牛津大学的研究团队在2014年发表的一篇论文从进化论的角度比较了多种哺乳动物,推断出了实际发挥作用的(生命活动所必需的)核酸序列。这一研究显示,人类基因组中确定蛋白质构造的核酸序列只不过占总量的1%多一点,而控制蛋白质表达的核酸序列只有7%左右。简单来说,人类基因组中重要的部分只占8%多一些。
与其说哪种研究结论才是正确的,不如说当前的任何一种研究结果都不过是一种暂时的推测。实际上,我们更应该一个一个地去对基因加以确认。
话虽如此,截至2015年8月,数据库中收录的基因已经达到了5万余个(每年仍在增加),这一数字已经远远超过了2003年的推算数值。如同前文所述,如果不只是把蛋白质的核酸序列看作基因,而把控制蛋白质表达的RNA的核酸序列也纳入研究范畴的话,我们就会一点一点地发现原本以为无用的基因区域,实际上都具有某种功能。但大多数是无用的(或者说大部分是间隙)这一点,恐怕并不会有所改变。
不过,虽说无用,却并不意味着这些基因是没有意义的。从长远的角度来看,有时一些突变也许会带来对进化有利的结果。
在ENCODE中大显身手的理化学研究所研究团队同时也主导了2000年发起的另一个国际项目——国际FANTOM联盟,共有来自18个国家的超过100家机构参加。
FANTOM是FunctionalAnnotationoftheMammalianGenome的缩写,是一个全面提取哺乳动物(尤其是小鼠)基因功能的项目。需要特别指出的一点是,国际FANTOM联盟的数据库中也包括了基因表达各个阶段内的细胞的表达,发明iPS细胞的灵感就是由此产生的。
世界各国的基因组分析
人类基因组计划对于解读人类的核酸序列是有着重要意义的。而下一阶段,我们则需要关注每个人之间的不同。做到这一点的项目,就是1000GenomesProject(千人基因工程,2012年完成),这一项目分析了超过1000人的基因组并将其数据库化。
非洲的样本有来自尼日利亚的伊巴丹市的约鲁巴人(非洲西部规模最大的民族之一)、来自肯尼亚的韦布耶市的卢希亚族(肯尼亚第二大民族,从非洲西部迁徙至东部)和马赛人(分布在肯尼亚南部到坦桑尼亚北部一带的本地居民)。
亚洲的样本有来自东京的日本人和来自北京的中国人。欧洲的样本有托斯卡纳大区的意大利人。美国的样本有南欧、北欧人后裔的犹他州美国人、休斯敦的古吉拉特系印度裔、丹佛的华人、洛杉矶的墨西哥裔美国人、西南地区的非裔美国人。这些人的基因组全都被数据库化了。(最终共有来自26个民族的2504人参加了项目。)
1000GenomesProject比较了众多人种,精细地区分了基因组中的共通之处和个性化的部分,并加以分析。项目期望自身的研究成果能够应用在各个领域的研究中,从形态表达到基因与疾病的关系、医药品研发等。
1000GenomesProject的研究成果发表在了2015年9月的《自然》杂志上,研究证实人类基因组31亿个碱基对中有高达2.93%的突变。人类的基因组突变比人们预想的更多,不同民族之间也存在着不同的和共通的突变,而在同一民族中,个体间的突变差异也很大。
不过,2000个左右的样本规模作为数据库来说还是太小了(虽然学术意义很大)。而更大规模基因组计划也将最主要的研究目的转向了个性化医疗和预防医疗。