9月8日,谷歌DeepMind正式发布AlphaGenome Atlas,一个覆盖人类基因组全部约90亿种单核苷酸变异的预测图谱。所谓单核苷酸变异,就是DNA序列中单个字母的改变,人类基因组约30亿个碱基对,每个位置都有另外3种可能的替换方式,加起来正是约90亿种。DeepMind利用其基因组AI模型AlphaGenome,把每一种变异的潜在分子效应全部预计算完毕,形成一个容量达1PB的数据集,规模是AlphaFold数据库的30倍以上,约相当于2亿张照片的数据量。这张图谱即日起通过免费网页门户向学术研究开放,任何研究者无需编写代码即可查询。
人类基因组计划完成二十多年后,科学家面临的问题早已不是读出DNA字母,而是理解每个字母的功能以及突变会带来什么后果。真正编码蛋白质的区域只占人类基因组的约2%,其余98%是非编码区,它们调控基因在什么细胞、什么时间、以多大程度表达,大量与疾病和性状相关的变异恰恰藏身于此,也是最难解释的部分。传统方法要么依赖实验数据圈定调控区域却难以定位具体碱基,要么依赖跨物种保守性而对人类特有位点不敏感,逐个实验验证数十亿种变异则成本完全不现实。
AlphaGenome瞄准的正是这一空白。这一模型最早于2025年公布,今年1月正式发表于《自然》,一次最多可读取约100万个碱基,预测染色质开放、转录因子结合、组蛋白修饰、RNA剪接、基因表达与染色质三维接触等多类分子指标。而AlphaGenome Atlas要做的是把这种能力扩展到整个基因组,团队对参考基因组中超过90亿种可能的单碱基变化全部完成预计算,并把结果整理成可查询的资源。对研究者而言,最直接的变化是过去需要自己运行模型获得的预测,如今打开网页或调用API就能直接获取。
海量预测只是第一步,如何让研究者快速找到值得深挖的变异才是关键。DeepMind为此推出AlphaGenome变异影响评分,即AVI分数。它将AlphaGenome对基因调控影响的预测,与DeepMind此前开发的蛋白质变异预测模型AlphaMissense的预测结合起来,把多层面的生物信息压缩成一个数字,帮助研究者在成千上万的候选变异中排序。与只看蛋白编码区的传统打分不同,AVI同时适用于编码区与非编码区,解决了约98%基因组区域的变异评估难题。
更精细的是,每个AVI分数都附带了特征归因,研究者可以看到这个分数主要来自哪些分子过程的预测,是RNA剪接被扰乱,还是基因表达或染色质开放受影响。图谱还整理了超过2500种反复出现的DNA短序列基序,这些序列往往是转录因子识别与结合的位置。换句话说,研究者不仅能判断一个变异影响有多大,还能知道它可能通过什么机制起作用,为后续实验设计提供了明确的优先级与方向线索。
图谱的价值在发布前就经过了实战检验。罕见病领域,美国博德研究所与GREGoR联盟合作,利用AVI对既往无法解释的罕见病变异重新排序,其中一名癫痫性脑病患儿此前多项遗传检测均未找到病因,研究者最终锁定一个影响DNM1基因的变异,该基因已知与癫痫性脑病密切相关,图谱预测显示该变异可能产生异常RNA剪接位点,后续实验验证支持了这一判断。
人群遗传学领域同样传来捷报。英国埃克塞特大学研究者利用超过5.4万名英国生物银行参与者的全基因组数据,寻找影响血浆蛋白水平的罕见非编码变异,他们先用图谱的分子效应预测对变异进行筛选分组再做关联分析,检测到的非编码遗传关联增加了22%,在具体分析中把526个候选变异缩小到4个。研究者还计划把类似方法拓展到身高、体重指数等更多性状的研究中。这些案例共同指向图谱的定位,它不直接给出最终结论,而是帮科学家从海量候选中优先筛出更值得研究的对象。
完成如此规模的预计算并非易事。DeepMind基因组学负责人透露,团队最初估算需要把计算效率提升约80倍,最终通过模型蒸馏、GPU计算优化与减少重复计算等手段实现目标。这套打法与其在AlphaFold上的经验一脉相承,2022年AlphaFold数据库扩展至超过2亿个蛋白质结构预测,让研究者无需自行运行模型即可查询结构,如今AlphaGenome Atlas把同样的模式复制到基因组调控领域,用大规模预计算降低整个领域的算力门槛。
当然,图谱的边界同样清晰。多位未参与项目的专家指出,基因调控涉及细胞类型、发育状态与远距离调控元件等复杂因素,AlphaGenome一次分析约100万个碱基,仍可能遗漏更远距离的调控关系;AVI分数适合筛选排序,但高分意味着变异可能具有较大分子影响,并不等于已经证明其致病。DeepMind也明确表示,图谱面向科学研究而非临床诊断,相关结果仍需结合遗传学证据、患者表型与实验验证进一步确认。从AlphaFold到AlphaGenome Atlas,AI正在把生命科学的基础研究资源化,而这张覆盖90亿种变异的生命地图,才刚刚翻开第一页。