AI资讯 / 产业

产业 / 媒体

Google DeepMind 发布 AlphaGenome Atlas,预计算90亿种DNA变异影响

IEEE Spectrum AI

Google DeepMind 于2026年9月8日正式发布 AlphaGenome Atlas,这是一个包含90亿条预计算预测结果的公开在线数据库。人类基因组约有30亿个碱基对,每个位置存在三种可能的单核苷酸替换,合计形成90亿种变异。Atlas 基于此前已发布的 AlphaGenome 模型构建,该模型能够比较原始与改变后的 DNA 序列,预测变异如何影响基因表达及其他调控活动。过去,研究人员需要自行选择待测变异、编写代码并运行这一计算密集型模型;如今 Atlas 已将所有工作预先完成,并提供更友好的查询界面。数据库还新增了单一数值「影响评分」,帮助科学家快速判断某一变异是否具有生物学意义。整个数据集规模约达1拍字节,为基础生物学、疾病研究和治疗开发提供了重要的加速工具。

DNA 通常被比作生命的指令手册,其中编码蛋白质的片段称为基因,但人类基因组中绝大多数 DNA 属于「非编码」序列。这些非编码区域中,部分功能尚不明确,另一些则对基因活性的调控至关重要。调控元件之间的相互作用错综复杂,其效果因细胞和组织类型而异,有些甚至能影响基因组中相距甚远的基因。英属哥伦比亚大学基因组学家 Carl de Boer 指出,理解 DNA 变化如何影响这种调控机制,是理解大多数疾病的根本所在。

为应对这一挑战,Google DeepMind 于2025年发布了 AI 模型 AlphaGenome,并于2026年1月在《自然》期刊发表详细论文,同时向公众开放非商业使用。该模型能够对比原始与变异 DNA 序列,预测单碱基改变对基因表达和调控活动的影响。然而,此前研究人员需要自行筛选变异位点、编写代码并独立运行这一计算量极大的模型,门槛较高,限制了其广泛应用。

此次发布的 AlphaGenome Atlas 彻底改变了这一局面。DeepMind 团队提前完成了针对人类参考基因组全部90亿种可能单碱基替换的预测计算,并将结果整合进可公开访问的在线数据库。科学家只需在界面中查询特定变异,即可获取包含11种输出类型的详细预测信息,以及一个直观的单一数值影响评分,无需具备编程能力或高性能计算资源。

实现这一规模的计算并非易事。整个数据集约达1拍字节,DeepMind 基因组学负责人 Žiga Avsec 坦言,项目启动之初团队认为这在计算上几乎不可能完成。早期估算显示,需要将计算速度提升80倍才能在合理时间内完成。为此,团队综合运用了模型蒸馏、GPU 内核优化以及消除冗余计算等多种技术手段,最终实现了这一工程壮举。

Atlas 并非没有局限性。许多疾病与多个遗传变异共同相关,而非单一位点改变;此外,AlphaGenome 虽然分析变异周围约100万个碱基对的区域,但某些称为增强子的 DNA 序列可在极远距离调控基因,有时超出模型的视野范围,其效果难以预测。de Boer 也提醒,单一影响评分是对复杂预测的高度简化,容易被误读。他认为 AlphaGenome 是目前该领域的领先模型,但同时指出其计算速度慢、资源消耗大的问题,Atlas 的发布恰好可以惠及那些缺乏高端硬件的研究者。

AlphaGenome Atlas 目前对非商业研究免费开放,商业授权则另行协商。这一资源延续了 DeepMind 在生命科学领域的开放数据库传统——此前 AlphaFold 预测了蛋白质三维结构,AlphaMissense 则对7100万种蛋白质编码变异的致病性进行了预测,相关结果均已公开。Google DeepMind 科学副总裁 Pushmeet Kohli 表示,理解 DNA 这门生命语言,将为人类打开无数扇门。

要点

  • AlphaGenome Atlas 收录了人类参考基因组全部90亿种单碱基替换的预计算预测,数据集规模约1拍字节,于2026年9月8日公开发布。
  • 科研人员无需编写代码或自行运行模型,即可通过在线界面查询变异对基因表达和调控活动的预测影响,大幅降低使用门槛。
  • 新增的单一数值影响评分方便快速筛选,但研究者需注意其为复杂预测的简化结果,存在被误读的风险。
  • 为在合理时间内完成90亿条预测,团队综合采用模型蒸馏、GPU 内核优化和消除冗余计算等技术,将计算效率提升约80倍。
  • Atlas 对非商业研究免费开放,可帮助科学家过滤候选变异、优先安排实验验证,有望加速基础生物学和疾病治疗研究。
查看原始来源

原始标题:Google DeepMind Maps 9 Billion Possible DNA Variants

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。