平台 · 第 2026-09-08

90 亿个变异预先算好:把模型变成一份资源

Google DeepMind 发布 AlphaGenome Atlas:人类基因组中全部 90 亿个单核苷酸变异的分子效应预测,免费向学术研究开放。模型不是新的,新的是它被整个跑完一遍并发布出来——实验室里逐个测试 90 亿种突变不可行,而把预测大规模预先算好,就把一个需要调用的模型变成了一份可以直接查询的资源。数据集 1 PB,是 AlphaFold 数据库的 30 多倍;每个变异带数千项预测,跨数百种细胞类型。同时发布的 AVI 分数把两个模型压成一个数字,但每个分数都链接回驱动它的生物学特征——合成分数可以被拆回去。

Google DeepMind Blog2026-09-08立即关注

多个信号同时成立,建议优先评估这条技术变化。

前沿模型推理与部署产品策略

记录

信号正文

它把一个模型变成了一份资源

AlphaGenome Atlas 收录了人类基因组中全部 90 亿个单核苷酸变异——每一个可能的单字母改变——的分子效应预测,通过一个免费的网页门户向学术研究开放,同时提供 AlphaGenome API 和 Google Antigravity 里的一个 skill。

模型本身不是新的。新的是它被整个跑完了一遍并发布出来。 DeepMind 的说法很直接:实验室里逐个测试 90 亿种可能的突变实际上不可行,所以把 AlphaGenome 的预测大规模预先算好,就把一个需要调用的模型变成了一份可以直接查询的资源。

这是一个部署形态的决定,而不是建模上的进展——也正是它对基因组学之外的读者仍然值得读的原因。

规模,以及它的参照物

  • 数据集 1 PB,是 AlphaFold 数据库的 30 多倍
  • 每个变异带数千项分子效应预测,覆盖基因调控的多个方面,跨数百种人类与小鼠细胞类型和组织。
  • 另附一套 2,500 多条反复出现的 DNA 序列基序——基因组的「词」——及其位置。

作者自己给了参照系:2022 年扩充 AlphaFold 数据库时,可用的三维结构信息从约 19 万个实验结构变成 2 亿多个结构预测,覆盖了科学界已编目的几乎全部蛋白质,并且提供了一个无需编程经验就能用的门户。他们说建 Atlas 时的目标是同一件事:让预测更可及。

AVI:一个数,但它带着自己的分解

同时发布的还有 AlphaGenome Variant Impact(AVI)分数:把 AlphaGenome 与 AlphaMissense(预测蛋白质改变类变异影响的模型)两者的预测压缩成一个数字,让研究者能快速给变异排序。

值得单独记的是它没有只发这个数:每个 AVI 分数都链接到驱动它的具体生物学特征——AlphaGenome 预测的基因调控方面,或者 AlphaMissense 给出的蛋白质影响分数。也就是说,这个合成分数是可以被拆回去的。

它同时覆盖编码区(基因组的 2%)和非编码区(其余 98%)——而大多数与性状相关的变异位于后者,这也是话题级摘要最容易漏掉的一半。

一条限制,如实写明

Atlas 里的每一条都是预测,不是实验测量。它的价值在于把 90 亿个候选压到一个可排序的列表,让实验去验证排在前面的那些;把它当成结论而不是排序依据,是这类资源最容易被误用的方式。

本条依据 DeepMind 官方博客,门户、API 与论文均未逐项复核。

为什么是现在

为什么重要

可迁移的不是基因组学,是那个部署决定:当输入空间是有限且可枚举的,把模型整个跑完一遍、把结果发布成可查询的资源,比让每个人各自调用要便宜也可及得多。AlphaFold 数据库已经证明过一次,这是同一招在一个大 30 倍的数据集上的重演。第二点同样值得抄:AVI 把两个模型压成一个数字,却把驱动它的特征一起发出来——一个合成分数只有在能被拆回去时才是可用的。

背景

技术背景

Atlas 提供四层相互链接的资源:每个变异数千项分子效应预测(跨数百种人类与小鼠细胞类型和组织)、单一的 AVI 分数、AVI 的特征归因(拆回到 AlphaGenome 的基因调控预测或 AlphaMissense 的蛋白质影响分数)、以及 2,500 多条反复出现的 DNA 序列基序及其位置。AVI 同时覆盖编码区(2%)与非编码区(98%),后者承载了大多数与性状相关的变异。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

在权衡「按需调用模型」还是「预先算好发布结果」的架构师需要把一个合成评分做成可解释形态的产品与数据负责人关注 AI 在科学领域从模型走向基础设施的技术决策者
可能影响的领域
预计算与资源化科学基础设施可解释评分

下一步

学习路径

  1. 先问你的输入空间是不是有限且可枚举的——这是预计算这一招成立的唯一前提
  2. 读《系统设计的权衡》:按需调用与预先算好是一对典型取舍,代价分别是延迟与存储
  3. 看 AVI 的做法:合成一个数字的同时把特征归因一起发,否则那个数字不可用
  4. 记住那条限制:Atlas 里全是预测,它的作用是给实验排序,不是替代实验
  5. 对照 AlphaFold 数据库 2022 年那次扩充(19 万实验结构 → 2 亿多预测),这是同一招的第二次

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 你的场景里输入空间可枚举吗?不可枚举时这一招完全不成立。
  • 1 PB 的分发与更新成本由谁承担,模型迭代后这份资源怎么重算?
  • AVI 这类合成分数在你的产品里,能不能同样把归因一起给出?

来源参考

Google DeepMind Blog

Google DeepMind大型科技公司2026-09-08
打开原始来源https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/