Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.067 — 2026-09-09
NEWS 约 5 分钟

九十亿种突变,AI一次画完

DeepMind预算约90亿种DNA单字母变化,把基因组模型变成可检索的科研基础设施。

IMAGE — Google DeepMind Blog

你拿到一份基因检测结果,其中有成千上万个不同于参考序列的字母。真正棘手的问题不是“哪里不同”,而是“哪个不同值得追查”。逐一做实验几乎不可行。Google DeepMind 新发布的 AlphaGenome Atlas,试图先用 AI 为人类基因组约 90 亿种可能的单字母变化计算影响,再把结果做成可搜索的目录。

这里的“图谱”不是一张图片,而是一座预测数据库。单核苷酸变异(SNV)指 DNA 中一个字母被另一个字母替换。官方称 Atlas 覆盖“每一种可能的单字母变化”,但目前全部信息主要来自 DeepMind 官方博客,覆盖范围、评测细节和外部验证材料仍不完整。因此,更准确的说法是:它批量预计算了约 90 亿种变异的分子效应预测,而不是用实验验证了 90 亿种突变,也不是一次模型调用就“画完”了基因组。

先把候选项全部算一遍

AlphaGenome 原本可以分析特定变异,预测它可能怎样影响生物过程。Atlas 做的关键一步,是把这种按需预测提前大规模运行。研究者查询某个位置时,不必从头调用模型,而是直接查看已经算好的结果。

这让基础模型的角色发生了变化。基础模型先从海量数据中学习通用规律,再服务不同任务;过去它更像一件科研工具,收到问题才给答案。Atlas 则把它的输出预先铺成一层公共数据基础设施,类似提前编好的字典:研究者可以检索、比较和筛选,再决定把有限的实验资源投向哪里。

据 DeepMind,Atlas 数据量约为 1 PB,是 AlphaFold Database 的 30 多倍。这个比较只能按官方口径理解,因为数据库版本、压缩方式和统计范围没有进一步披露。Atlas 为每个变异提供数千项分子效应预测,覆盖基因调控的多个方面,以及数百种人类和小鼠细胞类型与组织。

它还收录超过 2500 种反复出现的 DNA 序列模体——可以理解为基因组里经常出现的“词”——并标出它们的位置。研究者由此可以把一个变异与它可能扰动的功能序列联系起来。

一个分数,先找“可疑项”

面对如此庞大的结果,光有数据库还不够。DeepMind 同时发布了 AlphaGenome Variant Impact(AVI)score,即“变异影响分数”。它把 AlphaGenome 与 AlphaMissense 的预测压缩为一个数字。AlphaMissense 专门预测会改变蛋白质的 DNA 变异可能造成什么影响。

AVI 的用途不是直接判定疾病,而是排序。它像筛查清单上的优先级标记:分数帮助研究者先找到可能影响较大的变异;与分数相连的 feature attributions,则说明模型认为哪些生物特征推动了判断,例如 RNA 剪接、基因表达,或 AlphaMissense 给出的蛋白质影响。

这套设计同时面向编码区和非编码区。编码区约占基因组的 2%,负责提供蛋白质编码;其余约 98% 是非编码区,其中包含调控基因活动的序列。后者不直接制造蛋白质,影响通常更难解释。一位参与研究的分子生物学家将 Atlas 形容为一本可搜索的“非编码 DNA 词典”。

DeepMind 称,AVI 在多项变异致病性和罕见病基准上达到“best-in-class”表现。但博客没有给出具体基准、对手模型和分数差距,这一结论目前只能视为官方自评。

为什么它值得关注

DeepMind 此前已把模型输出做成过大型科研目录。据 Google DeepMind 与 Nature 提供的材料,团队在 2022 年公开约 2 亿个 AlphaFold 蛋白质结构预测,2023 年又用 AlphaMissense 预判约 7100 万种会改变蛋白质的变异。Atlas 把同一路线推进到约 90 亿种单字母变化:模型不只回答单个问题,还持续生产可被整个研究群体调用的数据层。

这种价值首先体现在“缩小搜索范围”。DeepMind 称,外部合作研究者已用 Atlas 找到并实验验证未解决罕见病研究中的关键变异,也发现了与常见性状相关的罕见变异。但官方没有披露具体变异、样本量或完整实验结果,不能把它概括为广泛的临床验证。

另一项官方披露的分析更能说明其当前定位:研究者从预测影响最大的 1% 非编码变异出发,在超过 5.4 万名英国生物样本库参与者的数据中,找出 19 个与体重指数相关的遗传区域,留待后续追查。说白了,Atlas 更像线索排序器,不是医学判决书。

目前,Atlas 通过免费网站、AlphaGenome API 和 Google Antigravity skill 提供;官方网站明确面向学术研究开放。它的意义不在于 AI 已经“读懂”整个人类基因组,而在于把原本零散、按需生成的模型判断,组织成可以反复查询和组合的大规模科研资源。

局限与未知

  • “覆盖每一种可能的单字母变化”和“约 90 亿种”均为官方表述;材料没有说明参考基因组版本,以及性染色体、未定位序列等具体覆盖边界。
  • 这些结果是 AI 预测,不等于实验确认,更不能直接充当临床诊断。外部合作案例也缺少足够细节供独立判断。
  • 免费范围限于学术研究;门户、API 与 Antigravity skill 的配额、具体权限及商业使用条件尚未披露。

供稿材料 SOURCES — 1

← 返回 2026-09-09 · 科技板块