Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.074 — 2026-09-16
PAPER 约 4 分钟

药企私藏结构,喂出更强蛋白模型

五家药企合并两万余个私有结构训练模型,成绩更好,也把科学 AI 的数据壁垒摆上台面。

如果让 AI 学会判断钥匙能不能开锁,只给它看锁,却很少给它看“钥匙插进锁孔”的照片,效果自然有限。药物研发中的蛋白模型正遇到类似问题:公开数据库里有不少蛋白质结构,但蛋白质与候选药物结合的实验结构仍然稀缺。与此同时,药企内部保存着大量没有公开的实验数据。

据 Nature 报道,一个由多家药企组成的联盟把其中 20,167 个私有结构用于训练模型。测试结果显示,这个模型优于只用公共数据训练的版本,也优于各家公司只拿自家数据训练的模型。不过,这项研究目前仅见于博客,尚未经过同行评审,模型也没有公开。

把五家的“锁孔照片”放到一起

蛋白质可以理解为一串氨基酸折成的三维机器。它的形状会影响功能,也会影响药物能否与它结合。这里的“配体”就是能嵌入蛋白并与之结合的小分子,许多药物都属于配体。蛋白质—配体复合物结构,则像一张钥匙已经插进锁孔的照片,能直接展示两者如何贴合。

训练这类模型通常依赖公开的实验结构。研究人员通过 X 射线晶体学、冷冻电镜等方法测出结构,再将其存入公共数据库。但药企在研发中产生的许多结构涉及商业机密,并不会公开。Nature 报道援引一名研究人员的估算称,公共数据库 PDB 中与类药物分子相互作用的实验结构可能只有约 10,000 个;这个数字的统计口径并不明确,只能视为粗略估计。

为验证私有数据是否有用,AbbVie、Astex 等公司组建了 AI Structural Biology(AISB)Network。它们以 OpenFold3 为基础进行“微调”——也就是让已经学过公共数据的模型,再用一批更贴近药物研发的数据继续学习。OpenFold3 是 AlphaFold 3 的开源复现项目。五家公司共提供 20,167 个蛋白质与潜在药物或配体结合的结构,同时采用了让各家专有数据保持私密的训练方式。

多拿数据,究竟多了多少能力?

联盟另外留出 1,056 个蛋白质—配体结构用于测试,没有让模型在训练时见到它们。据 Nature 转述的 AISB 结果,新模型能对其中超过一半给出高准确度预测。公共版 OpenFold3 达到同等准确度的比例约为三分之一,另一款开源模型 Boltz-2 约为 40%。

这个比较至少传递出两个信号。第一,针对药物结合场景,额外的实验结构可能确实有价值。已有研究显示,当测试分子与训练数据中的分子差异很大时,AlphaFold 3 等“共折叠模型”——同时预测蛋白质及其相互作用对象结构的模型——准确率会明显下降。更多样的数据,可能帮助模型面对陌生分子。

第二,五家公司合并数据得到的模型,还超过了只用单家公司内部数据训练的工具。这说明数据共享的价值不只在于数量,也可能在于覆盖更多类型的蛋白质和配体。不过,报道没有给出各家公司分别贡献了多少数据,外界暂时无法判断这种优势具体来自哪里。

真正的护城河,可能不是模型代码

这项工作触及科学 AI 的一个现实:模型架构可以开源复现,高质量实验数据却未必能够复制。药企几十年研发留下的结构库,既昂贵又敏感。当公共模型普遍依赖同一批公开数据时,谁能合法、安全地调动更多私有实验数据,谁就可能获得持续优势。

但这也带来张力。数据越私有,外部研究者越难复现、审计和公平比较结果。AISB 的做法表明,多家公司可以在不直接公开专有结构的前提下联合训练;它却没有解决公共研究界缺少同类数据的问题。Nature 报道还提到,英国政府支持的 OpenBind 项目获得最高 800 万英镑(约 1080 万美元)资助,目标是产生可公开使用的新结构数据。这代表另一条路线:不是设法进入药企的数据保险库,而是重新建设一套开放数据资源。

局限与未知

  • 研究尚未同行评审,模型未发布,现阶段的性能数字都来自联盟披露并由 Nature 转述,外部团队无法独立复核。
  • 材料没有说明 20,167 个结构是否去重、五家公司的贡献比例,也没有提供足够信息排除数据泄漏等评测风险。
  • “超过一半达到高准确度”展示了差距,却没有交代这里采用的具体指标、阈值和统计显著性。因此,它支持“私有数据可能改善模型”的判断,还不足以把“更强”视为已经完全证实的结论。

供稿材料 SOURCES — 1

← 返回 2026-09-16 · 学术板块