Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.076 — 2026-09-18
NEWS 2 信源 约 5 分钟

开源模型只落后美国四个月?

“只落后四个月”很醒目,但它衡量的是开放权重与闭源模型,不是中美AI总实力。

IMAGE — r/LocalLLaMA 日榜

你让两个 AI 接手一项原本要专家工作一整天的任务。一个今天能做好,另一个要等到几个月后发布的新版本才达到相近水平。Mozilla 所说的“落后 4.4 个月”,大致就是这种时间换算。它不是说某款模型晚发布四个月,更不是说中国整体 AI 只落后美国四个月。

Mozilla 在 2026 年 9 月发布《State of Open Source AI》v1.1,主要数据截至 9 月 1 日。报告比较的核心对象是开放权重模型与闭源模型。开放权重,指模型参数可以下载或使用;训练数据、训练代码和许可证却未必开放,因此不等于完整意义上的开源软件。

4.4个月是怎么算出来的?

这个数字来自 Mozilla 对 METR task-horizon 数据的拟合。METR 用“任务长度”衡量能力:一项任务如果交给人类专家,需要多少小时完成,而模型能否至少有一半概率做成。

按 Mozilla 的估计,领先闭源模型已经能处理相当于人类专家工作 8 至 12 小时的任务,开放权重模型大约晚 4 个月达到同一水平。报告给出的精确差距约为 4.4 个月。Epoch AI 用自己的 Capabilities Index 得到的平均估计约为 4 个月,方向相近,但指标并不相同,不能当作对同一结果的重复测量。

换句话说,“4.4 个月”是一把经过换算的尺子:先观察模型成绩随时间怎样增长,再问开放模型今天的位置,相当于闭源领先者什么时候的位置。Mozilla 计算的能力翻倍时间是开放模型 3.9 个月、闭源模型 5.5 个月。这说明在该数据和拟合方法下,开放模型追赶得更快;它不保证这个速度会一直保持。

差距不只看分数,也要看价格

综合基准指数会把推理、编码和知识测试汇总成一个分数,方便横向比较,但也会遮住不同任务上的强弱。按报告采用的 Artificial Analysis Intelligence Index,最佳开放模型落后闭源领先模型 3 分,标价约为后者的 60%;另一项比较中,开放模型落后 Claude Fable 5 两分,价格约为其 30%。这些数字均来自 Mozilla 报告采用的榜单与标价,不能直接推广到所有工作负载的实际总成本。

推理价格通常按输入和输出 Token 收费。Token 可以理解为模型处理文字时使用的小片段。把能力和价格放在一起,问的不是“谁绝对最强”,而是“达到某种效果需要付多少钱”。这也是开放权重模型即使没有登顶,仍可能被大量采用的原因之一。

报告称,在 OpenRouter 2026 年 8 月按 Token 量排名前十的模型中,8 个是开放权重模型,其中7个由中国团队开发。不过,模型来自哪里、由谁托管、数据流向哪里,并非同一件事。据 Axios 报道,AI Agent 公司 Lindy 据称把系统切换到 DeepSeek V4,但仍让美国供应商在美国境内托管模型,以兼顾成本、可替换性和数据顾虑。

为什么“中美只差四个月”说过头了?

因为这句话偷偷替换了比较对象。Mozilla 测的是开放权重与闭源模型之间的能力时间差;媒体标题才把它改写成中国与美国的竞争。中国团队确实在热门开放模型中占据显著位置,但开放与闭源不是国籍分类,美国也有开放模型,中国也不能由几款开放模型代表。更不能从一条基准曲线推导出芯片、训练数据、部署能力和商业生态的整体差距。

真正值得关注的结论更克制:在若干能力指标上,领先开放权重模型已经靠近闭源前沿,而且价格可能更低。Mozilla CTO Raffi Krikorian 的个人选择也提供了一个直观注脚。据 Associated Press 报道,他在 Kimi K3 发布数日后便把它换成日常主力,用于处理日历、文档和邮件,只把复杂任务留给价格更高的 Claude Fable。追赶已经不只发生在排行榜,也进入了实际办公流程。

局限与未知

  • 4.4 个月依赖所选模型、METR 指标、观察时段和曲线拟合。报告也指出,每轮新品发布都可能重新拉开差距。
  • 价格比较采用托管 API 的标价,没有覆盖本地部署所需硬件、运维和支持成本;体量很大的开放模型也未必容易自行运行。
  • 报告统计了 16 个重要开放模型版本,但没有一个提供 Open Source Initiative 定义所要求的完整数据配方。这里更准确的说法仍是“开放权重”,而不是笼统的“开源”。

供稿材料 SOURCES — 2

← 返回 2026-09-18 · 开源板块