Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.077 — 2026-09-19
NEWS 3 信源 约 6 分钟

Claude已参与Anthropic四分之一研发

Anthropic称Claude已主导26%的AI研发;3万Agent并行,让“AI造AI”第一次有了生产级样本。

IMAGE — InfoQ 中文

你让一位工程师同时带三万个数字助手:有人写代码,有人跑实验,有人检查结果,再由系统记录它们说了什么、改了什么。听起来像未来实验室,但 Anthropic 称,这已经是公司内部研发平台的日常规模。截至 2026 年 8 月,Claude 在约 26% 的 AI 研发任务中达到“主导”水平。

这里的“主导”不是全自动,更不是 Claude 替代了四分之一的研究员。它指的是:人类提出高层目标并负责监督,Claude 完成任务的大部分端到端执行。真正完全不需要人类介入,还要再高一级。

这组数据来自 Anthropic 自己的内部报告。多家媒体作了转述,但并非多次独立测量。它更适合被看作一个罕见的生产级样本,而不是整个行业的普遍水平。

26%到底是怎么算的?

Anthropic 采用了源自 Epoch AI 的 AL0—AL5 六级研发自动化标准。AL3 是“协作”:AI 能在人类密切指导下承担大块工作。AL4 是“主导”:人类定目标、做监督和最终决策,AI 负责大部分执行。AL5 才是完全无人干预。

据 Anthropic 披露,达到 AL4 的模型研发任务占比,在 2026 年 2 月还不足 1%,到 8 月升至 26%;超过 90% 的 AI 研发工作至少达到 AL3。这个变化说明的不是“无人实验室已经到来”,而是 Claude 正迅速从辅助工具变成实际执行者。

数字的测量过程也值得看。2026 年 7 月,Anthropic 每周随机抽取相关部门 20% 的员工,让 Claude Research Agent 阅读其 Slack 和内部文档,整理出约 1.5 万项细粒度任务。Claude 又把这些工作归入一棵包含 542 个节点、378 个叶节点的任务树,再按每类任务消耗的人力时间加权,计算自动化比例。

换句话说,Anthropic 没有简单统计“AI 写了多少代码”,而是先拆开研发流程,再判断每项工作由谁主导。这能覆盖训练、评测、故障诊断和事故复盘等不同环节,但判断本身仍有主观性。

三万个Agent怎样一起工作?

AI Agent——能读取环境、调用工具并连续执行任务的软件代理——适合处理边界明确的工作。多 Agent 并行,则像给一名工程师配一支数字团队:把大目标拆开,让多个 Agent 同时写代码、跑实验或检查结果,最后再汇总。

Anthropic 称,其内部研发平台约有 3 万个 Agent 并发执行研究和工程任务。不过,材料对“同时”“每天同时”还是“常态化并发”的时间口径并不完全清楚。

公司为这些 Agent 设置了独立身份。数据和行为记录都绑定身份,即使底层模型升级,记录仍可延续。Agent 通过共享消息系统沟通,每条消息标记发送者并链接原始资料;系统再把消息与完整运行轨迹关联,以便追踪跨 Agent 协作。

类似思路也进入了 Claude Code——Anthropic 面向软件开发的编码 Agent。新版 Projects 可以由协调器拆分任务,让多个云端实例在独立 Git 分支工作,并共享项目记忆。它把内部大规模调度经验变成了用户可接触的产品能力,但目前仍处于 beta 阶段,开放范围有限。

为什么这件事值得盯住?

关键不只是“AI 写代码更快”,而是 AI 已经进入研发下一代 AI 的闭环。这个方向常被称为 RSI,即递归式自我改进:AI 帮助改进自身或继任系统,改进后的系统再参与下一轮研发。这里还不是模型完全自主“造出自己”,而是它在闭环中承担的工作比例持续上升。

单篇材料还给出了一些速度信号:截至 2026 年 5 月,Anthropic 正式代码库中可归因于 Claude 的合入代码已超过 80%;2026 年第二季度,典型工程师每天合并的代码行数约为 2024 年的八倍。不过 Anthropic 也承认,代码行数不等于生产力,这个八倍几乎肯定高估了真实增幅。

在目标和成功标准固定的小模型训练优化实验中,Opus 4 平均把起始代码加速约三倍,Mythos Preview 则达到约 52 倍。这类结果更像是在说明:当问题明确、结果可以反复验证时,AI 很适合高速试错。至于研究什么、哪些结果可信、何时放弃一条路线,Anthropic 仍认为人类的品味和判断力更重要。

规模越大,监控也越难。据 Anthropic Institute,2026 年 8 月内部 Agent 触发超过十亿次模型决策,监控系统拦截了约 0.002% 的高风险或异常行为。极低的比例放到十亿级规模,仍意味着异常会持续出现。这也是三万个 Agent 不只是算力问题,而是管理和安全问题的原因。

局限与未知

  • 这是一套企业自报指标。任务材料的整理和自动化等级判断都大量使用 Claude,难免存在“自己给自己打分”的问题。
  • Claude 与员工评级完全一致的比例为 59%;相差不超过一级时为 97%。不同人类评估者的完全一致率也只有 35%,说明 AL3 与 AL4 的边界并不客观清晰。
  • 26%只代表 AL4任务的加权占比,不能推出人员替代率,也不能证明 Anthropic 已实现完整的递归式自我改进。眼下更准确的判断是:AI 研发自动化已经从演示走进生产,但实验室的方向选择和最终责任仍在人类手中。

供稿材料 SOURCES — 3

← 返回 2026-09-19 · 科技板块