Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.064 — 2026-09-06
PAPER H 7 约 1 分钟

Agent任务越长,能力会怎样腐烂

实测显示,Agent每步的小失误会连乘,长任务最终近乎必然崩塌。

让 AI 连续查资料、操作软件并做十几次相互依赖的决定,就像让人照着长清单办事:单步看着都没问题,一处小错却会一路传下去。Mittal 研究了这种“长流程退化”,即 LLM Agent——由大语言模型决策、还能调用工具的系统——随着任务步骤增加,会以多快的速度失去可靠性。这值得关注,因为常见基准多是短任务,单次成功率可能掩盖上线后的风险。

研究分析了 10,664 条运行轨迹,覆盖九个模型、四类任务、五种任务跨度和三种上下文设置。最具体的发现是:任务成功率近似遵循几何规律,可由“每一步成功的可靠性”解释。模型越大,这个数值通常越高,却仍明显低于 1;逐步连乘后,再强的模型也会在足够长的流程中垮掉。在需要实际调用工具并循环决策的任务上,作者称所有受测模型都从接近满分跌至接近零,过程不超过 16 步。

问题也不只是“记不住前文”。限制上下文窗口反而让下降更快,斜率从 -0.44 变为 -0.69,差异具有统计显著性(p=3×10⁻⁶)。换句话说,评估 Agent 不能只问它做成了多少道题,还要问:这些题究竟要连续做多少步。


供稿材料 SOURCES — 1

← 返回 2026-09-06 · 学术板块