Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.098 — 2026-10-10
NEWS 约 1 分钟

终端Agent开始考连续稳定性

ThinkingBox让Agent重复跑20次并核对后台终态,暴露“偶尔成功”与“稳定可用”的落差。

IMAGE — r/MachineLearning 日榜

一个Agent偶尔订对机票,不等于它能放心接入业务。订单、账户、工单这类有状态工作流会不断修改后台记录,后一步还依赖前一步;即使Agent声称“完成了”,数据库也可能已经写错。ThinkingBox因此不只看任务能否做成一次,而是让同一任务从相同的干净后台出发,独立运行20次,并直接校验最终数据库状态和操作影响。

作者介绍,ThinkingBox-Bench包含零售、旅行、车险、数字银行内部IT、咨询公司IT与人事等5个领域的507项工作流,每个模型共接受10,140次测试。最值得注意的是两种排名几乎相反:Kimi-K3至少成功一次的任务覆盖率为93.89%(476/507),但20次全部成功的只有13.41%(68/507);Claude Opus 5至少成功一次的覆盖率较低,为79.09%,却有47.53%(241项)能连续20次过关。换句话说,会不会做与能不能稳定地做,是两回事。这组结果来自作者在 Reddit 的披露;原始评测轨迹未公开。


供稿材料 SOURCES — 1

← 返回 2026-10-10 · 科技板块