Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.092 — 2026-10-04
NEWS 2 信源 约 1 分钟

SIFT让编码Agent评测更便宜

SIFT用大模型先筛选代码改动,把自我改进Agent的评测成本压到原来的约十分之一。

IMAGE — Sakana AI (via Google News)

让编码Agent不断改进自己,像让作者反复修稿:改一版不难,难的是每一版都要重新考试。MIT与Sakana AI提出SIFT(Self-Improvement via Fast Tree-search,自我改进快速树搜索),瞄准的正是这笔越滚越大的评测账单。

据Crypto Briefing报道,SIFT不再让所有候选改动都跑完整测试,而是先请LLM裁判——让大语言模型两两比较方案——筛出更有希望的版本,再用树搜索集中探索这些分支。以o3-mini编码Agent为例,SIFT在Polyglot基准测试中经过30次扩展达到35.1%,而此前的Darwin Gödel Machine经过80个节点达到30.7%。采用Qwen3-Coder-30B的配置完成整轮搜索用了224个CPU小时,API费用约34美元,资源消耗约为后者的十分之一。

这让自我改进实验有望从“反复全量考试”变成“先初筛、再重点复核”。但便宜筛选依赖LLM裁判,其偏差与稳定性也会传导到最终排名;现有数字来自论文相关报道,仍需更多独立验证。


供稿材料 SOURCES — 2

← 返回 2026-10-04 · 科技板块