Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
PAPER H 1 约 1 分钟

长推理何时该提前停

SABER故意让模型“唱反调”,答案仍不动时就提前结束推理。

模型有时已经算出答案,却还在反复验算,像考生做完题后迟迟不肯交卷。SABER要解决的就是:长链推理——模型回答前写出的连续中间步骤——何时已经“够了”,可以提前退出,少做无效计算。

它的关键做法很直观:在推理途中分出两条短支路。一条让模型直接总结答案,另一条故意暗示“前面的推理错了,请改正”。随后比较两边给出的答案和置信度——模型偏向某个答案的程度。如果这种“唱反调”仍推不动结论,SABER就把它视为答案已经稳定,停止继续推演。与只看置信度不同,这相当于主动测试结论经不经得住干扰;探测只生成面向答案的短续写,不必把每条支路完整算到底。

作者称,SABER无需额外训练,在多个推理基准和模型架构上平均减少了30.2%至39.8%的推理 token,同时保持与完整长推理有竞争力的准确率。


供稿材料 SOURCES — 1

← 返回 2026-09-03 · 学术板块