AI有时像已经算出答案、却还在草稿纸上反复验算的人:结论不再变化,时间和算力仍继续消耗。Settle要解决的就是这个问题。它从完整的推理轨迹——模型读题后写下的一连串中间步骤——中寻找答案开始稳定的时刻,再训练模型及时按下结束推理的“按钮”。
关键在于,Settle学的不是“第一次答对就停”,而是“答案已经定型再停”。训练时,研究者截取同一条轨迹的不同位置,让模型分别给出简短答案;若某处之后的答案始终与最终答案一致,就把那里标为可以停止。论文中的真实案例里,答案曾从107变成106,最后又回到107,说明偶然答对并不等于稳定。Settle只调整模型已有的结束推理 token——token 是模型处理文字的基本片段——同时尽量保持其他预测接近原模型,实际使用时不需要额外控制器。
据作者报告,在 MATH-500——包含500道竞赛风格数学题的评测集——上,Qwen3-4B 的生成 token 数减少40%,准确率下降0.5个百分点。更值得注意的是,在平均生成长度几乎相同的情况下,Settle 的准确率为93.61%,比直接模仿“截到首次稳定答案”的监督微调高6.16个百分点。这表明,学会判断何时收笔,可能比单纯模仿更短的解题过程更有效;不过这些效果目前仍是论文作者在所测模型与数学任务上的结果。