Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER H 39 · 2 信源 约 1 分钟

推理扩展不必反复抽样

两项研究把测试时算力从“多答几遍”转向沿好答案改进、主动探索不同思路。

让 AI 解难题,常见办法像让它反复交卷,再从中挑最好的一份。问题是,多次答案可能只是换了措辞,并没有换解法。两项新工作都在挑战这种“重复采样”:测试时扩展——模型训练完成后,为单道题增加生成、检验或搜索计算——不必等于盲目多试。

Beck 等人提出 Hill Sampling(山丘采样):保留当前得分最高的程序,让冻结参数的模型围绕它继续修改;只有新方案更好,才替换起点。作者报告,该方法在圆堆积任务上不到五小时、使用八张 NVIDIA H100,取得已发表方法中的新最佳结果;在 Erdős 最小重叠问题上运行 12 小时后超过 AlphaEvolve 参考方案。更反直觉的是,他们直接调整模型权重的进化策略,最高成绩还不如把学习率设为零;普通的文字生成随机性也比随机扰动权重更有效。

Labiad 等人走了另一条路:先生成概念、提示或解题策略,再据此作答;并用强化学习训练一个小型“概念生成器”,充当可复用的搜索策略。作者称,在相同答案生成配额下,它提高了困难数学题的 pass@k——尝试 k 次至少答对一次的概率——还能迁移到未参与训练、甚至不同模型家族的答题模型。第二项工作的摘要未披露具体提升幅度,因此目前更适合把它看作一个方向性结果。


供稿材料 SOURCES — 2

← 返回 2026-09-26 · 学术板块