Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER H 16 · HF 14 约 7 分钟

闭源模型的隐藏思维能被读出吗

研究借工具调用诱导闭源模型写出推理草稿,但这究竟是思路实录,还是事后补写?

你问一道难题,AI 很快给出正确答案,却把草稿纸盖住了。你能判断答案对不对,却不知道它是认真推出来的,还是碰巧猜中。现在,一项研究尝试换个出口:既然闭源模型不展示自己的“思维链”,能不能让它把中间步骤写进一次工具调用里?

这里的思维链(Chain-of-Thought,CoT),指模型在给出答案前生成的中间推理步骤。闭源模型只通过产品或 API 提供能力,外界看不到其权重、训练过程和未公开的推理记录。论文提出的办法确实能诱导模型写出有用的推理文本,也让不同模型的解题风格变得可比较。但标题里的“提取隐藏思维”需要谨慎理解:研究没有证明它直接读出了模型真实的内部思考。

本文所有模型表现和机制判断均来自这篇论文的单方实验;研究尚无第三方复现,部分模型与 API 条件也缺少独立材料印证。

给模型递一张“草稿纸”

研究者注册了一个极简单的自定义工具。它不搜索、不计算,只有一个自由文本参数,专门接收中间推理。工具调用原本是让模型按规定格式请求搜索或计算器;调用的参数和次序会留下比最终答案更细的行动轨迹。

实验开始时,API 被要求强制选择这项工具。模型于是把一段推理写进参数。研究者记录文本,返回一个不含实质内容的确认,再把工具选择恢复为自动。之后,模型可以继续调用工具,也可以直接提交答案。

妙处在于,这个工具什么都不做,只提供一张能被外界看见、又能留在对话里的“草稿纸”。真正被强制的只是第一次拿起草稿纸,具体写什么仍由模型在解题时生成。实验通过 OpenRouter 进行,覆盖 80 道竞赛数学题、100 道 LiveCodeBench 代码题和 100 道 Humanity’s Last Exam 跨学科题。

研究比较三种状态:关闭推理且不给工具;开启高强度原生推理;以及使用这套 Forced-Reasoning 协议。GPT-6 Astra 不能关闭原生推理,因此研究使用其最低推理强度;论文称,Astra 的 Forced 实验中,服务商报告的原生推理 token 为零。

写出来的东西真能帮助解题吗

先看能够观察原生思维链的开源模型。DeepSeek-V4-Flash 在数学题上,不推理时准确率为 30.5%,使用工具草稿后升至 73.3%,原生推理为 70.0%。GLM-5.2 则从 21.4%升至 84.3%,接近原生推理的 89.9%。抽取文本与原生思维链还表现出较高的措辞重合和大体相似的步骤结构。

这比“它写得像推理”更有说服力:工具里的文字确实承担了某种解题功能。但闭源模型没有可供核对的原生文本,研究只能比较行为结果。

在闭源模型上,Forced 模式通常接近原生推理,并明显好于不推理。以代码任务为例,Claude Opus 4.8 的准确率依次为 58%、83%和 82%;GPT-5.6 Sol 为 47%、90%和 90%。竞赛数学上,Sol 从不推理的 25.0%升至 Forced 的 91.3%,原生推理为 97.5%。Astra 在数学、跨学科和代码任务上的 Forced 成绩分别为 93.8%、32.0%和 89.0%,对应原生推理为 97.5%、35.0%和 92.0%。

工具本身似乎也很关键。对 Sol 而言,关闭原生推理后直接要求它逐步作答,HMMT 准确率从 39.4%升至 60.6%;把更强的思考指令放进普通回答提示,仍是 60.6%。强制使用工具后则达到 84.8%,配合最大审慎程度的工具描述时为 93.9%。同一句“认真想”,放在工具通道里和放在普通回答里,效果并不一样。

强模型的草稿,反而更难抄

论文进一步比较这些外显轨迹的长度、内容密度和结构。它把推理步骤分为阅读、分析、计划、执行、探索、验证和监控七类。各模型包含的活动类型大体相似,主要差别不是“会不会某种步骤”,而是写出多少,以及如何组织。

论文报告称,Astra 的轨迹最短,同时最难被 zlib 无损压缩。zlib 是一种寻找文本重复模式的压缩方法;越难压缩,粗略说越少重复和可预测的文字。Astra 常把算术展开、简单代数变形和背景知识留在文字之外,只写关键转换。

研究还把轨迹整理成“推理树”:宽度表示一处最多分出多少条支路,深度表示走了多少层,节点数反映总步骤量。Astra 的中位宽度为 5、深度为 11、节点数为 27;GPT-5.6 Sol 分别为 12、11和60;Claude Opus 4.8 为 22、12和96;Claude Sonnet 5 为 28.5、13和136。也就是说,它们走得差不多深,但 Astra 展开的岔路更少。论文据此把它描述为更直接、更节省 token 的推理。

不过,短草稿不一定是好教材。研究把一个模型的轨迹删去最终答案,再交给另一个关闭原生推理、也不使用工具的模型续答。Sol 和 Opus 的轨迹几乎都能被各类接收者复用;Astra 的紧凑轨迹则更依赖读者能力。强模型基本能补全省略步骤,较弱的 Claude Haiku 4.5 和 GPT-5.4 Nano 损失更大。有时正确答案已经写在轨迹里,接收者仍会报出另一个答案。

这给模型监督带来一个值得追踪的提示:最强的“老师”未必会留下最适合弱“学生”的教材。论文没有直接测试训练或蒸馏,只测试了把轨迹放进上下文后的即时复用,因此还不能断言压缩会导致教学效果下降。

真正值得关注的是审计边界

这项工作的价值不只在于比较谁的草稿更简洁。它显示,关闭指定推理模式,或者看到服务商报告零推理 token,并不等于模型不会从其他 API 字段写出推理式内容。对模型监督和安全审计来说,输出通道之间的边界可能没有产品界面呈现得那么清楚。

但“能诱导出有效草稿”和“读到真实内心”仍是两回事。可读文本可能是事后合理化——模型先形成答案,再补写一套听起来合理的解释。开源模型上的准确率、措辞和结构相似性,让它成为有用的行为代理,却不能证明它与内部计算完全相同。

局限与未知

  • 闭源模型没有可见的原生思维链,论文无法判定工具文本是实际推理、替代性工作区,还是事后合理化。
  • 协议要求 API 支持自定义工具和强制选择指定工具,不具备这些控制的接口不适用。
  • 全部结果来自同一篇论文,尚无第三方复现;关于 GPT-6 Astra 的版本、API 条件及相关机制解释,也没有供稿范围内的独立材料核验。

供稿材料 SOURCES — 1

← 返回 2026-09-26 · 学术板块