本地跑模型时,最尴尬的不是它答错,而是它答得很像真的;若再请一个模型当裁判,又会挤占显存(GPU 上存放模型和运行状态的高速内存)。这项测试把神经网络裁判拿掉:让模型多答几次,在 CPU 上做固定的字符串清理,再用 Shannon entropy 衡量答案是否分叉。它借用了 Semantic Entropy 的思路——多次回答意思越不一致,模型越可能在猜——但省去了 NLI cross-encoder,也就是把两段文字一起送进另一个模型判断是否同义的步骤。
作者自述,这个零依赖 Python 指标每次仅需 1.3 微秒,且不占 GPU。实测中,Qwen 1.5B 的 AUROC(用于衡量检测区分能力的指标)约为 0.58,原因是小模型格式太不稳定;到 Mistral 7B,字符串方法达到 0.706,与 DeBERTa 检测器的 0.705 相当;Qwen 27B 升至约 0.89。但 120B 模型反而跌到 0.09,作者称之为“自信模式坍缩”:模型即使在幻觉,也可能稳定地重复同一种答案。换句话说,这种轻量检测对中大型模型很有吸引力,却不能把“回答一致”直接当成“回答正确”。