同一道题、同一个模型,也明确要求每次都选“最可能的下一个词”,答案还会变吗?这篇论文发现,只要把计算精度从 BF16 换成 FP16——两种用有限位数近似小数的格式——即使硬件、提示和解码方法不变,输出也可能分道扬镳。作者测试了六个 1.1B 至 7B 参数模型、四个模型家族和三个基准,49% 至 100% 的提示出现差异;另对 12B 模型做了补充分析。
原因不只是误差越积越多。贪心解码每一步都选得分最高的词;当排名前两位的分数很接近,细小的舍入差异就可能让它们互换。一旦某一步选了不同的词,后续生成看到的历史也随之改变,最终滚成完全不同的回答。论文还报告一个反直觉结果:扩大 FP32 高精度计算的范围,跨精度一致性反而更差。效果最好的低开销方案只在前两名差距较小时,用 FP32 重算最后的输出层;作者称它在 A10G 上将完全一致率提高 22 至 36 个百分点,低批量推理的延迟开销低于 4%。不过这只是局部缓解:批量达到 8 以上或全程采用 FP8 时,收益会消失。