给大模型“省内存”,像把精确小数改成有限档位:数字占用更少,代价是回答可能变差。通常的补救思路是找出最怕误差的几层,单独给它们更高精度。但这篇论文发现,量化损伤往往不像一两个坏零件,更像遍布整台机器的细小偏差。
作者研究了4个架构家族的9个开放权重模型,并用22项任务测试训练后量化(PTQ——模型训练完再降低数字精度)的影响。他们逐层做“因果干预”:其余部分保持4-bit,只把某一层升到8-bit,看准确率能恢复多少。结果显示,常见线索——任务相关计算发生在哪里、某层权重的统计特征如何——都不能可靠指出该修哪一层。8个模型需要恢复大约一半层,才能补回大部分差距;Qwen3-8B是损伤较集中的例外。
更实用的结论是:在相同精度预算下,把额外精度通过更细的量化粒度分散到全模型,胜过优先修复最可恢复的几层;这一结果覆盖全部8个满足实验配置的模型,连Qwen3-8B也不例外。换句话说,下一位精度的默认去处,或许不是某个“关键层”,而是全局。结论仍限于论文测试的模型、任务与预算设置。