把模型压成 INT8,像把精密刻度换成粗刻度:文件更省、计算更轻,但换一块芯片,原先的速度和结果未必还能照搬。这项研究固定同一份 ONNX 模型——一种跨工具交换模型的通用格式——及量化尺度,在七类嵌入式与车载硬件上测试,想弄清差异究竟来自哪里。
作者实测发现,INT8 是否加速,取决于处理器有没有适合整数点积的指令;缺少这类指令时,同一模型甚至可能变慢。更值得警惕的是输出差异:FP32 在所测平台之间逐项完全一致,1000 个输入全部吻合;INT8 只有在两个目标共用同一种整数计算内核时才达到 1000/1000,内核不同时仅有 958—965 个吻合。常见的 top-1 准确率却没有下降,因此普通评测可能看不出这些变化。
这对车载等要求确定性或双机冗余的系统尤其重要:量化一次,并不等于可以到处部署。论文还观察到,厂商 NPU 往往要求使用自家的量化流程;外部量化配置可能被拒绝,甚至在程序正常运行时被悄悄忽略。