把大模型压到很低的位数,像把三种材质的行李塞进同一个小箱子:权重、激活值和KV缓存各有不同形状,单独压得好,放在一起却可能互相放大误差。CanonQ瞄准W2A4KV2——权重用2比特、临时计算结果用4比特、生成时的“记忆区”KV缓存用2比特——试图减少逐项调参和反复试错。
它最值得注意的一步,是先把不同数据“整理成同一种坐标”。CanonQ用固定旋转打散数值能量,再做归一化,随后让权重、激活和缓存复用按高斯分布预先设计、训练时保持冻结的量化码本。码本可以理解为一张有限的数字对照表:原值只能就近换成表中的代表值。模型再通过量化感知训练,也就是在训练时直接经历压缩误差,同时适应三条路径的联合作用。
作者称,CanonQ在LLaMA3的1B、3B和8B模型上进行联合W2A4KV2压缩时,优势最明显,并扩展测试到Qwen3-1.7B、代码生成和数学推理。不过供稿文本缺失了具体提升数字,因此目前能确认的是方法设计与作者报告的趋势,尚不能据此判断收益幅度及部署成本。