一座仓库即使只在每次订单中打开几个货架,也得先容得下全部货物。混合专家模型(MoE)也是如此:它为每个词元只调用少数“专家”模块,却仍要存放和调度庞大的专家权重。论文以 Kimi-K2.5 为例:模型共含 1 万亿参数,每个词元激活 320 亿参数,但其 INT4 打包权重仍约占 595 GB。
moesq 的关键不只是把模型压小,而是让压缩后的形状正好能被芯片执行。它联合使用稀疏化——删去部分权重——和量化——用更少位数记录数值,并学习符合 NVIDIA Sparse Tensor Cores 要求的固定稀疏排列。作者还编写了专用的 grouped sparse GEMM 内核:一次处理多个专家规模不同的矩阵计算,适应 MoE 动态路由后各专家收到词元数不一的情况。
这一步值得关注,因为纸面压缩不等于真实加速。论文在 NVIDIA B200 上测试了从 300 亿到万亿参数规模的 MoE,并称方法兼顾模型表现、存储与推理效率;但所给材料中的部分关键增益数字缺失,因此暂不能判断其领先幅度。