跑 MoE 大模型,像是每道题只请几位合适的专家作答;但“共享专家”每道题都要参与,反而会带来固定开销。llama.cpp 的这项 PR 针对 CUDA——NVIDIA 的 GPU 编程平台——调整底层计算路径,把共享专家原本分开的步骤合并执行,目标是减少数据搬运和任务启动成本。
具体来说,它把共享专家的两次矩阵乘法及 GLU 计算融合进同一个 GPU 内核。算子融合就像把多趟加工并成一条流水线,中间结果不必反复搬进搬出。不过,最后与其他专家结果相加的步骤并未纳入这次融合。PR 给出的测试对象是 RTX Pro 6000 上的 Qwen3.5-35B-A3B-Q8_0;材料没有披露速度、显存占用或其他量化结果,因此目前更值得关注的是优化路径本身,而非尚未公布的性能增幅。