本地跑大模型,过去想用 MTP 加速,往往还得另找分支、手工打补丁。现在,Qwen3.8-Flash-Next 的 MTP 支持已经合入 ik_llama.cpp 主线——也就是项目日常更新的主要代码分支。MTP 预测头会像助手一样提前草拟多个 token(模型逐步生成的文字单位),再交给主模型验证;通过的草稿越多,生成越快,输出则与普通解码一致。
据提交者 Alternative_Will5974 自述,在 RTX 5090、128GB DDR5 且专家模块放在 CPU 的环境中,编码任务的解码速度从 45 升至 90 tok/s,草稿接受率为 93%—99%。另一台 12GB RTX 4070 也从 9.5 提升到 12.5 tok/s。不过它并非所有场景都更快:散文任务的接受率只有约 60%—65%,RTX Pro 6000 的故事生成测试甚至从 83 降至 59 tok/s;当前还只支持单并发。真正值得关注的,是这条加速路径已不再依赖单独补丁,普通用户更容易直接试用。