两张旧款 RTX 3090 跑大模型,难点不只是“装得下”,还要避免生成时频繁从内存搬数据。作者在同一台双卡机器上运行 Qwen3.8-Flash-Next,通过三项组合优化,将解码速度从此前的 25—29 提至自述的 37—41 tok/s——也就是模型持续输出时,每秒生成约37至41个 token。
关键一步是换用更紧凑的 UD-Q4_K_XL 量化——用较低精度保存权重,腾出显存;每 GB 显存可容纳的专家缓存槽位约增至原来的1.44倍。专家缓存会把 MoE 模型常用的“专家”权重留在更快的存储层,减少经 PCIe 从系统内存反复搬运。缓存槽位由135增至188后,作者记录的命中率从84%—85%升至90%—92%,解码先达到32—35 tok/s;再叠加 MTP,让模型一次草拟并验证多个后续 token,速度继续上升。
这些数字来自作者在同一条4000-token Python 编程提示上的测试。量化后的质量仍待正式评估,而且 tok/s 不包含模型加载和首字等待时间,因此更适合看作一台特定旧平台上的优化上限,而非通用性能承诺。