显卡装不下更大的模型,就像桌面摆不下整套工具:可以把暂时不用的部分收进柜子,需要时再取。ExLlamaV3这轮更新加入MoE专家的CPU卸载——MoE(混合专家)由许多“专家”子网络组成,每次生成通常只调用少数;工具可把部分专家权重留在系统内存,减少显存占用,代价是来回传输可能拖慢推理。
据开发者社区帖子介绍,更新还适配了GLM-5.3-Flash,并为Qwen-3.8-Flash-Next加入ngram磁盘卸载;同时带来新的自校准优化技术。量化就是用更低位数保存模型权重,压缩越激进,越需要控制精度损失;自校准则试图减少用户另备校准数据和反复调参的负担。帖子展示了以3.05 bpw(平均每个权重约3.05比特)的Qwen模型生成SVG的例子,但没有披露显存节省、速度或精度对比,因此目前更适合把它看作一组值得本地推理玩家试用的工程能力,而非已经验证的性能跃升。