Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.099 — 2026-10-11
NEWS 约 1 分钟

40GB显存也能在GGUF上训练125B MoE

40GB 显存可直接微调 125B MoE,GGUF 开始走出推理场景。

超大模型微调常像在小桌上摊开一张巨幅地图:显存放不下,只能把一部分数据搬到 CPU 内存,来回传输又会拖慢速度。作者 woct0rdho 给出的新配方,让 40 GiB 显存也能训练 Qwen3.8-Flash-Next——一个标为 125B-A6B、另含 51B engram 的 MoE(专家混合模型,每次只启用部分专家模块),而且无需 CPU 卸载。

关键在于直接对 GGUF 中的量化权重做 LoRA。GGUF 原本更常见于本地推理,用来保存压缩后的模型权重;LoRA 则只训练附加的少量参数,不必改动整套模型。作者还把 engram 放在磁盘上,并称这没有降低训练速度。在 Strix Halo 上,长度为 2048 的上下文块每步耗时 9.5 秒,约合每秒 200 token。

这仍是作者在 Reddit 公布的阶段性结果:他明确表示还有优化空间。不过,Transformers 5.18 已合入现代 GGUF 的初步支持。值得关注的不是一次速度纪录,而是 GGUF 正从“省空间跑模型”的推理格式,向单机低成本训练工作流延伸。


供稿材料 SOURCES — 1

← 返回 2026-10-11 · 开源板块