Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.064 — 2026-09-06
PAPER HF 73 约 1 分钟

混合大模型的4比特生存指南

把循环记忆也压到4比特,误差没有越积越多,反而会被后续写入逐步擦除。

把模型压到4比特,像拿只有16档的粗刻度记录数字。省显存、少搬数据,但大家一直担心:循环记忆每读一个词就更新一次,误差会不会像复印件反复翻印,越传越糊?David Mayboroda 的研究测试了相反的做法:将一款270亿参数混合大模型的全部496个线性层都做成NVFP4 W4A4——权重和运算中的临时数值均使用4比特,包括此前常被保留在8或16比特的Gated DeltaNet(GDN)循环模块。

最有意思的发现不是“4比特也能跑”,而是误差为何没有累积。GDN用固定大小的状态概括前文,每次写入都会沿当前信息对应的方向覆盖旧状态。作者在32K词元实验中观察到,注入的量化噪声很快停在稳定平台;一次状态扰动会在数百步内淡去。负责遗忘和写入强度的“门”也最不敏感,因为后续函数会压缩线性计算带来的偏差。

按作者报告,Minima仅占17.53 GiB,32K输入的首词等待时间为4.03秒;五项任务平均分85.10,BF16高精度版本为85.62。其困惑度——模型预测下一个词时的拿不准程度——差距还会随上下文变长而缩小。结论很具体:在这种混合架构里,循环部分未必是4比特部署中最脆弱的一环。


供稿材料 SOURCES — 1

← 返回 2026-09-06 · 学术板块