Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
NEWS 约 1 分钟

27B三值模型获得2.2倍解码

重训草稿模型,让24GB可跑的27B三值模型在L4上解码提速约2.2倍。

IMAGE — r/LocalLLaMA 日榜

把大模型塞进一张24GB显卡,只解决了“能不能跑”;生成得够不够快,仍是另一回事。Ternary Bonsai 2 27B把大量权重压成三个取值,能装进24GB显存或Mac,但据作者实测,它在一张L4上原本约为每秒30个token(模型生成文字的基本单位)。

作者重新微调了DFlash 2草稿模型——它会先快速猜出接下来的若干token,再交给主模型成批验证。原版基于bf16 Qwen3.8-27B训练,与三值模型不够匹配;新版改用Bonsai 2自身生成的150万token训练。作者称,在温度设为0的一张L4上,GSM8K、MBPP和MATH-500的解码速度分别达到2.17、2.17和2.20倍;MT-Bench则只有1.39倍。叠加ngram查找后,代码编辑场景可到3.15倍,单用草稿模型为2.46倍。各测试集准确率与原模型相差不超过1至2题,但这些数字仅来自作者的一张L4和一台M4 Pro,其他硬件上的效果仍待验证。


供稿材料 SOURCES — 1

← 返回 2026-10-09 · 开源板块