把大模型塞进一张24GB显卡,只解决了“能不能跑”;生成得够不够快,仍是另一回事。Ternary Bonsai 2 27B把大量权重压成三个取值,能装进24GB显存或Mac,但据作者实测,它在一张L4上原本约为每秒30个token(模型生成文字的基本单位)。
作者重新微调了DFlash 2草稿模型——它会先快速猜出接下来的若干token,再交给主模型成批验证。原版基于bf16 Qwen3.8-27B训练,与三值模型不够匹配;新版改用Bonsai 2自身生成的150万token训练。作者称,在温度设为0的一张L4上,GSM8K、MBPP和MATH-500的解码速度分别达到2.17、2.17和2.20倍;MT-Bench则只有1.39倍。叠加ngram查找后,代码编辑场景可到3.15倍,单用草稿模型为2.46倍。各测试集准确率与原模型相差不超过1至2题,但这些数字仅来自作者的一张L4和一台M4 Pro,其他硬件上的效果仍待验证。