你想在自己的电脑上运行一个大模型,通常先会撞上一堵墙:模型越大,装权重的“行李箱”就越重。27B 代表约 270 亿个参数;如果每个参数都用常见的 FP16——一种以 16 位保存数字的格式——仅权重就可能占掉几十 GB。Ternary Bonsai 2 27B 想做的,是把这个行李箱压到约 5.9GB,并让模型通过 WebGPU 直接在浏览器里运行。
这件事值得看,不只是因为“27B 塞进网页”很抓眼球。它还把本地 AI 最现实的矛盾摆到了桌面上:模型文件能不能装下,与模型在真实任务里是否可靠,是两道不同的题。以下尺寸、能力与速度数字主要来自 Prism ML 的模型卡;社区测试只能作为个案,不能代替系统评测。
270 亿个参数,为什么只剩约 5.9GB?
关键在三值权重。权重可以理解为模型内部大量可调的数字,它们共同决定模型如何处理输入、生成回答。Ternary Bonsai 2 把语言模型的权重限制为 $-1$、、$+1$ 三种取值。可选数字少了,保存每个权重所需的空间也随之下降。
这属于激进量化——用更少的位数表示权重,在体积、速度和能力之间做交换。模型卡称,其语言权重覆盖嵌入层、注意力投影、MLP 投影和输出层,平均每个权重占 1.72 bit,没有把部分关键层偷偷留在高精度格式中。按官方口径,模型约 5.9GB,相比约 54GB 的 FP16 版本小约 9.3 倍。
据社区发布帖转述,模型衍生自 Qwen3.8-27B,并保留原来的 hybrid-attention causal language model 架构。这里的 hybrid attention 指混合使用不同注意力方式;causal language model 则是按照已有文字预测下一个词的生成式模型。不过,当前材料没有给出对应原始模型卡正文,“Qwen3.8-27B”这一名称仍缺少进一步核对。
官方还发布了 GGUF 版本。GGUF 是本地大模型常用的文件格式,负责封装权重和运行所需信息,可配合 llama.cpp 等轻量工具使用。换句话说,这不只是一份研究结果,也已经做成了可下载、可运行的模型。
浏览器运行,省掉的是什么?
WebGPU 是浏览器调用本机 GPU 计算能力的接口。网页借此可以直接在本地执行模型,不必先安装传统桌面推理程序,也不必把输入发到云端。Prism ML 的 Hugging Face collection 提供了 WebGPU 演示;独立社区帖子也确认,Ternary Bonsai 2 27B 可以在浏览器本地运行。
这条路线已有前例。据 WebML Community 开发者介绍,上一代 1-bit Bonsai 27B 曾配合专门编写的 WebGPU 内核,在一台只有 6GB 显存的 RTX 3060 笔记本上达到每秒约 25 至 30 个 token。token 是模型处理文字时使用的小片段,并不严格等于一个汉字或一个单词。开发者还处理了 WebGPU 单个缓冲区约 2GB 的限制。Bonsai 2 沿着这条路线继续前进,只是改用三值权重,重新权衡体积与质量。
模型卡另称,它在 Apple M5 Max 笔记本上约能达到每秒 47 个 token。不过,这个数字来自官方单一信源,材料没有给出完整测试条件,不能直接推算到其他电脑。
“保留 98.2% 智力”该怎么读?
模型卡给出了比宣传语更具体的一组成绩:14 项 thinking-mode 基准平均分为 84.78;传统低比特版本 IQ2_XXS 为 72.59;体积约为它三倍的 UD-Q4_K_XL,则只领先约 0.4 分。官方还列出数学 96.57、编码 89.42、工具调用 74.92。
这些数字支持一个有限结论:在官方选定的测试中,三值压缩没有让成绩同步缩小九倍。但“保留 98.2% of FP16 intelligence”不宜直接翻成“保留 98.2% 性能”。“智力”不是一个天然统一的量,材料也没有交代这 98.2% 的具体算法、任务权重、误差范围以及所有对照设置。它更像模型卡的概括性宣传指标,而不是适用于一切任务的保证。
社区个案也提醒了另一面。一名用户让模型生成一个可供玩家行走、包含多种生态环境的 3D 小星球,模型重复思考超过两小时,仍未完成任务。这只能说明某条提示词触发了长时间推理循环,不能据此断言模型整体不会写代码;但它足以说明,基准平均分与一次真实工作能否顺利做完,仍有距离。
类似争议在上一代已经出现。社区曾报告,27B 版本能以正常速度运行,却只输出符号和数字噪声;另一次 Terminal-Bench 2.0 测试仅得 7.9%,低于体积同样能装进显存的 Qwen3.5-9B。争论因此不再只是“能否运行”,而是:极限压缩的大模型,是否一定胜过压缩更温和的小模型。
真正值得关注的是门槛下降
Ternary Bonsai 2 最有意思的地方,不是把某个排行榜数字再推高一点,而是让“27B 级模型在本机浏览器运行”变成了可以实际尝试的东西。模型压缩与 WebGPU 结合后,部署门槛从专门的推理环境,进一步降到一个网页入口。
但这也是一场尚未结束的交换:它用更激进的数字表示换取更小文件,再努力避免能力随之坍塌。官方基准显示这次交换可能相当划算,社区个案则表明,真实任务里的稳定性仍需更多验证。
局限与未知
- “约 5.9GB”描述的是模型文件,不等于整套程序只需 6GB 内存。对话越长,保存前文中间结果的 KV cache——可以理解为模型随手记录的工作笔记——还会继续占空间。Prism ML 此前公布的旧版数据中,约 6.66GiB 的 GGUF 权重在 4K 上下文时峰值约 7.8GiB,100K 上下文时约 13.7GiB。
- 材料没有说明浏览器兼容范围、最低显存或统一内存需求、实际生成速度及额外缓存开销,因此不能把“可在浏览器运行”理解为任意设备都能流畅运行。
- 官方成绩和“98.2%”主要来自模型卡;目前只有一条社区失败案例,正反两边都不足以回答它在长期使用中的可靠性。