想在普通笔记本上本地运行大模型,常见难题是显存不够,还得安装一套复杂环境。mentria.ai 的开发者称,他们把 Bonsai-27B 搬进了 Chrome:打开网页即可运行,不用服务器,数据也不离开电脑。在一块只有 6GB VRAM(显卡自带的高速内存)的 RTX 3060 Laptop GPU 上,聊天时可达到每秒 25—30 个 token——token 是模型生成文字时处理的基本单位。
关键在“一比特”。Bonsai-27B 是 Prism ML 原生训练的一比特模型:每个权重用一个正负符号位表示,并由每 128 个权重共享一个缩放值,平均约 1.14 bit;因此,270 亿参数可装进约 3.8GB 显存。网页则通过 WebGPU——浏览器调用 GPU 计算能力的标准接口——完成本地推理。
最具体的突破来自一个很小的底层改动。作者发现,计算内核访问 GPU 临时存储时发生“银行冲突”,许多线程挤在同一条通道上,带宽利用率仅 38%。每行加一个填充位置后,相关计算耗时从 26.5 毫秒降至约 21 毫秒,原始速度达到 32 tok/s;计入采样和界面开销后,实际聊天速度为 25—30 tok/s。以上性能与质量结论均来自作者自述。