想象一个网页,不联网,也不用安装软件,打开后就能续写故事。开发者 Chromix_ 把页面、运行逻辑和一个微型故事模型一起塞进了约 24KB 的独立 HTML 文件。浏览器既是界面,也是模型运行的地方。作者称,手机上也能达到每秒 60 个以上 token——token 是模型生成文字时处理的基本片段;更换随机种子,也就是改变随机过程的起点,便会得到不同故事。
真正有意思的是压缩取舍。这个项目改造自 81KB、FP32(用 32 位浮点数保存参数)的 MacroStory 模型。作者发现,微型模型和常见大模型的“减肥规律”不同:词嵌入——模型用来表示词语的数字表——占了约 60% 体积,反而更有压缩空间;模型里的小型矩阵对量化很敏感。量化就是用更低精度保存数字,但在这里,1 bit 等方案附带的修正数据会吃掉节省的空间。最终奏效的是自适应量化与 QAT(在训练时模拟低精度误差),再配合网页代码压缩。
作者也坦言,这更像极限体积实验:稍大的文件能用更少工夫承载更强模型。它的价值不在实用性,而在直观展示端侧生成能被压到多小;故事一致性、速度和质量目前均只见作者自述,材料未提供系统测试。