想在个人电脑上运行27B大模型,最现实的障碍往往是内存。量化就像给模型数字“压缩打包”:每个权重少占几比特,运行更轻,但也可能损失能力。ShapeLearn发布了Qwen 3.8 27B的GGUF版本——一种方便llama.cpp等本地工具加载的模型文件格式,试图在体积与质量之间取得更好的平衡。
作者自述,其3.84 bpw版本(平均每个权重使用3.84比特)在八项指令与思考基准的聚合分数上,达到BF16原版的99.63%;3.23 bpw版本则达到98.72%。BF16是常用的16位浮点格式,这里充当精度参照。更值得注意的是,团队发现较低的KLD——衡量量化前后输出分布差异的指标——不一定带来更好的任务成绩:一个KLD低约20%的对手方案,聚合得分反而是95.55%,低于ShapeLearn Lite的97.33%。不过这些结果来自发布者自己的测试,且对比未包含Bartowski的最新版本。