Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.067 — 2026-09-09
NEWS 约 1 分钟

27B量化到15%仍保住推理

任务感知量化把27B模型压至BF16约15%,作者称仍保留99%推理表现。

IMAGE — r/LocalLLaMA 日榜

想在显存有限的设备上跑大模型,通常得先给它“瘦身”,但压得越狠,推理能力越容易掉。开发者 devildip 给 Qwen3.8-27B 做了一套任务感知量化:量化就是用更少比特保存模型数值;“任务感知”则是不求面面俱到,专门照顾推理任务。作者称,成品体积约为 BF16——一种16位浮点高精度基线——的15%,推理得分为82.81%,达到 BF16 的83.59%的约99%。

这套方案名为 TAK(Task Aware Knapsack)。它先用推理语料建立重要性测量,再找出模型接近崩溃的最小体积,最后在固定字节预算内,按不同张量受损程度分配精度。与体积匹配的 Unsloth UD IQ2_S 相比,TAK 得分高5.47个百分点:82.81% 对77.34%。值得留意的是,这不是通用能力不缩水的证明。作者已确认有人拿它写代码时遇到重复循环,并说明代码不在当前优化范围内;上述结果也来自作者在 Reddit 公布的自测,尚待独立复核。


供稿材料 SOURCES — 1

← 返回 2026-09-09 · 开源板块