Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.074 — 2026-09-16
NEWS 约 1 分钟

Maple把20B MoE压到1B激活

llama.cpp拟接入Maple:200亿参数中每次只激活约10亿,瞄准低成本本地推理。

IMAGE — r/LocalLLaMA 日榜

大模型装不进普通电脑,往往不只是因为“太聪明”,而是每次计算都要搬动太多参数。Maple 走了一条更省的路线:它共有约 200 亿参数,但采用 MoE(专家混合)结构,处理每个 token——模型读写文字的基本单位——时只调用约 10 亿参数;同时把部分权重压成三值。现在,一项 llama.cpp 的 PR 正在为这套 20B-A1B 架构补上 CPU 加载与计算支持,让没有专用显卡的电脑也有机会运行它。

提交者称,官方 DeepGrove GGUF——把模型权重和运行元数据打包在一起的本地推理文件——已能在 CPU 上正确加载和生成。在 Apple M4 测试中,TQ2_0 文件的提示词处理速度为每秒 216 token,生成速度为每秒 88 token。完整 WikiText-2 测试还显示,TQ1_0 与 TQ2_0 的困惑度相同;两者保存的是同一套三值权重,只是打包方式不同。值得留意的是,这仍是一项处于评审中的适配工作,实际速度和效果还会受硬件、上下文长度及推理实现影响。


供稿材料 SOURCES — 1

← 返回 2026-09-16 · 开源板块