Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.078 — 2026-09-20
PAPER H 17 · HF 10 约 1 分钟

35B MoE从SSD边读边跑

Edge0预判下一步要用的专家,把35B MoE权重从SSD边读边算。

一台24 GB的电脑装不下大模型怎么办?Edge0的答案是:别把全部权重塞进内存,而是像做菜前备料一样,提前从SSD搬来马上要用的部分。它面向35B级MoE——一种拥有许多“专家”子网络、每次只调用少数专家的模型;计算虽省了,完整权重仍有19.5 GB。

难点是,模型通常算到当前层后,才知道下一层该找哪些专家,临时读盘会卡住。Edge0训练了一个“预路由器”,提前一个Token预测下一步的专家选择,并直接把预测结果当作正式路由。这样,SSD读取可与当前计算重叠,也不会因预测不一致而临时补载。4位量化和替换路由造成的质量损失,则由一个不合并进主模型的LoRA小型适配器补偿。

作者报告称,在24 GB的Mac mini M4 Pro上,Edge0以约2.9 GiB峰值活跃内存达到20.4 Token/秒;同机常规常驻方案占18.2 GiB,仅为3.9 Token/秒。其质量在五项公开基准上平均仅落后fp16教师模型数个百分点。框架、检查点与适配器均已开源;上述速度和质量仍以论文自测为准。


供稿材料 SOURCES — 1

← 返回 2026-09-20 · 学术板块