一台24 GB的电脑装不下大模型怎么办?Edge0的答案是:别把全部权重塞进内存,而是像做菜前备料一样,提前从SSD搬来马上要用的部分。它面向35B级MoE——一种拥有许多“专家”子网络、每次只调用少数专家的模型;计算虽省了,完整权重仍有19.5 GB。
难点是,模型通常算到当前层后,才知道下一层该找哪些专家,临时读盘会卡住。Edge0训练了一个“预路由器”,提前一个Token预测下一步的专家选择,并直接把预测结果当作正式路由。这样,SSD读取可与当前计算重叠,也不会因预测不一致而临时补载。4位量化和替换路由造成的质量损失,则由一个不合并进主模型的LoRA小型适配器补偿。
作者报告称,在24 GB的Mac mini M4 Pro上,Edge0以约2.9 GiB峰值活跃内存达到20.4 Token/秒;同机常规常驻方案占18.2 GiB,仅为3.9 Token/秒。其质量在五项公开基准上平均仅落后fp16教师模型数个百分点。框架、检查点与适配器均已开源;上述速度和质量仍以论文自测为准。