在小内存 Mac 上跑大模型,常见瓶颈不是“算不动”,而是“搬得慢”:MoE(混合专家模型)虽每次只调用少数参数模块,却仍要把大量专家权重存进 SSD,需要时再读入内存。就像后厨等订单来了才去仓库取食材,计算过程常被存储延迟卡住。
开发者 carloslfu 为 slotstream 实现了 expert lookahead:在当前计算进行时,用 Qwen 的路由器——负责决定每个 token 交给哪些专家的小型网络——根据当前隐藏状态预测两层之后可能需要的专家,并提前加载。作者称,这让采用专家卸载和 SSD 流式加载的 Qwen 3.8 flash 在已有多项优化之上再提速超过 10%。
有意思的是,作者起初训练了一个小模型做预测,反复实验后却发现,模型自身就是更好的预测器,最终把前瞻距离定为两层;另加的小型纠正模型据称还能带来约 3%—4% 提升。上述结果来自作者在 Reddit 的自述,材料未披露完整测试配置与可复现实验数据,因此更适合看作一项实用的工程进展,而非普遍性能结论。