Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER 约 1 分钟

MoE卸载开始预判专家到达

SeqMoE预判专家调用并提前搬权重,减少低显存推理中的GPU空等。

像小厨房做大菜单,食材放不下,就得猜下一道菜要什么,提前从仓库取来。MoE(混合专家模型)也有类似难题:它每次只调用少数“专家”模块;卸载则把其余权重放在CPU内存,需要时再搬进GPU。这样能省显存,但专家来晚了,GPU就只能空等。

SeqMoE的关键,是把专家调用看成一段可预测的序列:它用轻量的Mamba2预测器,根据此前的调用轨迹,预判后续多个生成步骤、多个模型层会用到哪些专家。系统再结合截止时间安排预取——也就是提前搬运权重,并据预测决定缓存里该留下谁。它还让动态换入专家兼容计算图,即可重复执行的运算计划,避免数据搬运省下的时间又被调度开销吃掉。

据论文作者报告,当GPU常驻45%的专家权重时,SeqMoE平均命中率为96.97%,达到全部权重均在GPU时80.22%的性能;最强对照的命中率为88.50%,FreeToken达到51.50%的满载性能。这些数字来自作者在四类MoE模型上的实验,尚未给出独立复现结果。


供稿材料 SOURCES — 1

← 返回 2026-09-17 · 学术板块