Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.066 — 2026-09-08
PAPER HF 15 约 1 分钟

层可以随机丢,推理还能按需裁

训练时随机跳层,既省算力,也让同一模型能按推理预算灵活瘦身。

大模型像一摞层层传递的加工工序:层越多,通常越耗时间和算力。这项工作尝试在训练时随机跳过整层计算,像练习时故意少走几级台阶,让模型提前习惯不同深度。这样既能减少训练开销,也方便部署时按设备预算删层。

关键不只是“随机丢层”,而是怎么丢。作者发现,更有效的配置是:越靠后的层,跳过概率逐步增加;随着训练推进,整体跳层强度逐渐降低,并同步调整优化器参数。在超过 2400 次训练实验中,模型规模覆盖 2.71 亿至 82 亿参数。作者报告,在训练步数相同时,这套方法最多节省 25% 的训练 FLOPs——也就是主要计算量——同时取得相近或更低的验证损失。

更实用的是,模型训练完后无需再微调,就能做“零样本剪层”:直接提前结束计算或跳过中间层。作者称,这可带来最高 1.5 倍推理加速,准确率损失可忽略。换句话说,一次训练便能得到可按算力伸缩的模型;不过这些效果目前仍以论文作者的实验为准。


供稿材料 SOURCES — 1

← 返回 2026-09-08 · 学术板块