Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.098 — 2026-10-10
PAPER HF 10 约 6 分钟

万亿模型做Agent强化学习,先压缩权重更新

NeMo-DCR只搬运模型真正改变的部分,让万亿参数Agent强化学习不再反复搬整套权重。

你可以把它想成两间异地厨房:一边刚改完一份上千页的菜谱,另一边马上要照新版做菜。最笨的同步办法,是每改一个字,就把整套菜谱重新寄过去。万亿参数模型做Agent强化学习时,也在重复类似的事:训练集群更新模型,负责采样的集群必须拿到新权重,才能开始下一批任务。论文称,在它测试的两个AWS region之间,传输一个完整的1T检查点要87.5分钟。

NeMo-DCR想解决的,就是这段容易被忽略的等待。它不再搬运整套模型,而是只传真正发生变化的内容;同时保证接收端恢复出的每一位,都和传完整检查点完全一样。作者把这种同步称为refit,也就是把训练侧的新策略重新装进采样侧。

先说明证据边界:本文的性能数字与比较均来自该论文自身,尚无第二方复现。87.5分钟也是特定AWS跨region配置下的纯传输基准,不能理解成所有万亿参数模型都需要这么久。

为什么只传变化并不简单

Agentic Reinforcement Learning,是让Agent在环境中完成多步骤任务,再根据结果调整行为策略。它需要大量实际或模拟交互,因此系统通常把“训练模型”和“运行Agent收集轨迹”放在不同机器上。这里的rollout,指模型按当前策略执行任务后留下的一串状态、动作与反馈,也叫采样轨迹。

问题在于,每轮训练更新后,新策略必须先送到rollout集群。模型越大,这一步越像每次修订都搬整座图书馆。

论文测量六个模型的BF16训练后发现,每一步只有0.6%至1.2%的源元素改变了存储值。BF16是一种低精度数字格式;许多很小的更新经过舍入后,并不会改变最终保存的比特。换句话说,完整传输可能把绝大多数带宽花在没有变化的内容上。

但“只发差异”仍有三道坎。

第一是位置。训练集群和推理集群会用不同方式拆分、排列权重。训练侧知道某个分片里的数变了,不等于接收侧知道该写到哪里。

第二是精确。用“旧值加差值”重建权重,可能再次触发浮点舍入。强化学习又可能因训练策略与采样策略不一致而受影响。

第三是故障。若同步中途断掉,接收端会同时留着新旧两版权重。下一份差异若建立在错误的旧版本上,问题会继续累积。

先统一地址,再决定怎么寄

NeMo-DCR的关键选择,是先把变化投影到checkpoint的“标准坐标”——也就是Hugging Face检查点采用的张量名称与索引。它像一套双方都认识的统一地址:训练侧把变化写到这个坐标系里,接收侧再交给推理运行时原生的加载器安放。这样不用在同步系统里重新实现各种模型和并行布局的放置规则。

对于能用固定映射处理的变化,系统直接从训练分片算出标准坐标。论文称,这类映射覆盖两个受测MoE检查点96%以上的权重字节。MoE即“专家混合”模型,会让不同输入调用不同的子网络。其余无法直接映射的部分,例如共享缩放因子引起的连带变化,则先完成必要的转换,再与基线逐位比较。

确定位置后,NeMo-DCR混合使用两种编码。能保持原始比特表示的变化,用XOR mask,也就是记录哪些二进制位需要翻转。其余变化直接发送新值,执行overwrite(覆盖写入)。XOR mask往往有很多零,容易压缩;而覆盖写入不依赖浮点运算。两条路径最终都追求bit-exact:接收端的参数与buffer bits必须和完整同步一致。

论文的Qwen3实验显示,混合XOR方案比只用覆盖写入少38%至40%的payload字节。直接投影相较完整转换,则让delta构建快1.08至1.16倍。这里的delta,就是相邻两个版本之间需要传输的变化集合。

一次失败,不能留下半个版本

接收端会原地修改现有权重,不额外保存一整份副本。这节省了内存,却让恢复机制变得关键。

XOR不能盲目重放,因为同一mask执行两次会把比特翻回去。因此接收端会根据payload标识去重。若一次refit中途失败,重试不再依赖XOR,而是把完整变化集合全部改成绝对覆盖写入。无论上次写到哪里,这次都能把目标位置推到确定的新值。

所有指定接收端确认应用完成后,系统才执行joint commit(联合提交),把新策略版本和生成这份delta所依据的旧基线绑定起来。下一次比较只能从这个已提交版本出发。论文还做了50步GRPO训练实验:每五步随机杀掉一个vLLM实例并稍后重启,两个NeMo-DCR传输方案的平均奖励和KL轨迹与完整NCCL同步相随;三种方法在这组实验中的平均奖励均为0.41。该结果来自五次运行,仍需更广泛验证。

真正省下的是等待时间

NeMo-DCR支持两条传输路径。没有集群直连时,可以通过object storage(对象存储)中转;有直连时,则用relay tree(中继树)把payload先送到采样集群的一台机器,再在集群内部扩散。两种方式都能边构建delta边传输,不要求训练与rollout集群共同参加一次跨集群集合通信。

在论文设置的3%和5%变化率压力测试中,30B至1T模型的refit比“只计算传输、不计保存与加载”的完整检查点基准快12至40倍。对1T模型,3%变化率下的中继树方案耗时150秒,完整检查点基准为87.5分钟。测试覆盖了比较、编码、传输、应用、设备同步与提交等环节;而对照基准只计算完整检查点的传输,因此对照条件反而偏向完整传输。

这项工作的价值不只是压缩率。它把地址转换、逐位一致、失败恢复和跨集群传输放进了同一套协议。Agent强化学习若要把训练和采样铺到不同硬件、不同数据中心,权重同步就不能只是“能传过去”,还要足够快,并且能在失败后确认两边究竟处于哪个版本。

局限与未知

  • 12至40倍来自论文自己的特定硬件、网络和基准实现,不是普遍性能保证;各模型与网络配置的逐项结果也未在供稿中完整给出。
  • “每步约1%发生变化”针对论文测得的BF16训练,不能直接外推到其他精度、优化器或训练阶段。
  • 论文验证了1T场景下的refit,不等于已经证明端到端Agent强化学习训练整体可扩展到万亿参数。同步只是其中一个关键环节。

供稿材料 SOURCES — 1

← 返回 2026-10-10 · 学术板块