深度专题 FEATURES — 3
强化学习究竟怎样重塑推理
RL未必教会模型新招,更可能重排旧策略;这解释了迁移、遗忘与覆盖率为何同时发生。
从操作轨迹复刻一个Agent世界
把历史操作记录编成“世界手册”,让AI扮演可交互、能记住后果的训练环境。
万亿模型做Agent强化学习,先压缩权重更新
NeMo-DCR只搬运模型真正改变的部分,让万亿参数Agent强化学习不再反复搬整套权重。
速览 BRIEFS — 8
PAPER
重复训练数据也有扩展律
同一批数据再学一遍值多少?新扩展律把模型大小、训练轮次和重复收益纳入同一笔账。
PAPER
世界模型预测得准,未必规划得对
两项研究发现:世界模型预测分数漂亮,仍可能选错动作。
PAPER
世界模型在MOBA实战中交卷
世界模型在十英雄MOBA里闭环练兵,并以真实对局胜负验收。
PAPER
50M Token记忆层挑战反复重算
把旧对话的“思考草稿”存进硬盘再调用,50M Token测试中比重算更快、更省电。
PAPER
交互视频世界开始缓存用户控制
CtrlCache让视频世界模型看懂用户操作:转向时重算,稳定时复用,以兼顾速度与响应。
PAPER
Kandinsky 6.0同步生成声画
Kandinsky 6.0让画面与声音一起生成,并把开源声画模型推向30B级
PAPER
人形机器人家务评测加入全身平衡
BiGym 2.0让Unitree G1边走边做20项家务,把平衡也纳入能力测试。
PAPER
投机解码开始循环打磨草稿
两条路线都让小模型在验收前多轮打磨,把提速重点转向更可靠的草稿。