深度专题 FEATURES — 2
训练Agent,先批量制造世界
Skill2Env从能力倒推训练场,CompoWorld再组合服务扩张任务空间:Agent后训练开始批量“造世界”。
微型机器人训练压到分钟级
让上万名虚拟分身同时练导航,研究团队把微型机器人策略训练压到10分钟以内。
速览 BRIEFS — 9
PAPER
LLM推理奖励该分给哪一步
EAPO不再平均奖惩推理过程:奖励犹豫后的成功,纠正自信的失败。
PAPER
长任务蒸馏不再死盯时间步
AlignOPSD按“决策”而非固定时间步对齐监督,让长任务中的功劳分配更准确。
PAPER
注意力计算开始按质量自助分配
MassAlloc让注意力先看全局,再按实际贡献分配后续计算,并把节省做到GPU内核里。
PAPER
完整因果注意力不必人人看全史
CoWindow让不同注意力头分工阅读长上下文,合起来看全历史,减少重复计算。
PAPER
部署轨迹自动变成Agent考题
把真实运行记录改造成行为考题,专门揪出“结果对、过程错”的 Agent。
PAPER
LLM强化学习的错位发生在哪
同一模型在生成和训练时概率对不上;CIS从偏差源头校正,减少强化学习失真。
PAPER
奖励模型也开始走扩散路线
扩散式奖励模型不再只给一个分数,而是保留人类评价中的分歧与不确定性。
PAPER
极少视觉Token也能自我补课
只保留5%视觉Token,模型沿自己的答题轨迹向完整版本“补课”
PAPER
MoE路由变了,不等于合并坏了
合并后专家分工变了,不代表模型坏了;是否失败,要看任务损失能否通过路由干预挽回。