Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.079 — 2026-09-21
PAPER H 32 约 1 分钟

失败之后,机器人该学什么

MAGMA-GEN用反事实重执行筛掉误判,让机器人的失败经历成为更可靠的恢复教材。

机器人做一串长任务,最后失败了,不等于最后一步才错,也不等于前面的计划一定错。比如高层决定“拿起物体”,这个决定可能合理,只是机械臂执行时打滑。若把整段失败轨迹直接拿来训练,机器人反而可能学错责任归属。

MAGMA-GEN的关键,是让诊断接受一次“如果当时换一步”的检验。系统先由 privileged coach——训练时能看到更多状态信息的辅助模块——推测较早出现的决策错误,并提出局部修正或恢复动作;随后从同一状态、在匹配条件下重新执行。只有新动作确实改善了后续进展,这条样本才会被保留为恢复监督,也就是教机器人陷入坏状态后如何补救的训练信号。

这样,机器人能从自己实际遇到的失败中生成教材,又不必为每一步配人工示范。作者称,该方法在仿真与真实机器人上的长程交互操作任务中,相比蒸馏和轨迹修复基线提升了任务成功与恢复能力;供稿未披露具体增幅。


供稿材料 SOURCES — 1

← 返回 2026-09-21 · 学术板块