教机器人搬箱子,难点不只是动作本身:箱子换成球、桶或收纳筐,人的弯腰幅度、双手间距和搬法都会变化,不可能每种组合都重新拍一遍。PRISM瞄准的正是这道数据瓶颈。它从4段真人搬箱视频出发,用视频到视频生成模型 SeedDance 2.0 替换物体,并让人的动作随物体大小、姿态和摆放位置一起调整,最终生成256段“反事实视频”——也就是现实中没拍过、但可能发生的交互。
生成视频看起来合理,不等于机器人真能照做。PRISM最关键的一步,是把“接触”当作贯穿流程的锚点:先用手与物体的接触关系修正视频重建误差,再把动作转换为符合机器人身体结构和物理约束的轨迹,最后在模拟器中训练。作者称,同一套策略只看机载深度信息,无需现实微调,就能在真机上拿起、搬运并放下未见过的箱子、桶、筐和球;这是 real-to-sim-to-real,即从真实视频提取任务、在模拟器扩充练习,再把策略带回现实。