整理房间时,机器人可能把物品暂时移出视野,过一会儿便忘了自己做过什么。MaP-WAM要解决的正是这种“不能只看眼前”的长程操作:它不让执行模型反复翻阅越来越长的历史,而是先把已完成步骤和稀疏的历史画面整理成下一段计划,再据此行动。
这套“记忆即计划”框架把工作分成两层:规划阶段调用长期的多模态情节记忆——也就是文字与画面组成的经历记录;执行阶段只接收精简后的语言计划和视觉指引,因此上下文长度固定。更具体的一点是,World-Action-Progress(WAP)模型会同时预测动作和完成进度,并把眼前画面与预想的视觉过程对齐,判断何时结束当前步骤、转入下一段。
作者报告,MaP-WAM在RMBench上的成功率为83.3%,真实机器人任务为78.0%;随着任务历史增长,执行端推理延迟仍大致恒定。结果来自论文作者自述,现有材料未提供独立复现情况。