让机器人学会抓取物体,常见做法像是先让它在脑中“生成一段未来视频”,再决定手该怎么动。问题是,这套视频扩散模型——通过多轮去噪生成连贯画面的模型——训练和运行都很昂贵。
LeWAM换了一条路:它把当前画面压成潜空间里的“浓缩现场笔记”,直接在其中同时学习动作和环境变化。研究者比较多种视觉编码器后发现,I-JEPA——通过预测图像内部表示来学习视觉规律的编码器——比用于压缩、还原画面的VAE更适合直接生成动作。训练时,单个预测器一边生成动作,一边预测执行动作后的未来表示;部署时则删去未来预测环节,只输出动作,不再依赖大型视频扩散骨干。
作者报告,LeWAM仅训练4亿参数,在RoboTwin 2.0上的平均成功率为92.28%,与当时先进的视觉—语言—动作模型和世界动作模型相当,并在真实机器人操作中保持实用效果。不过,这些效果目前仍是论文作者的实验结论。