同样推一下箱子,换了重量或地面摩擦,结果可能完全不同。机器人若仍照搬旧经验,动作就容易失准。WorldAgen瞄准的正是这种环境切换:让视觉—语言—动作模型(VLA,即根据画面和文字指令直接控制机器人的模型)在部署后继续摸清现场规律,而不是训练完就把参数锁死。
它用同一个 Transformer 骨干同时做两件事:状态预测回答“这样做以后会发生什么”,动作预测回答“为了完成任务现在该怎么做”。模型到达新环境后,先执行探索动作,收集真实的状态变化,再通过基于 LoRA 的轻量测试时训练(TTT,即使用现场观察继续更新模型)修正内部的世界动力学。换句话说,它把“预演后果”从离线训练任务变成了现场适应工具。
作者称,WorldAgen只需少量测试时样本,便在 CALVIN 和 LIBERO 两套机器人基准上超过已有最佳方法。不过,所给材料未披露具体提升幅度,探索动作在真实部署中的成本与安全边界也仍待进一步说明。