你让机器人先左转再前进,但旧命令晚到一步,它可能先走再转。麻烦不只是“慢”:世界模型——用动作预测接下来会发生什么的模型——以为正在执行 A,机器实际却在执行 B,后续规划便从错误起点展开。
作者用相同的规划命令、相同的环境状态,只改变动作传输延迟。结果显示,延迟越大,发出的命令与实际动作分歧越大,短期回报也越低。更关键的是,对 TD-MPC2 这类规划式控制器,仅告诉它当前执行了什么,或执行器缓冲区里有什么,都不够;只有把准确的未来动作序列放进模型内部的状态推演,控制才会改善。拿同一信息只给候选轨迹重新打分,并无帮助。
这说明延迟会改变动作的“含义”和时间线,而不只是制造外部扰动。论文据此提出轻量接口:TD-MPC2 向执行端发送未来动作序列,DreamerV3 则接收实际执行动作的反馈;两者都无需修改预训练世界模型。