同样踩一脚油门,车换到湿滑路面后,反应可能完全不同。AI 也会遇到这种麻烦:环境的运行规律一变,原先学会的行动后果就不再可靠,规划随即失准。JEPA-TTT 要解决的正是这种“世界变了,模型却还按旧经验推演”的问题。
它建立在 JEPA——一种不逐像素描绘未来、只在压缩后的特征空间预测关键变化的世界模型——之上。部署后,模型利用刚执行的动作和随后看到的结果,自监督地更新动力学预测器;视觉编码器和任务评分模块保持不动。更关键的是,这些更新不会在每轮结束后清零:系统把不同时间位置的经验存入不断增长的回放池,跨回合持续学习。作者称,在四个连续控制环境的八种动力学变化中,该方法均改善了规划;经过 500 个测试回合,潜在状态的连续预测误差平均下降 83%,规划表现较冻结模型提高 153%。这些结果仍来自论文作者的受控实验,尚不能说明它能应对任意现实变化。