想象机械臂端起杯子:好的模型不仅要猜到下一刻,还得预见几步之后杯子会不会滑落。RoboJEPA研究的正是这种内部“想象力”能否随规模稳定提升。它不逐像素生成未来画面,而用潜变量世界模型——把场景压缩成“杯子正被抓起”之类的抽象状态——预测动作带来的变化。
作者在23个公开操作数据集、12种机器人形态上训练了从2200万到80亿参数的模型,并报告称,潜在展开误差——模型连续想象多步未来时的偏差——会随训练算力按二阶幂律变化,且能外推到拟合范围之外;这项误差还与后续规划表现强相关。一个直观现象是:处理物体时,只有20亿参数及以上的模型会在抓取后持续闭合夹爪,较小模型常会误把物体松开。价值不只在又一个JEPA——即在抽象表示中预测未来的方法——而在于它试图用扩展律估算:继续加数据、模型和算力,究竟还能换来多少机器人预测能力。上述效果均为论文作者报告。