Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
PAPER H 44 约 8 分钟

FLEX-WAM:一套模型切换想象与行动

FLEX-WAM 用一套模型预测未来、生成动作并在想象中规划,瞄准机器人长任务。

一套模型,既想后果,也想动作

假设机器人要把一块侧躺的 T 形积木推到桌子中央,再把它摆正。它不能只想“下一步往哪推”,还得判断:这样推下去,积木会不会转过头、滑过界,或者卡在错误的位置。任务一长,预测的小误差还会一层层累积。

FLEX-WAM 想把这些工作交给同一套模型。它既预测“执行这个动作后,世界会怎样”,也生成“为了目标,下一步可以做什么”,还能在内部试走多条路线后再选择。这类系统叫世界—动作模型(World-Action Model,WAM),可以理解为把环境模拟器和行动决策器装进同一个大脑。

更值得注意的是它的结构:同一个模型可以按帧慢慢生成,也可以一次处理一块未来;可以读取长短不一的历史,还能在部署时调整速度与预测质量之间的取舍,无需重新训练。以下结果均来自 Khorrambakht 等人的论文;部分实验仍是模型内部的“想象成功”,不能直接等同于现实执行成功。

关键不是预测更远,而是随时换挡

传统的自回归生成每次预测下一步,再把结果接回输入,继续预测后一步。它适合流式运行,但走得越远,误差越容易积累。另一种做法是同时查看整段预测区间,让未来各帧彼此协调,画面通常更连贯,却常被固定的预测长度绑住,也不利于缓存历史计算。

FLEX-WAM 用“块因果结构”折中。它把时间序列切成连续的块:同一块内的帧可以双向参考,块与块之间则严格遵守先后顺序。好比写行程时,一天之内可以来回协调安排,但第二天只能建立在前一天之后。

训练时,模型随机接触不同大小的块。部署时,使用者再决定怎样运行:块大小为 1,就是逐帧预测;块更大,就能并行生成一段未来,提高吞吐量。论文在 Unitree G1 数据上一次并行去噪 16 帧,发现块内双向注意力越强,时间上的平滑性和与真实数据的一致性越好。作者同时观察到,有历史画面可参考时,模型对未来帧之间相互参考的依赖会降低。

模型还支持 KV cache——把已经处理过的历史信息暂存在“草稿纸”上,后续生成不用反复重算。配合 axial attention(轴向注意力,即把空间与时间方向分开处理)和 blockwise diffusion forcing(按块设置扩散噪声,让模型练习修复不同完整程度的片段),它可以逐帧或逐块持续滚动。

这里要区分两个说法:架构允许持续自回归生成,不等于实验已经证明它能无限稳定运行。论文实际展示的是最长 1024 步的解码结果,并声称系统能稳定滚动数千步。

为什么“听动作”比“像真的”更难

联合训练有一个隐蔽问题:模型可能生成很像真的未来,却没有认真听从给定动作。连续画面本来就高度相似,模型只靠画面惯性也能猜出一个看似合理的下一帧。对视频生成来说,这未必显眼;对机器人模拟器来说却很危险,因为规划所依赖的正是“不同动作会导致不同结果”。

FLEX-WAM 同时学习状态与动作,两种训练目标会争夺同一组网络参数。作者先测量它们在不同噪声条件下产生的梯度——也就是各自推动模型更新的力量——再校准权重,避免其中一方长期压过另一方。

团队还设计了 Forward-Dynamics elasticity(FD elasticity,前向动力学弹性)。它不是直接衡量画面漂不漂亮,而是探测模型的内部状态会不会随动作变化,可作为“模型究竟听不听动作”的训练期传感器。

训练因此分成两段。第一段只训练世界模型,让它先学会动作与后果之间的关系。第二段再加入生成动作等其他模式,同时用 FD elasticity 反馈调节世界模型样本的比例,把动作敏感度维持在纯世界模型峰值的 90%附近。实验中,这个采样比例从接近 1 逐渐收敛到约 0.2;普通联合训练没有反馈时,动作响应能力则在达到较低峰值后继续下降。

真能在“脑内”完成长任务吗?

作者把 FLEX-WAM 同时用作动作提议器和模拟器,再接入 MCTS(Monte Carlo Tree Search,蒙特卡洛树搜索)。搜索器让模型提出多种可行动作,在想象中展开后果,然后逐步保留更有希望的路线。这类似下棋前试走多条分支,只是棋盘变成了机器人看到的画面。

在真实机器人数据构成的 PushT 任务中,模型找到一条把侧躺 T 形物推到桌面中央并摆正的想象计划。论文没有报告这条计划在真实系统上的闭环执行结果。

在 OGBench 的五个 Puzzle-4x4 任务上,每项任务需要按下 4 至 7 个按钮。规划器在 100 次评测中有 80 次让想象中的最终棋盘达到目标,五项任务分别成功 17/20、17/20、14/20、14/20 和 18/20;计划平均长度为 157 帧,范围是 72 至 240 帧。这里的成功标准仍是“模型想象中的终态到达目标”,现实执行留待未来工作。

生成质量方面,作者在 LIBERO 上比较 UWM 与 Cosmos-Policy。以表中最远预测位置为例,UWM 的 SSIM/PSNR 为 0.599/15.6 dB,Cosmos-Policy 为 0.587/16.5 dB;FLEX-WAM 在块大小 1、8、16 时分别达到 0.764/19.9、0.778/20.5 和 0.776/20.5。SSIM 和 PSNR 都用于衡量预测图像与真实图像的接近程度,数值越高越好。论文在列出的全部预测位置上都报告了更高结果,其中块大小 8 的整体表现最好。不过,延迟部分没有在供稿表格中保留可核对的具体数值,因此只能确认作者称其延迟具有竞争力,不能判断优势究竟有多大。

同一个 checkpoint,还能发现自己哪里不懂

在基于 OpenArm 的双臂机器人上,作者用两小时遥操作玩耍数据训练模型。部署时,同一个 checkpoint——一次训练后保存的模型版本——一边充当 play policy,生成与数据中相似的随机动作,一边预测这些动作应该产生什么结果。

真实相机画面回来后,系统比较预测与现实。如果两者差得很远,就把这段经历记下来。论文展示了一个例子:模型在下一时刻凭空预测出一个可抓取的盒子,而真实观察中并没有它。这种自动收集“模型—现实不匹配”样本的机制,为以后针对薄弱处继续训练提供了材料。

但它目前只是发现并收集错误,不代表模型已经能在线自我改进。论文也把如何利用这些样本持续学习留作后续方向。

为什么值得关注

FLEX-WAM 的推进不只在于某项分数,而在于把几种原本彼此牵制的需求放进同一架构:它可以生成动作,也可以预测动作后果;可以逐帧低延迟运行,也可以成块提高吞吐;还能作为搜索中的动作提议器与模拟器。块大小成了部署时的“换挡杆”,不必为了不同工作方式分别训练模型。

更重要的是,论文没有把“画面看起来合理”当作充分条件,而是正面处理模型对动作不敏感的问题。对需要规划的机器人而言,未来像不像只是第一关;未来是否真的随指令改变,才决定内部模拟能不能用于决策。

局限与未知

  • 论文的长任务成功主要发生在模型想象中。Puzzle-4x4 计划尚未在真实系统闭环执行,PushT 也未提供现实执行成功率。
  • 生成质量有具体指标,但延迟比较缺少可核对的数值、方差与统计显著性;“实时”和“更优”仍需结合完整基准审视。
  • OpenArm 案例只证明系统能发现并收集预测错误。利用这些数据持续改进模型,以及改进后是否更可靠,都还没有得到验证。

供稿材料 SOURCES — 1

← 返回 2026-10-09 · 学术板块