Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.078 — 2026-09-20
PAPER 约 1 分钟

结构化描述给视频模型补物理课

用结构化物理描述和机器人动作训练视频模型,让它更懂物体如何交互,而不只会生成画面。

镜头一晃,杯子在画面里换了位置,但它其实没动。视频模型若分不清这两件事,就很难真正理解物理世界,更别说替机器人预演动作后果。StrucPhysVideo 的思路,是先把训练视频里的物理过程讲清楚:结构化描述不只写“机器人操作杯子”,还按对象、材质、接触、形变、状态变化和发生时间提供线索,并把相机运动与物体运动分开。

团队还让模型接收机器人末端执行器的动作指令,再预测后续画面。换句话说,模型不只猜视频自然会怎样继续,还要学习“机械臂这样动,世界会怎样变”。论文报告称,其文本—图像到视频模型在 Physics-IQ Verified 上得分 45.5%,比 Cosmos3-Super-Image2Video 高 2.8 个百分点;按 2026 年 9 月 16 日的榜单快照,在所比较的 17 个模型中排名第一。机器人版本可用四步去噪逐段生成动作结果,但这些效果目前仍以作者披露的评测为准。


供稿材料 SOURCES — 1

← 返回 2026-09-20 · 学术板块