Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER HF 172 约 8 分钟

PhysBrain:物理模型闭环了

PhysBrain把看懂环境、生成动作和预测后果放进同一模型,但“闭环”目前主要成立在训练框架里。

你让机器人收拾桌面,它不能只认出杯子和抹布。它还得判断先做什么,控制夹爪怎么移动,并预想动作之后桌面会变成什么样。过去,这几件事常由不同模型分别处理。PhysBrain 1.5 想把它们收进同一个模型:既理解环境,也生成动作,还预测未来状态。这正是它值得关注的地方。

不过,标题里的“闭环了”需要加一道边界:论文闭合的是“观察—交互—环境变化”的学习框架,并没有提供真实机器人持续运行的定量闭环验证。本文的数字和效果均来自作者团队的论文,尚无独立信源交叉印证。

把三种任务写成同一种语言

PhysBrain 1.5 从 Qwen3-VL-Instruct 8B 出发。VLM,即视觉语言模型,本来擅长把图像和文字放在一起处理,例如看图回答问题。研究团队在它的词表中加入了两类新“词”:动作 token 和视觉 token。

Token 可以理解为模型能够读写的离散符号。语言模型通常根据前文猜下一个 token。PhysBrain 的关键做法,是把文字回答、机器人动作和未来画面都翻译成这样的符号序列。于是,三种看似不同的工作都变成同一道题:根据已有输入,逐个预测接下来应该出现什么。

这像给同一位学生三种统一格式的答题卡。题目可能要求写一句话,也可能要求画出夹爪的移动路线,或者描述几秒后的场景;答案形式不同,但都从同一个模型出口依次填出。训练时,任务格式和 loss mask——决定哪些答案位置参与误差计算的标记——告诉模型这次该生成哪一类内容。

这样做不只是把接口整理得更整齐。作者希望,环境理解能为动作和后果预测提供上下文;动作与状态变化的训练,也反过来给空间定位和轨迹推理加入“物理常识”。但论文提供的证据更能说明理解能力的提升,尚不足以证明三类能力已经在真实运行中形成稳定循环。

动作也能变成一句“话”

机器人真正接触物体的部位叫末端执行器,例如机械臂末端的夹爪。PhysBrain 不直接输出每一刻的连续控制量,而是预测末端执行器接下来 16 个动作步骤的短轨迹。每条轨迹包含相对位移、旋转和夹爪开合状态。

团队用 ActionPiece 把轨迹压缩成离散符号。这个动作 tokenizer——把连续运动转换成有限词表的编码器——在 2870 万段轨迹上训练,对应 4.592 亿个动作时间步。每段腕部轨迹最终表示为 32 个动作 token,动作词表共有 512 个符号。

数据来源之间并不整齐。不同机器人和视频采用不同坐标轴、运动尺度、控制频率,部分数据又缺少完整标定信息。作者没有强行把所有动作转换到一个全球统一的坐标系,而是保留各数据源原有的坐标轴,并把当前画面之前的一段动作一同交给模型。模型据此判断眼前系统的方向、节奏和尺度,再续写下一段轨迹。说白了,它先看清“这台机器刚才是怎么动的”,然后接着动。

未来不是一张图,而是三层状态

预测后果时,PhysBrain 同时生成 RGB 彩色画面、深度图和机器人掩码。深度图表示各位置离相机多远;机器人掩码标出画面中哪些区域属于机器人。三者对应同一时刻和同一图像坐标,因此模型不仅要猜未来“看起来怎样”,还要兼顾空间结构和机器人所在的位置。

这三层信息先由同一个 VQ-VAE——把图像压缩成离散代码、再还原成图像的模型——转成网格符号。PhysBrain 按空间位置交错排列 RGB、深度和掩码 token,总计生成 770 个 token。相同位置的三种信息被放在相邻处,方便模型联合考虑。生成完成后,冻结的解码器再分别还原三幅图。

论文展示的定性案例表明,模型可以生成末端执行器轨迹,也能输出空间对齐的未来 RGB、深度和机器人掩码。但这里的“可以”来自案例展示,不是动作成功率或未来预测误差等定量结果。

人的视频,怎样教会机器行动?

PhysBrain 1.5 分两阶段训练。预训练阶段的具身监督全部来自人类交互视频:约 3 万小时的第一视角、外部视角和全景录像。团队按任务和动作边界切分视频,把场景语义、空间标注、恢复出的人体运动以及后续画面配成连续样本。

其中,物理感知数据有 2430 万条,人类动作数据有 3120 万条,未来状态数据有 2680 万条;另混入 1490 万条通用语言和视觉语言指令数据。这里需要分清:只有预训练的具身监督完全来自人类视频。随后的监督微调还加入了人类示范、真实机器人轨迹和模拟经验,包括 540 万条动作样本、120 万条未来状态样本和 661 万条具身理解样本。

人类动作通过 Human-as-Humanoid 流程恢复成双腕轨迹,手指运动则被排除。到微调阶段,动作语料还包括约 2620 小时真实机器人与模拟轨迹,以及 500 小时筛选后的人体运动数据。这条路线的吸引力在于,人类视频能提供丰富的“做事过程”,机器人数据再负责贴近具体机器的运动方式。

72.5 分说明了什么?

作者在 28 个具身理解基准上测试模型,范围包括视觉与空间感知、多视角理解、具身推理与规划、目标定位与可供性,以及视觉轨迹推理。可供性指一个物体或位置允许怎样操作,例如哪里适合抓、放或接触。

按论文的统一重测结果,PhysBrain 1.5 8B 的平均分为 72.5,比最强开源对照 Hy-Embodied-VLM-1.0 高 6.5 分;它在 14 个基准上位列开源模型第一,在 24 个基准上进入开源前二,并在全部 28 项上超过底座 Qwen3-VL-Instruct 8B。这组结果支持一个较稳妥的判断:共同训练物理相关任务后,模型的具身理解确实比原始通用 VLM 更强。

论文还称它接近 Gemini 3.6 Flash 的 73.0 和 GPT-6-Astra 的 73.3,并超过 Claude Opus 5 的 67.9。不过,这一比较依赖作者的平均口径和重测设置;材料无法独立确认这些闭源模型的版本与公平比较条件,因此更适合看作作者报告的参照,而不是已经坐实的“追平闭源模型”。

所谓“保留通用多模态能力”也不是每项都不退步。与底座相比,PhysBrain 在 MMStar、RealWorldQA、POPE、ChartQA 和 V* 上更高,但在 MME、VideoMME、MVBench、AI2D、DocVQA、TextVQA 和 ScreenSpot 上更低。更准确的说法是:它没有整体丢掉通用看图与推理能力,但专项训练带来了有升有降的结果。

为什么值得关注

PhysBrain 给“物理基础模型”提出了一套相对完整的定义。这个概念借鉴语言基础模型,目标不是只让机器看懂画面,而是用一个通用模型同时处理环境理解、行动和后果预测。PhysBrain 的推进在于,它把三类输出统一为 token,并让它们共同更新同一套模型参数;数据组织也围绕“看见什么、做了什么、随后发生什么”展开。

这比单纯增加一个机器人动作模块更有野心。它试图让模型学习一条完整因果链的不同切面。即使目前的证据还主要集中在“看懂”这一段,这套统一表示和训练方法仍给物理基础模型提供了一个可检验、可扩展的工程框架。

局限与未知

  • “闭环”目前首先是训练概念。动作生成和未来预测只有定性案例,论文未给出真实机器人闭环任务的成功率,也没有证明模型能在连续部署中根据新观察反复修正动作。
  • 72.5 分、14 项开源第一和“open-source SOTA”都来自作者单一信源。虽然论文称统一了评测指标、输入分辨率和视频采帧数,但材料未提供统计误差,也没有独立复现。
  • 不同数据源保留各自坐标轴,模型依靠动作历史推断局部约定。这降低了统一数据的成本,但它跨机器人、跨控制频率迁移时能否稳定工作,现有结果还回答不了。

供稿材料 SOURCES — 1

← 返回 2026-09-17 · 学术板块