你抱着箱子走向货架时,真正忙碌的不只是双手:脚要调整位置,躯干要下沉,身体还得随时维持平衡。如果箱子太低,你会蹲下;腾不出手时,甚至会用脚把它推过去。对人来说,这些动作几乎不用思考。对人形机器人来说,它们却是一个彼此牵制的控制难题。
Workhorse想解决的正是这件事:让机器人从人类示范中学习接触密集的全身移动操作。所谓“接触密集”,是指手、脚、身体和物体频繁接触,细小的位置或力度偏差都可能改变结果。更重要的是,示范时不需要机器人在场。研究团队让人穿戴追踪设备完成任务,再把记录到的人体动作教给人形机器人。
论文在真实 Unitree G1 上展示了搬箱、踢箱、接住抛来的箱子,以及推倒并爬上行李箱等动作。不过,这些真实机器人结果属于能力演示;论文只在仿真中报告了成功率。以下数据与效果均来自该论文,尚无独立信源交叉验证。
不教关节,先教五个关键部位
传统做法常把人的动作转换成某台机器人的关节角度。这个过程叫重定向(retargeting):需要解决人的身体比例、关节结构与机器人不一致的问题,也通常要针对每种机器人重新设计。
Workhorse换了一个接口。它不直接告诉机器人每个关节转多少,而是记录五个部位的姿态:躯干、左右手腕、左右脚。可以把它理解成给机器人标出五个关键落点——身体朝哪里,两只手要到哪里,两只脚又该踩在哪里。至于膝盖和手臂如何弯曲,由控制器自己解决。
人类示范通过五个 HTC Vive 穿戴式追踪器记录:一个随胸前摄像机移动,另外四个装在手背和鞋面。胸前相机同时拍下示范者第一视角的 RGB 画面,也就是普通彩色图像。五个部位的姿态处在同一个与重力对齐的坐标系中。
这里的“无需重定向”需要说准确。系统没有把整段人体动作缩放、改造成机器人的关节轨迹,五个部位的记录姿态直接成为学习目标;但它仍要测量追踪器、人体关键位置与机器人对应部位之间的固定关系,也会用逆运动学——根据手脚目标反推关节姿势——辅助训练和图像处理。它并不是把一段原始视频直接扔给模型,就自动得到机器人技能。
一个负责看路,一个负责动起来
系统分成两层。
第一层是视觉规划器。它读取机器人胸前相机的画面,以及最近一段五部位运动历史,预测接下来躯干、手腕和双脚应该到达的姿态。运动历史还包含躯干高度和“投影重力”:也就是机器人根据自身坐标感受到的重力方向,用来判断身体是否倾斜。
第二层是全身跟踪器。它通过强化学习训练——让策略在仿真中反复行动,再根据奖励改进——把五部位目标转换成连续的关节控制,同时尽量保持自然姿态和平衡。跟踪器只依赖本体感知,也就是机器人对自身关节角度、速度和身体状态的感知。
这很像“先画路线,再负责落脚”:规划器决定身体下一步想去哪里,跟踪器处理具体动作和稳定性。两者分别训练,却使用同一批人类姿态记录。任务空间中的五部位姿态成为它们之间的共同语言。
这也解释了它为什么有机会迁移到不同机器人。五部位目标不是某台机器专属的关节指令。换机器人后,研究者仍需测量五个对应位置,替换仿真模型并重新训练两套策略,但不必重新录制人类示范。论文用同一批数据为第二种人形机器人 Unitree H2 重新训练了系统,不过结果目前只有仿真。
真正难的是两层之间会互相犯错
如果规划器和跟踪器永远准确,分层并不难。问题在于部署时,规划器会根据带误差的动作历史继续预测;跟踪器也未必能完全执行规划结果。误差会在闭环中不断传递。机器人被推一下后,这个问题更明显:原计划仍停留在旧位置,身体却已经偏离。
Workhorse的关键处理,是让两层在训练时提前见过对方可能制造的麻烦。
训练视觉规划器时,研究团队给五部位历史加入逐渐累积的漂移,并同步扭曲相机图像,让画面变化与身体偏移保持一致。训练全身跟踪器时,则模拟规划指令在一段时间内漂移、重新规划时突然跳回的情况。换句话说,两层没有一起端到端训练,却分别接受了针对另一层误差的数据增强。
图像本身也存在落差:人类示范画面会拍到人的身体,部署时相机看到的却是机器人。团队先从训练图像中分割并移除示范者,再估计背景深度,最后把仿真中的机器人渲染进画面。这样,规划器训练时看到的主体更接近部署状态。
它展示了什么
在真实 Unitree G1 上,机器人会连续处理三个箱子:用双手把两个箱子放到上层货架,再把第三个箱子踢进下层。演示中有人推、踢机器人,或直接把它正要拿的箱子取走。跟踪器负责避免摔倒,规划器根据新画面继续任务,重新伸手或走向附近的箱子。
另外两项演示更能说明“全身”二字。机器人会用双手接住抛来的箱子并放下;也会推动行李箱,用手和一条腿把它压倒,踩上行李箱取下高处的箱子,再跳下来。这些结果说明系统能够生成手脚参与方式不同的动作,但论文没有提供真实机器人的量化成功率,因此不能据此判断它在更广泛场景中的可靠性。
量化评测来自示范房间的仿真副本。每种设置运行100次:完整系统在无推搡时完成三个箱子分拣的成功率为77%;向骨盆施加随机方向、总冲量为40 N·s的推搡后,成功率为64%。这里的 N·s 是冲量单位,并非持续施加40 N推力。
消融实验也支持“让两层预习彼此误差”的设计。在受推搡条件下,移除规划器的数据增强后,成功率从64%降到0%;移除跟踪器的指令增强后,成功率降到52%,跌倒比例从15%升到23%。如果改用机器人关节指令连接两层,受推搡时成功率为42%。这些数字只适用于论文构建的固定仿真环境,不能直接外推到真实世界。
使用同一批示范重新训练后,模拟 H2 在无推搡条件下的箱子分拣成功率为83%。它与 G1 的77%并非严格的跨机器人同条件能力比较:两者都重新训练过,而且论文指出,100次测试下两组比例之差小于统计区间所能清楚分辨的范围。
为什么值得关注
我们此前报道的 Astra,关注的是从普通图像直接决定机械臂目标,但精密操作和双臂协作仍较弱。Workhorse把问题推进到更复杂的人形机器人:不仅要决定手往哪里去,还要让躯干和双脚共同参与,同时维持平衡。
它最有意思的地方,不是某一个演示动作,而是数据路径。机器人示范通常需要占用昂贵设备,还需要熟练操作者。Workhorse把示范采集搬到人身上,再用五个关键部位作为人与不同机器人之间的中间语言。它没有消除仿真、控制和数据处理成本,但展示了一条把相对便宜的人类动作数据变成可执行全身技能的路线。
局限与未知
- 每项任务都有独立的视觉规划器和全身跟踪器,目前不是一套能自由处理多种任务的通用策略。
- 所有数据由一名示范者在一个房间采集,测试也只发生在该房间或其仿真副本中;Lighthouse基站还限制了采集范围。
- 真实 G1 只有演示性结果,H2 只有仿真结果。系统也没有描述手指和头部状态,因此还不能处理需要精细手指控制或主动转头观察的任务。