Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
NEWS 约 1 分钟

SmoothRL让机器人边推理边训练

SmoothRL只从机器人真正执行的动作中学习,让训练追上不停顿的异步推理。

IMAGE — 量子位

机器人投掷物体时,不能挥到一半停下来等大模型想好下一步;可让机器人边动、模型边算,又会产生新的麻烦:模型一次生成的一小段连续动作(action chunk),可能只有部分真正执行,其余会被新计划替换。如果强化学习把整段计划都拿来复盘,没发生的动作也会因成功“记功”、因失败“背锅”。

星尘智能(Astribot)的 SmoothRL 是一套异步在线强化学习框架——机器人持续工作,系统同时根据实际结果继续训练。它把每段动作分成已确定执行、当轮实际执行和将被丢弃三部分,只用实际执行的部分更新策略,并让训练也采用与部署相同的异步节奏。

据团队披露,在 S1 真机投掷实验中,模型每次预测 32 帧动作,真正属于当轮执行的只有 6 帧,另有 20 帧会在执行前被覆盖。SmoothRL 因而瞄准的不是单纯提高模型能力,而是减少机器人等待推理的空转,同时避免训练“对错账”。作者报告投掷成功率在累计 250 个 rollout episodes 的评估节点由 39% 升至 94%;但目前推理仍须满足预设延迟预算,基础策略太弱时,局部修正也无法凭空补救。


供稿材料 SOURCES — 1

← 返回 2026-09-05 · 科技板块