你让机器人收拾桌面。它第一次忘了杯子放在哪,第二次又在同一步卡住。普通系统也许会在当次任务里提醒它,或者专门重训一个动作模型;但下次换张桌子、换台机器人,相似的错误还会回来。RoboFoundry 想解决的正是这件事:不只改一个模型或零件,而是让支撑机器人工作的整套系统,从执行经验中持续更新。
这里的机器人属于“具身 Agent”——它通过传感器观察环境,再控制身体行动。与聊天模型不同,它的判断会直接改变外部世界。论文作者把 RoboFoundry 称为首个采用 Self-Evolving System-as-Policy 的具身智能体框架:把记忆、上下文、技能和动作接口组成的 Agent 栈,当成一套可以优化的“策略”。本文的效果数字均来自作者论文,尚无独立复现。
真正要进化的是整台机器
传统语境里的“策略”,通常是一个从观察映射到动作的模型。RoboFoundry 换了一个观察角度:同一个基础模型,拿到什么信息、能调用哪些技能、如何把决定翻译成机器人动作,都会改变最终表现。既然实际行动由整套系统共同决定,改进对象也不该预先限定为某一个组件。
可以把它理解成一家餐厅。厨师相当于基础模型,但出餐好坏还取决于订单如何传递、备忘录记了什么、标准流程是否合理,以及出了差错怎样补救。RoboFoundry 不重新训练“厨师”,而是检查整套工作制度哪里出了问题,再修改对应部分。
系统运行分成内外两层循环。内层让机器人执行任务,保存执行轨迹——其中包括工具调用、逐步观察、机器人状态、结果和反馈。外层读取这些轨迹,诊断失败来自哪里,提出修改,再通过新的执行验证。基础模型参数保持冻结;真正变化的是模型周围的支持系统,而且修改通过文件系统保存,不会随着当前任务结束而消失。
一次补丁,怎样变成长期能力?
RoboFoundry 先做任务级修补。例如,机器人搬运方块时掉落,系统可能发现问题不在任务规划,而在失败后的恢复方式。它会从方块落到支撑面后的状态重新规划抓取,而不是机械地重复刚才的动作。
但修好一次不等于学会一类问题。系统会保存成功修改及其前后轨迹,再拿同类能力缺口在其他任务中的记录做验证。只有当一项改进在当前任务之外仍然有效,它才会被提升为通用更新,供后续任务继续使用。换句话说,这不是放任 Agent 随意重写自己,而是“诊断—修改—验证—推广”的受控循环。
作者把可进化的部分分成两面。
一面是 context system,也就是上下文系统。它同时管理当前任务里模型正在看的信息,以及跨任务保存的文件系统记忆。系统不会每一步都机械地写入,而是在值得记录的事件出现时,选择保存什么、何时取回,以及怎样放进当前上下文。例如,遮挡任务需要记住物体及其空间关系,计数任务则需要保存相关动作出现了几次。
另一面是分层技能系统。最底层是抓取、移动等 atomic skills(不可再拆的原子技能);上面是可复用的技能组合;再往上是根据失败状态组织的恢复结构。这样的分层让系统能够判断:问题究竟出在基本动作、动作编排,还是失败后的补救。
换机器人,不必把经验全部推倒
不同机器人的关节、控制方式和可用动作并不相同。RoboFoundry 因此设置了一套共享语义接口:上层只表达与机身无关的决定,例如“找到饮水设备”或“把物体转移到目标位置”;下层再把决定绑定到特定机器人的执行原语。
这相当于把“做什么”与“这副身体具体怎么做”拆开。作者据此主张,在一台机器人上演化出的语义能力,可以通过更换执行绑定迁移到另一台机器人,也能接到不同的基础模型上。论文展示了 AgileX COBOT MAGIC 平台上的操作、毛巾折叠迁移,以及 Unitree G1 人形机器人的语义导航;不过公开文本没有给出足以完整判断迁移规模的数字。
数字说明了什么?
在包含 1,128 个任务、覆盖四类环境的 EmbodiedBench 上,完整 RoboFoundry 搭配 GPT-5.5 得到平均 72.7%,原始 GPT-5.5 为 56.9%,相对提升约 27.8%。搭配 Qwen3.7-Plus 时得到 70.3%,与前者仍相差 2.4 个百分点。值得注意的是,同一模型只保留任务级修改、取消通用演化的 RoboFoundry-Lite 得到 63.2%,低于完整版本的 70.3%。这组结果支持了论文的核心判断:把反复有效的补丁提升为通用系统能力,是重要的一步。
长程记忆基准 RoboMemArena 测试转移、遮挡、计数和序列任务。RoboFoundry 的任务成功率为 53.5%,对照方法 PrediMem 为 38.5%;累计成功率则是 72.8% 对 55.2%。这些结果说明,性能差异不只可能来自动作技能,如何保存和调用经历本身也是系统能力。
面对物体布局和任务描述变化的 LIBERO-PRO,作者也报告 RoboFoundry 在多种扰动设置下优于 CaP-Agent0。加入模拟器提供的特权物体位置后,部分设置达到 100%,反过来也提示:即使系统策略能够进化,感知仍可能是瓶颈。
为什么这一步值得关注?
RoboFoundry 最有分量的地方,不是又发明了一种机器人技能,而是重新划定了“学习”的边界。过去常见的思路是挑出记忆、提示、技能或动作模型中的一个部件来优化;它则让执行历史决定该改哪里,并要求成功经验经验证后成为持久修改。
这也改变了我们判断“自我改进”的标准。Agent 在一次任务里接受反馈、临时改正,并不等于系统真的进化。只有经验改变了后续任务仍会使用的运行机制,改进才具有持续性。RoboFoundry 给出了一个具体框架,说明这种持续性可以怎样被组织和检验。
局限与未知
- “首个”和“state-of-the-art”均为作者自述。论文没有提供独立复现、误差区间或统计显著性,现阶段不能把这些结果视为定论。
- 系统会判断失败归属、提出修改并验证推广,但公开材料不足以判断诊断错误、错误修改及长期积累风险有多大。
- 真实部署只报告每项任务进行 10 次试验,材料未完整披露各机器人、各任务的成功率,也没有给出足够条件来证明“完全自主”的具身智能体已经实现。