让机器人把盘子放进纸箱,听着很简单。但如果训练时它只学过“放进金属篮”,任务一变,它可能还会照旧执行。清华大学、无问芯穹与正行创新开源的RPent,想解决的正是这个问题:把GPT-6 Astra式的任务理解和规划能力,真正接入机器人的感知与动作链路。
据量子位报道,RPent让通用大模型负责理解目标、拆解步骤,再调用VLA——把视觉、语言指令转成机器人动作的专家模型——完成精细操作。机器人执行后还会重新观察环境、检查结果并调整计划,形成“闭环控制”。演示中,它能排除错误放置位置、重新定位盘子,也会先移开遮挡勺子的碗,而不是按预设动作硬抓。
更值得注意的是,RPent会把验证成功的流程存成“任务卡”,再次执行时只按当前画面做必要调整,减少反复调用大模型。报道援引团队结果称,其在LIBERO-PRO基准测试中任务成功率为92.6%,端到端完成速度提升7倍以上;这些效果目前仍以团队披露为准。