Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
PAPER 约 1 分钟

硬约束直接接入机器人策略

ActSafeGuard把硬约束嵌进动作生成路径,让机器人从训练到执行都守住物理边界。

机械臂不能撞进桌面,也不能把关节拧过极限。常见做法是在 AI 给出动作后再拦截、裁剪,像等司机开错方向才猛打方向盘:虽然避开了越界,实际动作却可能偏离训练时学到的轨迹。ActSafeGuard要解决的,正是这种训练与执行脱节。

它面向流匹配策略——一种从随机动作出发、连续修正并生成最终动作的方法。研究者在每一步修正后加入一个可微分的射线缩放算子:若动作将越过由当前状态决定的凸形可行区域,就沿原方向缩短步幅,使结果留在边界内。更关键的是,同一层同时用于训练和执行。由于它可微分,安全边界能把“该往哪里改”的信号传回模型;遇到边界时,更新还可顺着边缘移动,而不只是被生硬截断。

按论文描述,这个组件不增加可学习网络,并可较小改动接入预训练的流匹配动作头。作者称其能逐步确定性地满足约束,同时保持任务成功率;但所给原文未披露完整实验数字,因此这里不作量化判断。


供稿材料 SOURCES — 1

← 返回 2026-09-14 · 学术板块