机械臂不能撞进桌面,也不能把关节拧过极限。常见做法是在 AI 给出动作后再拦截、裁剪,像等司机开错方向才猛打方向盘:虽然避开了越界,实际动作却可能偏离训练时学到的轨迹。ActSafeGuard要解决的,正是这种训练与执行脱节。
它面向流匹配策略——一种从随机动作出发、连续修正并生成最终动作的方法。研究者在每一步修正后加入一个可微分的射线缩放算子:若动作将越过由当前状态决定的凸形可行区域,就沿原方向缩短步幅,使结果留在边界内。更关键的是,同一层同时用于训练和执行。由于它可微分,安全边界能把“该往哪里改”的信号传回模型;遇到边界时,更新还可顺着边缘移动,而不只是被生硬截断。
按论文描述,这个组件不增加可学习网络,并可较小改动接入预训练的流匹配动作头。作者称其能逐步确定性地满足约束,同时保持任务成功率;但所给原文未披露完整实验数字,因此这里不作量化判断。