桌上摆着几个相似的杯子时,与其费劲描述“左边第二个”,人通常会直接一指:“拿这个。”DeicticVLA想把这种交流方式交给机器人:同一个VLA(把视觉、语言和动作连起来的模型)既能接收纯语言,也能理解“语言加指点”,还可以只看指点完成任务。
具体来说,论文用点击机器人视野中的位置来模拟指示手势,再由SAM 2把点击扩展成掩码——一张标出目标物体或落点像素的选区图。系统把三种输入统一整理成文字提示和掩码,交给同一套VLA处理。这样,“这个”“那里”不必完全依靠模型猜测语言所指,而能落实到画面中的具体区域。
最醒目的结果来自真实环境中的未见类别测试:作者报告,语言加指点和纯指点的成功率均为100%,联合训练的纯语言模式只有16.7%。这说明在陌生物体面前,直接指出目标可能比精确描述更稳。不过,论文采用的是屏幕点击,并非直接识别人手指向;100%也只对应作者设置的三项真实机器人任务,不能据此推断它已适用于开放环境。