Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.078 — 2026-09-20
PAPER H 4 · HF 40 约 1 分钟

动作Token不该再一刀切

ActionPiece不只压低动作误差,还尽量保住细微动作之间的远近关系。

机器人伸手抓杯子时,手腕偏一点、夹爪早合一点,都可能让结果不同。但模型常把这些连续动作压成有限的“动作词汇”,再像写句子一样逐个预测;压缩后,每个动作看似误差不大,原本适应不同场景的细微差别却可能缩小,甚至颠倒。

ActionPiece重新设计了这一步。它为自回归VLA——同时理解画面、指令并生成动作的模型——提出PRC指标,检查动作压缩再还原后,邻近动作之间“谁更近、谁更远”的顺序是否保留。训练时,它不仅降低均方误差,也同时约束动作特征和离散词码的分配关系。说白了,它不只要求每个点大致准确,还要求整组动作的相对结构别乱。

在相同的Qwen3-VL-4B训练设置下,作者报告ActionPiece在LIBERO成功率为94.8%,比最强对照高1.1个百分点;在未见过的LIBERO-Plus场景中达到68.8%,高4.5个百分点。社区获得39个点赞也说明,动作Token正从实现细节变成机器人模型的新竞争点。


供稿材料 SOURCES — 1

← 返回 2026-09-20 · 学术板块