Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.099 — 2026-10-11
PAPER HF 87 约 1 分钟

Long-WAM给机器人补上长时视觉记忆

Long-WAM让机器人真正用上更长视觉历史,同时把实时控制延迟压到可部署范围。

机器人整理桌面时,不能只看眼前一帧:杯子刚被挪过没有、任务做到哪一步,都藏在此前的画面里。但回看越久,出手越慢。Long-WAM把这对矛盾放进同一套系统设计:既延长视觉记忆,也控制等待时间。

关键发现是,“看得到历史”不等于“会利用历史”。团队先做自回归预训练——让模型按时间顺序根据过去预测未来,再把这种能力用于世界—动作模型,也就是同时理解环境变化并生成机器人动作的模型。作者报告,在RoboCasa GR-1测试中,把视觉历史从0延至19.2秒,成功率由63.3%升至78.7%;采用双向预训练的版本则没有净提升。这说明长记忆的价值,很大程度取决于模型是否提前学会从历史推断下一步。

长记忆还得跟得上现实。Long-WAM一边执行动作,一边处理新画面,并针对不同硬件加速。作者称,在RTX 5090上,每段动作连同未来画面预测耗时107.4毫秒。结果仍来自论文作者自述,但它提出了一个值得关注的系统判断:机器人的记忆长度,不能脱离训练方式和控制延迟单独讨论。


供稿材料 SOURCES — 1
01
Long-WAM: Scaling the Context of World-Action Models arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-10-11 · 学术板块