Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
PAPER HF 165 约 7 分钟

视频助手开始学会何时开口

OneStreamer边看边做笔记,还学习何时开口,让视频模型从被动问答走向实时助手。

你在看一场直播:孩子们先在楼上黄色小桌旁读书,几分钟后镜头已经切走,你才问“他们可以去哪里看书?”视频助手既要记得早先的细节,又不能因为翻找旧画面而错过眼前的新动静。更难的是,它还得判断证据是否已经够了:太早回答会猜错,太晚回答又失去实时助手的意义。

OneStreamer 想把这三件事放进同一个过程:边看,边留下以后可能有用的记录,边判断何时应该开口。这里的“流式视频模型”,指视频仍在播放时便持续处理画面的模型;“主动响应”(Proactive Response)则意味着它不必等用户反复追问,可以在证据充分时自行回应。

论文作者报告,参数规模为 4B(约 40 亿参数)的 OneStreamer 在所比较的模型中,于八个流式视频理解与主动响应基准上都取得最高结果。不过这些数字全部来自 OneStreamer 论文自身;论文目前是 arXiv 预印本,材料没有提供同行评审、第三方复现或代码开放情况。因此,更值得看的不是一句“全面领先”,而是它提出的路线:让记录事实与回答问题变成同一种生成行为。

先做通用笔记,再等问题出现

普通视频问答常常围绕一个已经知道的问题寻找证据。真实直播却不是这样。模型看到某个动作时,并不知道几分钟后用户会问什么。早先看似无关的一张桌子、一本书或一次人数变化,都可能突然变得重要。

OneStreamer 因此使用“查询无关记忆”(Query-independent Memory):问题还没出现,模型就先保存可能有用的事实。可以把它理解成看直播时做通用笔记,而不是拿到考题后才回头找答案。

这套机制名为 Proactive Hierarchical Caption Memory,简称 PHCM,即“主动分层字幕记忆”。它写两种笔记。第一种是局部细节描述,记录短时间内出现的物体、动作、场景和状态变化;第二种是较稀疏的事件摘要,只在一段事件结束后概括整体发生了什么。前者像逐段速记,后者像阶段小结。每条记录都与来源时间段对应,而且只能描述当时已经出现的内容。

模型处理新画面时,只保留近期视觉窗口,也就是最近一段画面的视觉信息。更早的画面离开窗口后,其文字记录仍留在上下文里。这样,模型回答后来问题时,可以同时读取“眼前画面”和“过去笔记”,不必重新访问全部历史视觉特征。

这不只是推理阶段临时外挂的记事本。训练时,OneStreamer 也要根据截至当前时刻已经看到的视频片段生成字幕。作者把记录证据和回答任务统一为一个连续生成过程:模型用不同控制标记表示继续观察、写局部记录、写事件摘要、暂时等待或正式回答。换句话说,它同时学习“现在处于什么状态”和“此刻该写什么”。

难点不只是答什么,而是什么时候答

主动助手很容易学成一个沉默的助手。视频的大多数时刻并没有新答案,训练数据里“继续等待”的状态会远多于真正开口的时刻。如果每个时间点一视同仁地监督,重复的沉默标签可能淹没少数关键决定。

OneStreamer 为此提出 Proactive State Transition Learning,简称 PSTL,即“主动状态转换学习”。它保留所有会触发输出的关键位置,再从“状态发生变化”和“状态继续维持”的位置中挑选有代表性的样本。没被选中的状态标记仍留在完整序列里,只是不参与状态损失的计算;字幕和回答文本仍接受完整监督。

这个设计的重点不是单纯少教一些,而是有选择地教。作者的消融实验中,PSTL 只监督了 27.5% 的已标注状态 token——token 可以理解为模型处理文本和控制信号时的基本单位——却在 ProactiveVQA、OmniMMI 和 OVO-Timing 上分别得到 48.7、36.6 和 41.6。使用全部状态、采用普通交叉熵损失的结果分别为 26.1、30.8 和 1.5;同样只保留 27.5%、但随机抽取状态的版本则为 26.6、27.4 和 1.4。这说明论文所报告的提升不能仅用“监督变稀疏了”来解释,挑哪些时刻更关键。

记忆没有挤掉眼前画面

长期记忆通常有一笔隐性成本:模型保留的历史越多,有限上下文就越拥挤,当前画面的细节反而可能被稀释。OneStreamer 的选择是把远处历史压成文字,同时给近期视觉信息留出固定空间。

在使用同一模型检查点和 Recent-16 近期视觉窗口的实验中,只看近期画面的 FIFO 方案在 OVOBench 的历史问答 ASI 指标上得到 63.5;保留生成字幕的 PHCM 提升到 71.6。与此同时,OVOBench 实时感知由 80.9小幅升至81.4,StreamingBench 实时感知由86.3升至86.9。也就是说,按作者的实验,留下文字笔记改善了对过去的追问,并未以实时感知下降为代价。

成本差异也很直观。在一段 360 秒的 OVOBench 样本上,保留完整视觉历史需要 62,094 个上下文 token、25.18 GB GPU 显存,首次输出等待时间为 4.560 秒。PHCM 使用 4,308 个 token、9.98 GB 显存,等待时间为 0.124 秒。相较只保留近期画面的 FIFO,它多出 1,272 个 token、0.29 GB 显存和 0.030 秒。作者据此认为,文字记忆用较小额外开销换来了对远处证据的访问。

数据也必须知道“证据何时够了”

为了训练这套行为,作者构建了 OneStreamer-1M,包含超过 100 万条 records,即训练记录,而不是 100 万个独立视频或全人工标注样本。数据由合成的流式字幕与问答,加上清洗后的开源数据组成。

其关键不只是给出答案,还要给答案安排合理时刻。局部字幕要等对应画面已经出现,事件摘要要等事件完成;问答则先定位证据区间,再寻找最早能够可靠支持答案的时间点。训练序列由此形成一条时间线:证据尚未出现时保持安静,证据正在形成时进入等待状态,足够回答时才输出。

这正是 OneStreamer 最值得关注之处。它没有把感知、记忆和开口时机拆成三个互不相干的模块,而是让模型通过同一种主动生成过程完成三件事。流式视频助手因而不再只是“等人提问的视频搜索框”,而开始接近一个持续在场的观察者:它知道哪些事情值得记,也学习何时证据已经足以打断沉默。

局限与未知

  • 八个基准上的领先均为作者自报。不同基准的分数尺度也不相同,不能横向比较,更不能据此概括为所有视频场景中的全面领先。
  • PHCM 保存的是模型自己生成的文字记录。论文展示了它对历史问答的帮助,但供稿没有给出错误记忆如何累积、修正或遗忘的系统分析。
  • 效率数据来自一个 360 秒样本;主动响应和 PSTL 的结果也缺少误差范围与第三方复现,真实长时直播中的稳定性仍待验证。

供稿材料 SOURCES — 1

← 返回 2026-10-05 · 学术板块