Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.079 — 2026-09-21
PAPER H 34 约 1 分钟

模型开始自己决定何时回看上下文

模型先看近处,必要时才回查完整历史,减少长上下文的重复扫描。

和人翻聊天记录一样,AI 回答长对话时未必每句话都要从头重读。但常见的完整注意力——模型生成当前词时扫描全部历史——每一步都会这么做,上下文越长,成本越高。On-Demand Attention(ODA,按需注意力)改成先只看最近一段,再由“召回头”判断这一步是否值得回查完整历史;它像一道门卫,只在预计能改善预测时开启更昂贵的全局注意力。

最关键的是,这个判断器只读取模型当下已有的状态,不改动预训练模型参数,完整的历史 KV Cache——模型保存的上下文中间结果——也始终留着,随时可查。作者报告,在 Qwen3-1.7B 的 RULER16K 测试中,单用局部注意力得分为 19.23;ODA 仅在 41.6% 的路由步骤调用完整注意力,得分达到 81.17,接近始终读取全部历史的 81.94。结果仍来自论文作者在特定模型与测试上的实验,但它提示了一条实用方向:让模型自己决定何时“翻旧账”,可能减少长推理和 Agent 任务中的反复扫描。


供稿材料 SOURCES — 1
01
On-Demand Attention: Language Models Know When to Recall arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-21 · 学术板块