Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.098 — 2026-10-10
NEWS 13 信源 约 1 分钟

DeepSeek为何时强时弱

Seed发现,关键信息只挪几个Token,DeepSeek的长文检索表现就可能周期性起伏。

IMAGE — DeepSeek (via Google News)

你让DeepSeek从一份长文档里找答案,内容和问题都没变,只在前面添几个无关字符,结果却可能从答对变成答错。字节Seed团队认为,这不只是随机“抽风”,还与关键信息在文本中的位置有关。

据量子位报道,团队测试DeepSeek-V4-Flash-Base补全同一段代码时,仅改变前置填充长度,答案便以4个Token为周期摆动。Token是模型读取文字的基本单位。研究者把原因指向分块KV缓存压缩:KV缓存像模型阅读长文时保存的中间笔记,分块压缩能省内存和计算,却让信息落在压缩窗口中的相对位置——也就是“相位”——影响后续检索。在128K Token、约1.6万个键值对的测试中,DeepSeek-V4-Flash-Base不同相位的准确率最大相差40.2个百分点;更新和后训练后的模型差距缩小,但周期性仍存在。

这项发现提醒我们,长上下文模型的平均分可能把“某些位置很好、某些位置很差”抹平。评测这类模型,不能只看总平均,还要把同一信息挪到不同相位反复测试。


供稿材料 SOURCES — 13
11
DeepSeek“抽风”原因找到了 DeepSeek (via Google News) · NEWS
原文 ↗

← 返回 2026-10-10 · 科技板块