你让DeepSeek从一份长文档里找答案,内容和问题都没变,只在前面添几个无关字符,结果却可能从答对变成答错。字节Seed团队认为,这不只是随机“抽风”,还与关键信息在文本中的位置有关。
据量子位报道,团队测试DeepSeek-V4-Flash-Base补全同一段代码时,仅改变前置填充长度,答案便以4个Token为周期摆动。Token是模型读取文字的基本单位。研究者把原因指向分块KV缓存压缩:KV缓存像模型阅读长文时保存的中间笔记,分块压缩能省内存和计算,却让信息落在压缩窗口中的相对位置——也就是“相位”——影响后续检索。在128K Token、约1.6万个键值对的测试中,DeepSeek-V4-Flash-Base不同相位的准确率最大相差40.2个百分点;更新和后训练后的模型差距缩小,但周期性仍存在。
这项发现提醒我们,长上下文模型的平均分可能把“某些位置很好、某些位置很差”抹平。评测这类模型,不能只看总平均,还要把同一信息挪到不同相位反复测试。