你让 AI 读一部长篇小说,再追问开头埋下的线索,它不只要“记得住”,还要付出越来越高的计算和显存成本。文本越长,传统注意力机制需要处理的词元关系通常越多。DeepSeek-V3.2-Exp 想解决的正是这笔长文本账:少算一些不重要的关系,同时尽量保持原有输出效果。
更值得注意的是,技术更新和商业动作同时发生。2025 年 9 月 29 日,DeepSeek 发布这款实验性模型,并把 API——其他软件调用模型、按用量付费的标准接口——价格下调超过 50%。不过,“长文本提效”和“API 降价”是两件相关但不能画等号的事:现有材料没有给出不同文本长度下的成本曲线,也没有证明降价完全来自新技术。
本文的模型表现、效率与价格信息均来自极客公园对 DeepSeek 官方文章的转述,关键结论只有一个独立信源,具体数字也有限。
它到底改了什么?
DeepSeek-V3.2-Exp 建立在 V3.1-Terminus 之上,核心变化是引入 DeepSeek Sparse Attention,简称 DSA。
“注意力”可以理解为模型阅读时寻找上下文关联的过程。传统做法倾向于广泛比较文本中不同位置的关系;稀疏注意力则只重点计算其中一部分更相关的关系。像读一份几百页的报告时,先找目录、关键词和相关章节,而不是让每一句话都同全文逐句核对。它承担的角色,是降低长上下文训练和推理的开销。
据极客公园转述的官方说法,DSA 在“几乎不影响模型输出效果”的情况下,大幅提高了长文本训练和推理效率。DeepSeek 将新旧模型的训练设置对齐后,在各领域公开评测中,V3.2-Exp 与 V3.1-Terminus 的表现基本持平。
这个“持平”很重要。它说明此次更新的主线并不是让榜单分数全面超过旧模型,而是在尽量守住效果的同时提高效率。换句话说,V3.2-Exp 更像一次计算方式的实验,而不是一次已被证明全面变强的能力跃迁。
模型及相关论文当时已在 Hugging Face 和 ModelScope 公开。DeepSeek 还开源了两类主要 GPU 算子——在图形处理器上执行具体计算任务的程序:一类用 TileLang 编写,便于调试和快速试验;另一类用更底层的 CUDA 实现,追求更高效率。
降价为什么比跑分更值得看?
DeepSeek 当时宣布,API 新价格立即生效,整体降幅超过 50%;官方 App、网页端、小程序和标准 API 也默认切换到 V3.2-Exp。对开发者来说,这意味着把模型嵌入产品后的调用费用直接下降。它不是所有 DeepSeek 产品统一“半价”,而是一次 API 服务价格调整。
这件事还有行业记忆。据 Reuters 报道,DeepSeek 在 2024 年 5 月发布 V2 后,其定价曾引发中国大模型价格战;阿里云随后将部分模型价格最多下调约 97%,腾讯也让轻量版混元免费,并下调其他版本价格。因此,V3.2-Exp 的意义不只在一张新价目表。DeepSeek 是中国主要的大模型开发商之一,它再次大幅降低调用价格,可能迫使其他服务商重新评估推理服务定价。
但这种影响目前只能说“可能”。材料没有提供竞争对手的后续动作,也不足以确认新一轮价格战已经发生。
局限与未知
- V3.2-Exp 是实验性模型,也就是用于提前验证新架构和能力的版本。公开评测基本持平,不代表它在所有真实应用中都同样稳定,也不能写成全面优于 V3.1-Terminus。
- 官方没有披露上下文长度、吞吐量、延迟、显存占用或不同文本长度下的成本数据。“大幅提升效率”和“几乎不影响效果”仍缺少逐项数字支撑。
- DeepSeek 当时曾把 V3.1-Terminus API 保留至 2025 年 10 月 15 日,价格与新版相同,方便用户对比。这个期限已经过去,现有材料不能说明旧接口目前是否仍可访问。