你让一个编码 Agent 改网页,它读完代码、跑过测试,然后告诉你“一切正常”。可你打开页面,按钮被挤出屏幕,错误提示还盖住了输入框。问题在于,代码和测试只记录了系统做了什么,不一定能告诉模型页面看起来怎样。
DeepSeek-V4-Flash-Vision-Exp 想补上这块缺口。它是 DeepSeek-V4 系列首个实验性多模态模型——“多模态”指模型不仅能处理文字和代码,也能接收图像。据 DeepSeek 发布在 Hugging Face 的模型页面,它在 DeepSeek-V4-Flash 架构上加入视觉模块,再通过持续训练获得图像理解能力。简单说,V4 的 Flash 路线第一次“长出眼睛”。这里的“首次”仅指 DeepSeek-V4 系列,不能扩大为 DeepSeek 的首个视觉模型。
目前关于模型结构、成绩和运行方式的信息主要来自这一份官方模型页面,尚缺少独立复测。因此,下面的效果数字应视为官方报告,而不是已经得到外部验证的结论。
眼睛对编码 Agent 有什么用?
视觉语言模型(VLM)是能同时理解图像和文字的模型。放进编码工作流后,它可以读取网页截图、软件界面和程序运行结果。于是,Agent 不只检查“测试有没有通过”,还可以检查“页面到底有没有修好”。
这改变的是反馈闭环。纯文本 Agent 像一位只能读施工记录、不能去现场验收的维修员;加入视觉后,它至少可以看一眼完工照片。如果截图仍显示错位、白屏或错误页面,Agent 就有机会继续修改,再截图复查。视觉不能保证它一定判断正确,但能把过去根本看不见的一类问题送进模型的判断范围。
官方成绩说明了什么?
DeepSeek 报告称,新模型在文字类 Agent 任务上大体保持了 DeepSeek-V4-Flash-0731 的水平,同时提升了多模态 Agent 能力。
最明显的一项是 ApexBench 的 Pass@1——模型第一次尝试便完成任务的比例:Vision-Exp 得到 36.5,旧版为 26.2。需要注意,官方注明旧版会忽略输入中的多模态内容,因此这组差距首先证明“能看图”比“直接跳过图片”更合适,不能单凭它判断视觉能力已经领先。
在 Agents’ Last Exam 上,新模型为 27.3,高于旧版的 25.2,也高于表中 Opus-4.8 的 25.7。另两项多模态测试中,它在 Chartography 得到 64.3,接近 Opus-4.8 的 65.0;ZeroBench 的 Pass@5 为 35.0,略高于后者的 34.0。这里的 Pass@5 指允许模型尝试五次后至少成功一次的比例。
文字任务没有因接入视觉而一致退步。比如 DeepSWE 从 54.4 升至 59.3,并高于表中 Opus-4.8 的 58.0;但 Cybergym 从 76.7 降至 75.3。更稳妥的解读是:官方数据支持“加入视觉后,文字 Agent 能力仍大致可比”,而不是所有任务都变强。
从云端实验变成可自行部署
据 DeepSeek API Docs 与 Hugging Face 页面整理,这次发布分成两步。2026 年 8 月 21 日,DeepSeek 先把 Vision-Exp 放进自家 API——开发者通过网络请求调用模型的接口——当时没有承诺开放模型文件。8 月 31 日,官方又上传了完整权重、分词器和推理代码,并采用 MIT 许可证。十天之内,它从云端实验服务变成了开发者可以自行部署和改造的开放权重模型。
仓库给出了 Transformers、vLLM、SGLang 和 Docker Model Runner 等调用或部署入口。Transformers 是 Hugging Face 维护的模型加载与推理工具库;vLLM 和 SGLang 则常用于把模型运行成可供其他程序调用的服务。仓库还包含视觉编码器、图文对齐组件及最小 PyTorch 推理实现,并支持 OpenAI 风格的图文消息和简化的图片路径写法。
这对本地编码 Agent 尤其值得关注。过去,是否加入视觉常常意味着要在能力与资源之间取舍:图像会被转换成视觉 Token——模型处理图片时使用的信息单位——还需要额外的图像编码过程,通常会增加显存压力。显存是显卡运行模型所用的高速内存。如今 Flash 路线开放视觉权重,至少让开发者有机会把“截图验收”接进自己的工作流,而不必完全依赖云端接口。
局限与未知
- 官方页面没有披露参数规模、具体显存需求,也没有说明视觉模块带来多少额外计算开销。本地用户能否以常见硬件顺畅运行,目前无法判断。
- 所有基准成绩都来自官方单一信源,尚无独立测试。模型页面称其视觉能力获得“显著提升”,现阶段不宜据此宣称效果领先。
- 页面中的部分自动生成调用示例与视觉任务并不完全对应,例如用纯文本请求演示视觉模型。因此,列出某套工具不等于每条模板都已经过完整兼容性验证。
真正值得看的,不只是 DeepSeek 又多了一个能识图的模型,而是视觉正进入编码 Agent 的日常闭环:读代码、运行程序、看截图、再修改。V4 Flash 已经迈出这一步;它是否足够省资源、稳定,并能在真实项目里可靠发现界面错误,还要等待独立复测。