在 V4-Pro 与 V4-Flash 双旗舰跑了四个月之后,DeepSeek 给自家「小快灵」那条产品线补上了眼睛。8 月 21 日,DeepSeek 上线实验性多模态模型 V4-Flash-Vision-Exp:它在 DeepSeek-V4-Flash 的文本能力之上叠加图像理解。官方定位不是新旗舰,而是面向 agent 应用——把视觉理解与工具使用结合起来,给需要「边看边干」的工作流用。

先看成绩单:两项反超,一项还在追

据 DeepSeek 官方公布的对比数据(经 OfficeChai 整理),新模型在文本类 agent 评测上与上一版 V4-Flash-0731 几乎持平,这印证了官方「视觉版不牺牲文本能力」的说法。Terminal Bench 2.1 上,V4-Flash-Vision-Exp 拿到 83.9,略高于旧版 V4-Flash 的 82.7,距离 Opus 4.8 的 85.0 只差 1.1 分;但 NL2Repo 上差距被拉大到 57.7 对 69.7,DSBench-Hard 也落后约 8 分。

真正有信息量的是多模态侧:ApexBench(Pass@1)上视觉版拿到 36.5,对比文本版被迫忽略图像输入时的 26.2,提升了 10 分以上——虽然仍落后 Opus 4.8 的 39.4。而在 Agents' Last Exam(27.3 对 25.7)和 ZeroBench Pass@5(35.0 对 34.0)两项上,V4-Flash-Vision-Exp 直接反超了 Anthropic 的现役旗舰。Chartography 上 64.3 对 65.0,基本咬平。

需要提醒的是,这些数字出自 DeepSeek 自家的 Harness Minimal Mode 测试环境(top_p 0.95、temperature 1.0),并非独立复测,参考时请保留一分克制。

工程细节比跑分更值得关注

这次同步放出的还有一批面向开发者的基建(官方 Vision 指南):

  • 按内容识别格式:模型支持 JPEG、PNG、GIF、WebP,格式判定看文件实际字节而非文件名或 MIME 声明;
  • 384 token 封顶计费:每张图最多计 384 token,定价沿用 V4-Flash 费率;可选 detail 字段把图降采样到 512×512 省 token,处理前自动归一化到约 800×800;
  • Files API 免费:上传一次图像、按 ID 跨请求复用(单文件 64 MiB),不必每次重传;单请求最多 600 张图,单边最长 8192 像素;
  • 三协议兼容:同时支持 OpenAI 的 Chat Completions/Responses 和 Anthropic 的 Messages 端点,同日发布的 Harness 0.1.1 开箱支持新模型。

实验模型是一步便宜的棋

OfficeChai 的分析点破了这次发布的策略属性:DeepSeek 没有从零训练新旗舰,而是给已经便宜的 V4-Flash 加视觉,用最小成本把产品线延伸进多模态 agent 领域。同样的打法在 MiniMax、智谱身上也能看到:多模态能力正在下沉到中端模型,而不再是大参数旗舰的专属卖点。

对开发者的启示很直接:当「能看图的便宜模型」开始逼近旗舰的多模态基准,选型逻辑就要从「谁跑分最高」切换到「单位成本下的视觉 agent 能力」。实验标签意味着它可能随时调整或毕业,适合先在低风险工作流里试水,而不是直接押上生产关键路径。

下一轮中国实验室的竞争,未必是谁的模型最大,而是谁能让便宜快速的模型先学会看世界——这一局,DeepSeek 先出了牌。