技术背景

8 月初,大模型竞争被「同等智能成本」这条新坐标轴重新定义。OpenAI 7 月 30 日把 GPT-5.6 Terra 和 Luna 价格分别下调 20% 和 80%,直接把行业焦点从「谁的分数高」拽到了「每 1 分 Intelligence Index 要花多少钱」。DeepSeek 7 月 31 日公测的 V4 Flash 0731 正式版,正是踩着这条坐标轴交出的答卷(华泰证券 8 月 5 日研报)。

核心数据:50 分跑分 + 60% 成本差

Artificial Analysis 7 月 31 日发布的官方评测给出了 V4 Flash 0731 的核心数据:

  • Intelligence Index v4.1: 50 分,比前代 V4 Flash(40 分)直接高 10 分,比同系列 V4 Pro(44 分)高 6 分;比 GPT-5.6 Luna 最高档(51 分)只低 1 分(Artificial Analysis 文章)。
  • 单任务成本比 GPT-5.6 Luna 低约 60%——即便是 Luna 80% 降价后,这 60% 差距仍然存在(同源 Artificial Analysis 评测)。
  • Agent 评测跃升明显:GDPval-AA v2 跑分从 1189 升到 1559,Terminal-Bench 2.1 升 17 分到 79%,τ³-Bench Banking 升 8 分到 31%。
  • Hallucination 率下降 12 个百分点到 84%,跟 GPT-5.6 Terra(85%)、Mistral Medium 3.5(82%)处于同一档。
  • 总输出 token 数下降 12%——在分数上升的同时,模型的输出更「干净」。

架构与定价:没换骨架,只换后训练

V4 Flash 0731 没有换任何架构,延续了 V4 Flash 预览版的纯文本 MoE 设计:

  • 总参数 284B,单 token 激活 13B;
  • 上下文窗口 1M token,最大输出 384K token;
  • 43 层 Transformer 混合注意力(前两层纯滑动窗口 + 后续层交替使用 CSA / HCA 压缩注意力);
  • mHC 超连接 + Muon 优化器(同系列架构设计);
  • 官方 API 定价 /bin/bash.14 / /bin/bash.28 每 1M input/output tokens,跟 V4 Flash 完全一致;
  • Cache hit 折扣 98%——远高于业内常见的 90%(Artificial Analysis 文章原话)。

后训练层面,V4 Flash 0731 重点把 Agent 能力拉了上来:DeepSWE 从预览版的 7.3 拉到 54.4(涨 7.5 倍),Terminal-Bench 跑到 82.7,逼近 Claude Opus 4.8 的 85(aitoollab 评测)。

在国产模型坐标系里的位置

按华泰证券 8 月 5 日研报与 Artificial Analysis 测评综合看:

  • 能力上限:Kimi K3 57 分仍是当前国产开放权重模型的天花板;
  • V4 Flash 0731 在 50 分档位,比 GLM-5.2(51 分)低 1 分,比 Gemini 3.6 Flash(50 分)持平;
  • 性价比地板:V4 Flash 0731 混合价格约 0.06 美元/百万 token、平均任务成本约 0.03 美元,比 Luna 分别低约 65% 和 57%(华泰证券同源研报);
  • 完整权重「将在未来几周内发布」(Artificial Analysis 原话),Unsloth 的 GGUF 量化版已经可以本地跑。

个人评论

V4 Flash 0731 的真正信号,不在 50 分这个数字本身——它跟 Gemini 3.6 Flash 持平,只比 Luna 落后 1 分,优势有限;真正的信号是它在不换架构、只做后训练的情况下,把 Agent 能力抬到能跟旗舰模型正面竞争的位置。这说明 DeepSeek 已经把「权重 → 能力」这个映射的边际收益打到了非常高的水平,后续的迭代速度会越来越快。

更值得注意的是 cache hit 折扣:98% vs 业内常见 90%,这 8 个百分点的差距在长上下文 Agent 场景里是数量级的影响——一次 1M token 的对话如果 90% 走 cache,DeepSeek 实际收费的 token 数只有 100K,而不是 1M。OpenAI 这次 80% 降价是「让用户看到便宜」,DeepSeek 是「让 cache 真正便宜」,两者的设计哲学完全不同。

国产模型已经形成「Kimi K3 抢能力上限、V4 Flash 0731 抢性价比地板」的双线格局,跟 OpenAI 的「Sol 保利润 + Luna 抢市场」正好镜像。下一轮值得关注的,是 V4 Flash 0731 完整权重开源后,本地部署生态能不能把这个 60% 成本差再放大一次。