一、Preview 不算数,正式版看的是后训练

2026 年 7 月 31 日,DeepSeek 在 API 文档的更新日志里抛下一条信息密度极高的改动:DeepSeek-V4-Flash-0731 正式版 API 公测。调用方式不变,模型名字符串仍然是 deepseek-v4-flash,但背后发生的事情和四月那份 preview 完全不同——也完全相同。

完全不同的,是分数。DeepSeek 同步放出的基准对比表显示,0731 这版 checkpoint 在 Code Agent 类任务上的表现全面反超 V4-Pro 预览版:Terminal-Bench 2.1 82.7(预览 61.8、Pro 72.1)、Cybergym 76.7(预览 38.7、Pro 52.7)、DeepSWE 54.4(预览仅 7.3、Pro 12.8)、Toolathlon-Verified 70.3(预览 49.7、Pro 55.9)、DSBench-FullStack 68.7DSBench-Hard 59.6。这是一个 13B 激活的轻量模型,在 Agent 工作流这种最值得花钱的赛道上,把自家还没转正的旗舰打回了未达预期。

完全相同的,是架构。Hugging Face repo 写得很直白:0731 与 preview 共享同一套权重拓扑,预训练后的 32T tokens 数据不动、284B 总参 / 13B 激活的 MoE 结构不动、1M token 上下文不动、CSA + HCA 混合注意力不动、mHC 残差不动、Muon 优化器不动。DeepSeek 在不动一分钱新算力、不重训一个 token 的前提下,只靠后训练把模型从「会写代码但不会当 Agent」拉到了「能跑通 Responses 流程、Codex 也能调用」。开源阵营第一次看到一条清晰的「轻量迭代」信号:权重发布之后,模型还能再变。

二、0731 真正变了什么:三条工程流水线

DeepSeek 没有公开后训练的具体配方,但从 release notes、Hugging Face model card 与 vLLM 启动命令三处交叉来看,0731 这一版至少叠了三层 infra 级的能力。

第一层是 DSpark 推测解码默认装载。0731 的 checkpoint 直接挂载了 DeepSpec 团队的 DSpark 模块,作为权重的一部分下发;vLLM 跑这条 0731 时只要加一行 --speculative-config {\"method\":\"dspark\",\"num_speculative_tokens\":7,\"draft_sample_method\":\"greedy\"} 就能启用。DSpark 论文里测的是 60%–85% 的端到端首 token 之后的吞吐提速,且是无损的——这对 Code Agent 这种「每步都要再生成几十 token」的负载,是直接的延迟红利。

第二层是 Responses API 和 Codex 适配。0731 是 DeepSeek API 第一次原生支持 OpenAI 的 Responses 形态,且为 Codex 做了专门的工具调用与上下文适配。这意味着开发者把 OpenAI 客户端切到 DeepSeek 后端几乎是「把 base_url 改一下、把 model 字段改成 deepseek-v4-flash」这一笔成本的事——不需要再维护 adapter。

第三层是 reasoning_effort 的三档可控reasoning_effort 现在支持 lowhighmax。DeepSeek 的推荐采样参数是 temperature=1.0,top_p=0.95(agentic)、1.0(其它),highmax 档位建议最大输出长度 384K tokens。换句话说,0731 可以像 Claude Opus 4 系列那样在「快答模式」与「深推理模式」之间动态切档,且切的是真实训练过的能力,不是 prompt 层的小把戏。

三层叠在一起,0731 的本质是:同样的预训练、不一样的后训练 + 不一样的 decode 拓扑 + 不一样的 API 形态,带来不一样的 agent 表现。这是一个把 LLM 当「持续部署服务」而不是「一次性模型发布」来运营的范例。

三、价格为什么重要:把 Agent 主线打成基础设施级支出

0731 的定价彻底把这张牌摊明:

  • 输入:低 / 百万 token(命中缓存低)
  • 输出:0.28 / 百万 token

作为对比,V4-Pro 的输出价是 0.87 / 百万 token——Flash 只有 Pro 的三分之一。更直接的对比是 Claude Opus 4.8 的 5 / 25 与 OpenAI Codex 的 5 / 30。0731 把 Terminal-Bench 82.7 这种 Agent 主流基准,做到了 Opus 4.8(85.0)价的 5%。在 Agent 这条主线上,LLM 调用第一次具备了「按基础设施预算」立项的可能性,而不是「按 SaaS 预算」立项。

四、自托管的边界:开源不是万能药

0731 的 MIT 许可证让任何人都能拉下来自己部署,但 304B 参数(含 DSpark 草稿模块)的总量决定了 serving 门槛。DeepSeek 官方给的 vLLM recipe 是单节点 4×GB300;Unsloth 的无量化 dynamic GGUF 在 3-bit 下大约 103 GB,加上 VRAM 共需约 110 GB 内存。这意味着自托管对中小团队并不友好——一台 H100 节点 80GB 显存跑不动 3-bit,4×GB300 整机价格远超普通云年度预算。

但这条路最重要的一扇门没有关:开源 + 不可撤回的 MIT 条款 + 官方自带的 serving recipe,意味着任何一家头部云厂商或推理服务商都可以当天拉权重、当天上线。事实上 Fireworks 在 7 月 31 日就同步挂出了 serverless endpoint。这是 DeepSeek 把「同等规模模型的发布权」让渡给整个生态的又一次实操——Claude Opus 没法被第三方云以原生模型名卖,DeepSeek V4-Flash 可以。

五、需要警惕的两件事

第一,所有打分都来自 DeepSeek Harness,这个 harness 尚未公开。DeepSeek 在 benchmark 注释里明确标注:Code Agent 任务使用 minimal mode,max effort,temperature=1.0,top_p=0.95。这个 setting 不可与第三方重跑直接对齐。在独立第三方验证 Cybergym 与 DeepSWE 之前,生产级路由决策不应只基于 DeepSeek 自报数字。

第二,API 老字符串要废弃了deepseek-chatdeepseek-reasoner 在 2026-04-24 的迁移窗口里被临时映射到 V4-Flash 的两种模式,但官方明确这两条字符串将在三个月内下线——也就是 2026-10-24。任何继续用这两个字符串的代码,现在开始就该做迁移计划。

六、个人评论:这条节奏一旦跑通,价值不在 Flash

0731 真正的影响,不在它本身刷了多少分,而在它示范了一种节奏——权重发布之后,模型仍然可以以「后训练 + 解码拓扑」的方式不停迭代。这种节奏放在四月初的 V4-preview 时还不存在,4 个月后,DeepSeek 用一次 0731 把这个节奏立住了。

接下来的 6–12 个月里,这条节奏会被复制到三类玩家身上:

  1. 其他中国开源:Kimi K3 已经把 MoE 训练栈完整开源,具备同样技术条件的团队(阶跃星辰、智谱 GLM-5)会在自家 preview 转正时走同一条路。
  2. 闭源旗舰:Anthropic 的 Opus / Sonnet 已经在做月度小步快跑,0731 之后闭源厂的「补丁式更新」会被迫更频繁。
  3. 企业自托管党:Flash 这个尺寸的模型(单节点 4×GB300 可跑)是企业私有化部署最舒服的甜点,V4-Pro 还没转正意味着 Flash 是 DeepSeek 在企业 Agent 市场最拿得出手的牌——也是他们接下来最想守住的一块。

可以预期的是,V4-Pro 正式版一旦上线,同样会沿用这条「后训练驱动」的路线;而 Anthropic 如果要在 V4-Pro + V4-Flash 面前保住 Agent 主线的价位,要么靠更新的产品形态,要么靠更深的工具调用可靠性。

所以,0731 不只是一次「模型升级」,而是一次「模型何时不再是快照」的范式信号。开源 LLM 终于把「持续部署」写进了自己的工作流。