只动后训练,不动权重:DeepSeek-V4-Flash 正式版 API 上线
7 月 31 日,DeepSeek 在更新日志中宣布 DeepSeek-V4-Flash-0731 正式版 API 正式上线公测,同步预告了 V4-Pro 正式版即将发布。和 V4-Flash-preview 相比,正式版的 模型结构、参数量、权重 都保持不变,只重新做了一轮后训练(post-training)。也就是说,这次升级没有新 checkpoint、没有新架构,模型文件本身一字节都没改。
这正是开源 LLM 进入工程化运维阶段后的典型打法:权重冻结 + 后训练迭代。
为什么可以只换后训练
V4-Flash 走的是 DeepSeek 标志性的 MoE + 稀疏注意力 + 长上下文(1M tokens) 路线。在 5 月 V4 GA 的技术披露中,DeepSeek 已经把 CSA(Compressed Sparse Attention)+ HCA(Hierarchical Compressed Attention) 两条主线拼到了同一套推理栈里,把 1M 上下文下的注意力计算量压到了传统密集注意力的 27% 左右,峰值吞吐比 V3 翻倍,但 API 价格长期按分时电价思路压得很低。
后训练(post-training)成本远低于预训练:
- 预训练:数千卡 · 数十天 · 数百万美元
- 后训练(RLHF / SFT / RL-on-CoT):几十到几百卡 · 数天到数周 · 成本量级低 2 到 3 个数量级
Flash-preview 之所以单独命名,是因为它的权重是上一轮 RLHF/SFT 流水线收尾时的副产物,DeepSeek 想拿真实流量再跑一轮对齐。0731 这个版本号本身就是一次完整后训练迭代的收尾标记,而不是任何架构升级。
这种打法的三个收益
快速滚动版本号:开源 LLM 不能再像过去那样每次都喊训练成本数百万美元。用户每天在生产环境跑推理,质量 regression 必须被快速修正。Preview 到正式版的无权重升级,可以在几天内通过 API 推给所有用户。
行为校准而不打扰基座:V4-Flash 在多语言、长上下文、代码、推理上是开源同价位里最强的(参考 Developers Digest 三模型对比里的 DeepSeek V4 部分)。这些能力写在权重里,改权重 = 承担 regression 风险;改对齐层 = 改说话方式,基座推理能力保留。
成本曲线平滑:preview 阶段用户量大,正式版意味着 DeepSeek 已经把对齐数据 / reward model / RL 训练流水线都跑稳,进入边际成本极低的稳定运营态。这是为什么 V4-Pro 正式版可以尽快发布——同一条后训练管线可以无缝切换到 Pro 权重上。
留给行业的两个问题
- 复现性问题:只看 API 行为,用户不知道哪些是权重贡献、哪些是对齐贡献。一旦 preview 和正式版输出差异较大,debug 时会归因困难。
- 版本号语义:DeepSeek 用日期后缀(0731)代替 v4.1 / v4.2 这种语义版本号,意味着 DeepSeek 在承诺不破 API 兼容性的节奏下追求快速迭代。开源协议下的派生模型如果跟随日期版本号,会很快失去可追踪性。
评论
把 V4-Flash 看作开源 LLM 的运维型版本号,比把它当作模型升级更准确。它说明一件事:开源大模型的差异化竞争,正在从谁的预训练更狠转向谁的后训练管线更稳。V4-Pro 正式版一旦跟上,这条管线就同时跑通 Flash 和 Pro 两个价位——DeepSeek 在用工程化能力锁住开源 LLM 的商业护城河。
对开发者来说,0731 是一个值得记下的节点:开源 LLM 进入按日期发版的新节奏,你读 release notes 时,要把权重变了和只动了对齐区分开。
参考
- DeepSeek 更新日志(2026-07-31):V4-Flash-0731 正式版 API 公测,V4-Pro 正式版将尽快发布
- MACGPU Blog:DeepSeek V4 GA 把分时电价塞进大模型 API,CSA + HCA 撑起 1M 上下文
- MorphLLM:DeepSeek V4 混合注意力架构解析——1M 上下文下计算量降至 27%
- Developers Digest:开源编程模型三选一——GLM-5.2、DeepSeek V4、Qwen3.6