技术背景

DeepSeek 在 2026 年 4 月 24 日以 MIT 协议同时开放了 V4 Pro 与 V4 Flash 的权重与 API,从这一天起就进入了"先预览、再 GA"的两段式发布。7 月 31 日 Flash 先转正,Pro 留 preview。4 个月之后,Pro 端点跟着转正,挂在 build 号 0813 上。

V4 Pro 不是一个普通的 dense 升级,而是 1.6T 总参数、每 token 激活 49B 的 Mixture-of-Experts。架构上它把两种新注意力同时塞进了同一套模型:DeepSeek 称之为 Compressed Sparse Attention (CSA)Heavily Compressed Attention (HCA),官方给出的账本是:在 1M token 设定下,单 token 推理算力压到上一代 V3.2 的 27%,KV cache 压到 10%。两个 V4 模型都用了 32T+ token 做预训练,后训练则走"按领域独立长专家 → on-policy 蒸馏合并回单一模型"的路线。

Hugging Face 上 V4 Pro 的 preview 仓库过去一个月已经有 1.4M+ 次下载,官方建议本地跑最大推理档位时至少留 384K token 的上下文。

核心内容

1) API 经济沿用 preview 价格

  • 输入:cache miss $0.435 / 百万 token,cache hit $0.003625 / 百万 token
  • 输出:$0.87 / 百万 token
  • 上下文窗口:1,048,576 token(1M),最大输出 384,000 token
  • Pro 端点并发上限 500,Flash 端点 2,500——Pro 仍然走"慢但重"的路线

OpenRouter 上,deepseek-v4-pro-0813 页面标"Released Aug 12, 2026",与 DeepSeek 自家 API 文档里的 deepseek-v4-pro 版本号对齐。

2) 三个运行档位

DeepSeek 把 API 切成三档:

  • non-thinking
  • high reasoning effort
  • max effort(官方原文:"pushing the boundary of model reasoning capability")

API 同时兼容 OpenAI ChatCompletions、Anthropic Messages 以及 DeepSeek 自家 Responses API,Pro 与 Flash 都支持 tool calling 与 JSON 输出。

3) 官方 benchmark(V4-Pro-Max 档位,均为厂商自报)

  • SWE-bench Verified: 80.6% resolved
  • Terminal Bench 2.0: 67.9% accuracy
  • GPQA Diamond: 90.1% pass@1
  • Humanity's Last Exam: 37.7% pass@1
  • MMLU-Pro: 87.5%
  • LiveCodeBench: 93.5% pass@1
  • Codeforces rating: 3,206
  • MRCR @ 1M tokens: 83.5 MMR

官方对比表里,V4-Pro-Max 在 Terminal Bench 2.0(67.9 vs 75.1)与 Humanity's Last Exam(37.7 vs 44.4)上仍落后 GPT-5.4 xHigh 与 Gemini-3.1-Pro;在 SWE-bench Verified(80.6)上与 Gemini-3.1-Pro 持平,略低于 Claude Opus 4.6(80.8);但在 LiveCodeBench 与 Apex Shortlist 上拿下表格最高分。这些分数尚未有独立第三方对 0813 build 做完整复现。

4) 商业侧:Pro 端价格会涨

DeepSeek 的 pricing 页面挂了一条提示:整体 API 定价在"不久的将来会有显著上调",具体以官方公告为准。在此之前,8 月 12 日的列表价继续生效。OpenRouter 上"用户实际支付价"明显低于 $0.435 的列表价,差异被解释为 cache 命中与折扣。

5) 还没出 0813 的开源权重

Hugging Face 仓库目前只挂着 4 月的 preview build,DeepSeek 尚未公布 0813 权重的发布时间表,也未明示 GA build 相对 preview 是否只有后训练差异。V4 线的官方节奏写得很清楚:先 API,后权重

个人评论与行业影响

V4 Pro 的 GA 不是技术奇袭,而是 DeepSeek 这家公司在公开做一次"产品定位"。

第一, API 先行 + 权重滞后 已经是 DeepSeek V3 以来就稳定使用的发布节奏。把"preview" 这个标签摘掉的动作,只是把定价、并发、运行档位等商业参数固定下来,模型权重再分批放出——这是一种典型的"先把生态位占住,再让社区做移植与基准复现"的打法。

第二, CSA + HCA 的双注意力组合 + 27% / 10% 的算力与 KV 账本 是 DeepSeek 把"长上下文"重新拉回 MoE 阵营的关键。V3.2 时代 MoE 在 100K+ 上下文里 KV 增长过快,被许多团队放弃长文档;V4 Pro 用结构上的稀疏 + 重压缩,等于在 MoE 主线之外又开了一条"1M token 仍然跑得动"的次线。配合 OpenAI / Anthropic 这一档同期把 GPT-5.6 / Claude Opus 系列推上同级别 1M 上下文,基本可以下结论:2026 下半年,1M token 是头部模型的入场券,而不是卖点。

第三, "将显著上调 API 价格" 的官方提示,意味着 DeepSeek 在 5000 亿元估值融资(报道见 36氪)之后,开始把"靠低价抢市场"切换成"靠能力卖 API"。配合 V4 Flash 0731 在 Artificial Analysis Intelligence Index 上以 50 分打 GPT-5.6 Luna 的 1 分差距,Pro 的提价空间在于"V4-Pro-Max 在 SWE-bench / LiveCodeBench 这类开发者工作流上已经追平甚至超过 GPT-5.4 / Claude Opus 4.6"——而开发者工作流对 token 单价的容忍度,远高于聊天/摘要场景。

留给读者的问题:V4 Pro 0813 的开源权重一天不放出来,DeepSeek 一天就是在用"preview → GA"的措辞差做商业缓冲;一旦权重跟 GA 同步放出,MoE 长上下文赛道的下一波竞争会立刻被 Kimi、Qwen 与字节系的开源旗舰接过去。 这条时间窗口,大约就是接下来 30 天。


素材来源: