技术背景
DeepSeek 在 2026 年 4 月 24 日以 MIT 协议同时开放了 V4 Pro 与 V4 Flash 的权重与 API,从这一天起就进入了"先预览、再 GA"的两段式发布。7 月 31 日 Flash 先转正,Pro 留 preview。4 个月之后,Pro 端点跟着转正,挂在 build 号 0813 上。
V4 Pro 不是一个普通的 dense 升级,而是 1.6T 总参数、每 token 激活 49B 的 Mixture-of-Experts。架构上它把两种新注意力同时塞进了同一套模型:DeepSeek 称之为 Compressed Sparse Attention (CSA) 与 Heavily Compressed Attention (HCA),官方给出的账本是:在 1M token 设定下,单 token 推理算力压到上一代 V3.2 的 27%,KV cache 压到 10%。两个 V4 模型都用了 32T+ token 做预训练,后训练则走"按领域独立长专家 → on-policy 蒸馏合并回单一模型"的路线。
Hugging Face 上 V4 Pro 的 preview 仓库过去一个月已经有 1.4M+ 次下载,官方建议本地跑最大推理档位时至少留 384K token 的上下文。
核心内容
1) API 经济沿用 preview 价格
- 输入:cache miss $0.435 / 百万 token,cache hit $0.003625 / 百万 token
- 输出:$0.87 / 百万 token
- 上下文窗口:1,048,576 token(1M),最大输出 384,000 token
- Pro 端点并发上限 500,Flash 端点 2,500——Pro 仍然走"慢但重"的路线
OpenRouter 上,deepseek-v4-pro-0813 页面标"Released Aug 12, 2026",与 DeepSeek 自家 API 文档里的 deepseek-v4-pro 版本号对齐。
2) 三个运行档位
DeepSeek 把 API 切成三档:
- non-thinking
- high reasoning effort
- max effort(官方原文:"pushing the boundary of model reasoning capability")
API 同时兼容 OpenAI ChatCompletions、Anthropic Messages 以及 DeepSeek 自家 Responses API,Pro 与 Flash 都支持 tool calling 与 JSON 输出。
3) 官方 benchmark(V4-Pro-Max 档位,均为厂商自报)
- SWE-bench Verified: 80.6% resolved
- Terminal Bench 2.0: 67.9% accuracy
- GPQA Diamond: 90.1% pass@1
- Humanity's Last Exam: 37.7% pass@1
- MMLU-Pro: 87.5%
- LiveCodeBench: 93.5% pass@1
- Codeforces rating: 3,206
- MRCR @ 1M tokens: 83.5 MMR
官方对比表里,V4-Pro-Max 在 Terminal Bench 2.0(67.9 vs 75.1)与 Humanity's Last Exam(37.7 vs 44.4)上仍落后 GPT-5.4 xHigh 与 Gemini-3.1-Pro;在 SWE-bench Verified(80.6)上与 Gemini-3.1-Pro 持平,略低于 Claude Opus 4.6(80.8);但在 LiveCodeBench 与 Apex Shortlist 上拿下表格最高分。这些分数尚未有独立第三方对 0813 build 做完整复现。
4) 商业侧:Pro 端价格会涨
DeepSeek 的 pricing 页面挂了一条提示:整体 API 定价在"不久的将来会有显著上调",具体以官方公告为准。在此之前,8 月 12 日的列表价继续生效。OpenRouter 上"用户实际支付价"明显低于 $0.435 的列表价,差异被解释为 cache 命中与折扣。
5) 还没出 0813 的开源权重
Hugging Face 仓库目前只挂着 4 月的 preview build,DeepSeek 尚未公布 0813 权重的发布时间表,也未明示 GA build 相对 preview 是否只有后训练差异。V4 线的官方节奏写得很清楚:先 API,后权重。
个人评论与行业影响
V4 Pro 的 GA 不是技术奇袭,而是 DeepSeek 这家公司在公开做一次"产品定位"。
第一, API 先行 + 权重滞后 已经是 DeepSeek V3 以来就稳定使用的发布节奏。把"preview" 这个标签摘掉的动作,只是把定价、并发、运行档位等商业参数固定下来,模型权重再分批放出——这是一种典型的"先把生态位占住,再让社区做移植与基准复现"的打法。
第二, CSA + HCA 的双注意力组合 + 27% / 10% 的算力与 KV 账本 是 DeepSeek 把"长上下文"重新拉回 MoE 阵营的关键。V3.2 时代 MoE 在 100K+ 上下文里 KV 增长过快,被许多团队放弃长文档;V4 Pro 用结构上的稀疏 + 重压缩,等于在 MoE 主线之外又开了一条"1M token 仍然跑得动"的次线。配合 OpenAI / Anthropic 这一档同期把 GPT-5.6 / Claude Opus 系列推上同级别 1M 上下文,基本可以下结论:2026 下半年,1M token 是头部模型的入场券,而不是卖点。
第三, "将显著上调 API 价格" 的官方提示,意味着 DeepSeek 在 5000 亿元估值融资(报道见 36氪)之后,开始把"靠低价抢市场"切换成"靠能力卖 API"。配合 V4 Flash 0731 在 Artificial Analysis Intelligence Index 上以 50 分打 GPT-5.6 Luna 的 1 分差距,Pro 的提价空间在于"V4-Pro-Max 在 SWE-bench / LiveCodeBench 这类开发者工作流上已经追平甚至超过 GPT-5.4 / Claude Opus 4.6"——而开发者工作流对 token 单价的容忍度,远高于聊天/摘要场景。
留给读者的问题:V4 Pro 0813 的开源权重一天不放出来,DeepSeek 一天就是在用"preview → GA"的措辞差做商业缓冲;一旦权重跟 GA 同步放出,MoE 长上下文赛道的下一波竞争会立刻被 Kimi、Qwen 与字节系的开源旗舰接过去。 这条时间窗口,大约就是接下来 30 天。
素材来源:
- Unite.AI(2026-08-12):DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview — https://www.unite.ai/deepseek-ships-v4-pro-as-its-flagship-model-leaves-preview/
- OpenRouter Model Page(2026-08-12):DeepSeek V4 Pro 0813 — API Pricing & Benchmarks — https://openrouter.ai/deepseek/deepseek-v4-pro-0813
- Hugging Face(2026-04 起,持续更新):deepseek-ai/DeepSeek-V4-Pro model card — https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro