DeepSeek V4 GA 把分时电价塞进大模型 API:CSA + HCA 撑起 1M 上下文,峰值翻倍只是商业答案

7 月 20 日 DeepSeek V4 正式 GA,沿用预览期 1.6T MoE 架构,核心新增是面向工业级推理的"峰谷定价"——北京工作日 09:00-12:00 与 14:00-18:00 输出一倍,off-peak 仅 $0.87/M。配合 CSA + HCA 把 KV 缓存压到 V3.2 的 10%,V4-Pro 终于让 1M 上下文从 spec sheet 走向可规模化部署。 DeepSeek V4 在 4 月以 MIT 协议开源时,大家关注的是 1.6T 总参 / 49B 激活的 MoE 架构和 1M 上下文;但真正卡生产部署的不是参数,是那一行 spec sheet 上写着"1M 上下文"、实际却烧光显存撑不开。 7 月 20 日 V4 GA 把架构故事和商业故事拆开回答了两个不同的问题: 第一,1M 上下文凭什么便宜?答案在注意力层的工程重组:用 CSA(Compressed Sparse Attention,4× softmax-gated pooling + FP4 闪电索引器 top-1024 sparse)与 HCA(Heavily Compressed Attention,128× 压缩后做全局 dense attention)按 transformer 层交替铺开。1M tokens 时 FLOPs 仅 V3.2 的 27%,KV cache 缩到 10%(Flash 版本 7%)。这意味着 V4-Pro 的 384K max-output + 1M 上下文,是第一次真正可以按 token 经济地定价的 1M 上下文。 第二,API 凭什么分时?答案是商业模式升级:GA 引入峰谷输电价——off-peak 仅 $0.87/M,peak 双倍至 $1.74/M。即便翻倍,仍比 Claude Opus 4.8($15/M)和 GPT-5.6 Sol(约 $15/M)便宜一个数量级,同时按"Strategy & Operations"基准折算成本,V4-Pro 单任务仅 $0.03,Claude Fable 5 是 $3.48,116× 成本差距。 SWE-bench Verified 上 V4-Pro 拿到 80.6%,刷新开源权重纪录并打平 Gemini 3.1 Pro;LiveCodeBench 93.5%、Codeforces Elo 3206 同样领跑。把这两个数字放进 API 经济账里:开源模型第一次证明,在工程成本维度,闭源 frontier 不再是默认选项。 工程上的"对齐+加速"在同一表征空间实现,大概率会成为下一代开源 LLM 的标配范式——而 DeepSeek 已经把这条路径走到了 GA。