今天中午 12 点(UTC 04:00)起,所有打到 deepseek-v4-pro 端点的 API 请求,后台服务的已经不是那个 1.6 万亿参数的旗舰,而是 552B 的 V4.1-Flash——并且按 Flash 的费率计费。DeepSeek 在 9 月 10 日的官方公告里写得很直白:「我们正在逐步淘汰 V4-Pro」。上线刚满一个月的旗舰,就这样被自家最小的模型接了班。
一场没有发布会的主帅更替
先理时间线。V4.1-Flash 是 9 月 10 日随新架构家族一起亮相的「最小成员」,原生支持视觉理解。同一天官方就预告了退役计划:9 月 14 日 04:00 UTC 起,deepseek-v4-pro 的全部请求路由到 V4.1-Flash,计费同步切换到 Flash 费率,这个状态会持续到 V4.1-Pro 发布。更早一代的 V4-Flash 与 V4-Flash-Vision-Exp 也同步退役,旧模型名暂时兼容路由。整个切换没有新发布会,一纸公告加一次路由变更,旗舰就换人了。
被替代的 V4-Pro 并不是旧货。按 Unite.AI 的报道,它 8 月 12 日才结束近四个月的 preview 转正:1.6T 总参数、每 token 激活 49B,Hugging Face 仓库单月下载量超过 140 万次。从转正到退位,33 天。
552B 凭什么顶替 1.6T
答案写在架构里。V4.1-Flash 采用新的 Causal Encoder–Decoder 结构:输入侧每 token 只激活 8B 参数,输出侧 16B——读题的模型小,答题的模型大,两头都省。KV cache 相比上一代只需要 1/4 的 HBM 和 1/8 的 SSD 存储,而官方明确说,缓存命中的费用往往占 agent 成本的大头,把缓存压下来,就是把账单压下来。
性能层面,官方的表述是「多方测试显示 V4.1-Flash 在性能、成本、速度和总运行时间上领先 V4-Pro」。对照 Unite.AI 抓取的定价页:V4-Pro 每百万输入 token 0.435 美元、输出 0.87 美元,且 Pro 端点并发上限 500,Flash 是 2500——旗舰在吞吐上反而是短板。API 模型名设为 deepseek-flash 即可调用,官方合作伙伴 WorkBuddy(含 CodeBuddy)与 OpenCode 已全面支持。
参数规模不再是旗舰的定义
这件事真正值得记一笔的,不是 DeepSeek 换了个模型,而是它愿意亲手把「参数最多」的那个模型请下位。MoE 时代总参数早已和实际算力脱钩:49B 激活的 1.6T 与 8B/16B 激活的 552B,谁的服务成本低、谁的有效吞吐高,谁才是事实上的旗舰。DeepSeek 用一次路由变更承认了这一点。
对开发者的信号也很实际:长上下文与 agent 工作负载里,缓存成本正在追上模型本身的智力溢价;峰谷定价(谷时半价)进一步把「什么时候跑任务」变成了一个工程问题。另外权重和技术报告已放上 Hugging Face,官方还留了一句——「规划 2000 GPU 加存储集群的大规模部署?来聊」——本地化与私有部署路线并没有放弃。
所以呢:当一家以效率著称的实验室主动退役自家最大的模型,「旗舰」的定义权就已经从参数表转移到了单位成本的性能上。下一次谁再拿总参数规模说事,可以把这次路由变更直接甩给他。