9 月 10 日,DeepSeek 做了一件少见的事:上线新模型 V4.1-Flash 的同时,宣布自家旗舰 V4-Pro 进入退役流程——9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 的 API 请求将被路由到 V4.1-Flash,并按新模型的价格计费,直到 V4.1-Pro 发布为止。家族里最小的模型把旗舰逼下台,这个信号本身比任何跑分都值得咀嚼。

非对称架构:读题用 8B,答题用 16B

V4.1-Flash 是一个 552B 参数的 MoE,核心变化是一套新的 Causal Encoder–Decoder(CED)架构:输入侧每个 token 只激活 8B 参数,输出侧激活 16B。官方称,配合新的预训练方法和更大规模的 RL 后训练,它在 benchmark 上超过了包括 V4-Pro 在内的旗舰模型。

第三方分析(atoms.dev)拆得更细:40 层 Transformer 被拆成 20 层因果编码器加 20 层解码器,解码器的全局 KV cache 不再逐层独立计算,而是从编码器的最终隐状态投影得到。这种非对称设计针对的正是 agent 负载的特征——上下文、工具返回、历史对话加起来的输入,往往远大于最终输出。

KV 缓存:Agent 成本的命门

官方公告给出的数字:与上一代相比,V4.1-Flash 的 KV cache 只需要 1/4 的 HBM、1/8 的 SSD 存储。官方也直接点破了动机——在 agent 任务里,缓存命中费用往往占总成本的很大一块。

atoms.dev 从模型卡读到的细节更夸张:全局 KV cache 低至每 token 890 字节,约为 V4-Flash 的 1/4、初代 V1 的 1/437(AIBase 的独立报道交叉印证了这个量级);配合 SWA Bounded Replay 机制,不再把完整的滑窗注意力 KV 状态持久化到 SSD。另有 Compressed Sparse Attention 2:注意力层在 Full、Reindex、Reuse 三种静态模式间选择,跨层共享 KV 数据与稀疏索引,而不是每层重复重建。

价格与生态

定价继续峰谷结构:off-peak 费率为 peak 的 50%,新价格自 9 月 10 日 04:00 UTC 生效。atoms.dev 列出的具体数字:off-peak 未缓存输入 $0.15/百万 token、缓存输入 $0.003、输出 $0.60,peak 翻倍。生态侧,官方合作伙伴 WorkBuddy(含 CodeBuddy)与 OpenCode 已宣布全面支持;权重和技术报告已放上 Hugging Face。同时旧模型 V4-Flash 与 V4-Flash-Vision-Exp 退役,旧模型名暂时兼容路由到 V4.1-Flash。

几点判断

其一,「Flash 逼退 Pro」说明竞争焦点正在从「谁跑分高」转向「谁的单 token 成本低」——当小模型的跑分追平旗舰,旗舰的存在意义就只剩下品牌和更大的参数故事。其二,非对称架构是给 agent 时代定制的:长上下文、多轮调用、输入密集,KV cache 压缩直接命中这类负载的成本结构,比单纯的规模叙事更有工程含金量。其三,留一分清醒:「超过旗舰」目前是官方提交口径,独立分析确认了架构与价格数字,但具体基准的胜负,建议在自己的负载上实测再下结论。

所以呢:下一波模型竞争的胜负手,可能不在参数表上,而在「每个 token 的显存账」上。V4.1-Flash 把这笔账摆上了台面——真正的问题是,接下来发布的 V4.1-Pro,还能拿什么把旗舰的故事讲下去?