长程 agent 的工作负载有一个共同特征:输入远多于输出。一份代码库、一沓文档、几十轮工具调用记录塞进上下文,prefill 的算力、HBM 里的 KV cache、SSD 的容量和搬运带宽,三样同时吃紧。DeepSeek 9 月 17 日放出的 V4.1-Flash 技术报告(arXiv:2609.19969),通篇就在算一笔账:同一个 552B 的模型,怎么把每个 token 的 KV 缓存开销压到 890 字节。

第一层:CED 非对称激活,读题用 8B、答题用 16B

V4.1-Flash 采用 Causal Encoder-Decoder(CED)架构:40 层 Transformer,前 20 层做因果编码器,后 20 层做解码器。关键在于,解码器的全局 KV cache 不再由各解码层自己的隐藏状态推导,而是直接从编码器最终的隐藏状态投影而来。好处立竿见影:prefill 阶段每个 token 只需激活 8B 参数,decode 阶段激活 16B。对输入重、输出轻的 agent 负载,省的正是最贵的那一段。9 月 10 日 API 公告里「读题 8B 答题 16B」的说法,在这份报告里给出了完整的架构依据。

第二层:CSA2 三模式加 FP4,全局缓存砍到上代 1/4

Compressed Sparse Attention 2(CSA2)给每个注意力层分配三种静态模式之一——Full、Reindex 或 Reuse——让多层共享主 KV 与索引 K,并复用 Top-K 稀疏注意力索引。解码器里的分层稀疏索引器(Hierarchical Sparse Indexer)进一步把后续索引层的候选池限制在第一个 Full 模式层构造的集合内,更深层索引器的成本不再随上下文长度增长。再叠上 FP4 主 KV 缓存(E2M1 格式,每 16 个通道共享一个 E4M3 缩放因子),全局 KV 缓存落到每 token 890 字节——约为 V4-Flash 的 1/4、V1 的 1/437。

第三层:SWA Bounded Replay,持久缓存再砍到 1/8

驻留在 SSD 或主机内存里的持久 KV 是另一笔开销。SWA Bounded Replay 的思路是:不把滑动窗口注意力的 KV 状态持久化,需要时只重放最近 n_win 个 token 重建缺失状态。持久缓存占压到 V4-Flash 的约 1/8。

架构外的配套件

报告还交代了几个值得注意的组件:Engram 条件记忆模块(196B 参数,按 token 查找的稀疏访问);DSpark 投机解码(半自回归草稿生成,置信度调度验证);MoE 每层 1 个共享专家加 384 个路由专家、每 token 激活 6 个。预训练从零开始,45T token 多模态语料,稀疏注意力在 64K 序列长度上训练,34T 处扩到 1M 上下文。后训练沿用 SFT、RL 到在线蒸馏(OPD)的流程,改动集中在数据管线——agent 任务与环境的大规模自动合成。推理侧支持 1-100 整数档的连续可控推理强度。

官方口径的跑分:agent 场景领先,硬解推理仍有差距

按模型卡公布的基准(官方内部框架评测口径),最大推理强度下:Terminal-Bench 2.1 90.6(高于 Opus-5.0 的 89.1)、DeepSWE v1.1 74.2(高于 Opus 74.0)、CyberGym 88.1、Agent's Last Exam 31.8、AutomationBench 54.8,均为对比表中最优;Codeforces 评分 3471 也是全表最高。但差距同样写在表里:Terminal-Bench 3.0/4.0 分别只有 30.0/31.2,明显落后 Opus 的 43.3/51.8;HLE 36.8 对 Opus 的 56.3;GPQA 90.9 低于 GPT-5.6 Sol 的 94.1。便宜不等于全能,这份把短板一并放出来的表格,比单看几项第一更有信息量。

工件配套:这次连 Rust 库都给了

HF 仓库(MIT 许可)除权重外,还带了 prompt 编码参考实现、推理代码、DeepSWE 复现步骤,以及 deepseek-recipe——一组带 Python 绑定的 Rust 库,统一处理 V4 与 V4.1 的 prompt 编解码。社区侧已有 73 个量化版本、14 个微调模型跟进。值得注意的是这次没有提供 Jinja 格式 chat template,改用自维护的编码工具链——新架构的 prompt 格式复杂度,可能已经到了通用模板不好覆盖的程度。

三层缓存设计不是把模型缩小,而是把「上下文怎么存」重新设计了一遍。当 agent 把百万 token 上下文当常规配置用,HBM 和 SSD 的账本迟早会摆到每家推理团队桌上。这份报告给出的参照系是:架构层的非对称激活、注意力层的跨层共享、部署层的有损重建,三件事可以叠加,而且开源可验证。