从 Kimi Linear 到 Kimi K3:MoE 推理效率战里被忽略的架构升级
2026 年 7 月底,Moonshot AI 把 Kimi K3 权重开源,2.8T 参数 MoE 一举拿下"目前最大的开源权重模型"。但比参数规模更值得关注的,是 K3 在架构层面的一系列替换:从 MoE 到 LatentMoE,从标准注意力到多头潜在注意力 + Kimi Delta Attention 的混合方案,从常规残差连接到 Attention Residuals,从 RoPE 全面换成 NoPE。Sebastian Raschka 在发布次日对技术报告做了逐项拆解,这些改动合起来只把推理成本抬高了 2%,却把验证损失和下游性能都再压低了一档。
一、LatentMoE:把 MoE 的大线性层也"潜空间化"
Kimi K3 最显眼的新组件是 LatentMoE。思路和过去一年大模型里"潜空间化"的趋势一脉相承——既然多头潜在注意力(MLA)可以通过 down-project 把 attention 矩阵压缩到低秩潜空间,MoE 里的 expert 线性层为什么不能照做?
Raschka 指出,K3 用的 LatentMoE 与 NVIDIA Nemotron 3 Ultra 用的是同一个套路:把 expert 内部的大矩阵先压到一个小维度的潜空间,计算完再升回去。对推理而言,这条路径减少的是 expert 内部的访存和算力,而不是 expert 数量本身。换句话说,它让"开更多 expert"这件事变得更便宜,这才是 2.8T 参数仍然能跑得动的核心工程基础。
二、Kimi Delta Attention + MLA 的混合:把注意力也压到潜空间
K3 不是单一注意力,而是 hybrid 方案:
- 全局层用 Kimi Delta Attention(KDA),一种循环线性注意力,延续自去年的 Kimi Linear,ETH Zurich 7 月份那篇比较四种循环线性注意力的论文已经把 KDA 列为损失最低的一档。
- 局部层则走多头潜在注意力(MLA),靠潜空间压缩来减少 KV cache 占用。
两条路一起走的效果是:全局层负责长程依赖但省算力,局部层负责细节但省显存。K3 把这套混合延续到 2.8T 规模,在开源权重里是头一次。
三、Attention Residuals:不卷参数卷残差通路
如果说 LatentMoE 和混合注意力都还属于"用更便宜的方式做同一件事",那 Attention Residuals(AttnRes)就是这一轮架构改动里唯一的"非效率性"升级。
DeepSeek V4 用 mHC(manifold-constrained Hyper-Connections)把残差通路变宽,AttnRes 走的是另一条路:在层与层之间用 attention score 来决定当前残差对下一层的贡献权重。换句话说,残差连接本身带了一个"哪些层该用多少"的学习机制。
按技术报告数据,AttnRes 让验证损失和下游任务都"一致地"小幅改善,代价是训练成本 +4%、推理成本 +2%。这两个百分比看起来小,但放在 2.8T 规模上,绝对算力是天文数字——Moonshot 愿意为这一点点提升付费,说明残差通路在超大规模上还有红利可挖。
四、NoPE 全场:第一个 frontier 级"无位置编码"模型
Kimi K3 完全抛弃了 RoPE,所有层都用 NoPE(No Positional Embeddings)。Raschka 直接说这是他在 frontier 级模型里见到的第一个全 NoPE 案例——之前要么是 NoPE 用在全局层 + RoPE 用在滑动窗口层,要么是某些小模型试水。
K3 之所以敢这么做,一方面是因为混合注意力里 KDA 已经隐式编码了相对位置信息,另一方面是 MoE 路由本身就提供了位置无关的全局结构。这条路径如果被后续的 V5、DeepSeek V5 跟进,意味着 RoPE 这个从 LLaMA 时代沿用至今的设计可能被加速淘汰。
五、原生多模态:架构升级的最后一块拼图
K3 不再是纯文本模型,而是原生多模态。Raschka 把这点单独列出,认为它和上面几个架构改动是同一波技术决策的产物——MoE 让不同模态共享容量,NoPE 让不同模态不需要对齐位置,AttnRes 让跨模态残差可以学习融合权重。一套架构同时解决"模型够大"和"模态够多"两个问题。
个人评论:K3 给"推理效率战"立的新标杆
把 K3 这一轮改动和 DeepSeek V4、Nemotron 3 摆在一起,可以看出 2026 下半年开源 frontier 模型的主旋律不再是"参数更大",而是"每一个组件都被换成了推理效率更高的版本"——MoE 换 LatentMoE,attention 换 MLA + 线性注意力混合,RoPE 换 NoPE。这条路径的意义在于:开源权重模型的可用性不再只看参数,更看推理时每一 token 的真实成本。
对国内开源生态而言,K3 的另一个信号是:2.8T 参数的 MoE 仍然可以做到权重公开 + 推理成本可控,这给 DeepSeek V4 Pro、GLM-5.2 之后的下一轮竞争定了基调——谁能把"潜空间化"做到每一层,谁就能在开源 frontier 上保持领先。
最后一个值得关注的点:AttnRes +4% 训练成本换来的"小幅"性能提升,在 2.8T 规模上是否值得,完全取决于 Moonshot 后续用 K3 跑多模态 agent 工作流时的实际收益。如果多模态 agent 是 2026 下半年的主战场,那这 4% 可能是今年最划算的一笔架构投资。