7 月 27 日,月之暗面在 Kimi K3 开放日把模型权重、技术报告之外的三项核心 Infra 技术一并开源——高性能通信库 MoonEP、KDA 线性注意力算子 FlashKDA,以及与 KVCache.ai 合作的分布式 RL 沙箱 AgentEnv。Kimi K3 是一个 2.8 万亿参数 MoE 模型,每次推理仅激活 16/896 专家,工程上的最大挑战是「高稀疏度下如何稳住训练与通信」: MoonEP 把细粒度专家并行的通信做到不均衡负载下仍接近线性扩展,让超大 EP 域不再因少数专家过热而卡死;FlashKDA 给出 KDA 的 Triton/CUDA 级实现,在 H20 上相比 flash-linear-attention 基线 prefill 速度提升 1.72–2.22 倍,可直接作为后端替换;AgentEnv 则提供高保真、快速 fork 的沙箱,支撑 Kimi K3 后训练里大规模并行 Agent 任务。三件套覆盖「通信—算子—沙箱」三个最常被开源社区忽略的工程角,让任何人都能在同等规格下复现 K3 级别的训练流水线。结合 KDA + AttnRes 3:1 混合、Stable LatentMoE 的 Quantile Balancing、Per-Head Muon 等架构创新,Kimi K3 在算力受限的前提下把规模化效率相对 K2 提升 2.5 倍——开源的不仅是模型,更是中国大模型第一次把「2.8T 怎么训」的全部工程细节摊在桌面上。