[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-3d8b9b1a-e038-466f-9b6b-304f911e35a7":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":26,"created_at":27,"modified_at":28,"is_published":29,"publish_type":30,"image_url":13,"view_count":31},"3d8b9b1a-e038-466f-9b6b-304f911e35a7","Kimi K3 开源三件套 MoonEP\u002FFlashKDA\u002FAgentEnv:Moonshot 把 2.8T MoE 训练栈完整交底","7 月 27 日,月之暗面在 Kimi K3 开放日把模型权重、技术报告之外的三项核心 Infra 技术一并开源——高性能通信库 MoonEP、KDA 线性注意力算子 FlashKDA,以及与 KVCache.ai 合作的分布式 RL 沙箱 AgentEnv。Kimi K3 是一个 2.8 万亿参数 MoE 模型,每次推理仅激活 16\u002F896 专家,工程上的最大挑战是「高稀疏度下如何稳住训练与通信」: MoonEP 把细粒度专家并行的通信做到不均衡负载下仍接近线性扩展,让超大 EP 域不再因少数专家过热而卡死;FlashKDA 给出 KDA 的 Triton\u002FCUDA 级实现,在 H20 上相比 flash-linear-attention 基线 prefill 速度提升 1.72–2.22 倍,可直接作为后端替换;AgentEnv 则提供高保真、快速 fork 的沙箱,支撑 Kimi K3 后训练里大规模并行 Agent 任务。三件套覆盖「通信—算子—沙箱」三个最常被开源社区忽略的工程角,让任何人都能在同等规格下复现 K3 级别的训练流水线。结合 KDA + AttnRes 3:1 混合、Stable LatentMoE 的 Quantile Balancing、Per-Head Muon 等架构创新,Kimi K3 在算力受限的前提下把规模化效率相对 K2 提升 2.5 倍——开源的不仅是模型,更是中国大模型第一次把「2.8T 怎么训」的全部工程细节摊在桌面上。","https:\u002F\u002Fgithub.com\u002FMoonshotAI\u002FMoonEP","0ec8f614-42c7-4256-8591-209e1e39eb6b",[10,14,17,20,23],{"id":11,"name":12,"slug":12,"description":13,"color":13},"7ac06d8e-b074-4147-abfc-ffaa4c6b8744","ai-efficiency",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"a8002d98-9df1-4ab9-94d4-a7625af634c4","china-ai",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"7e89b5cc-57db-4f37-bc6d-28919a73931c","model-release",{"id":24,"name":25,"slug":25,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source","2026-07-28T04:30:00Z","2026-07-28T04:06:17.036638Z","2026-07-28T04:06:17.036646Z",true,"agent",4]