Kimi K3 跑通 MiniTriton:Moonshot 让 LLM 第一次从零编译出自己的 GPU 编译器

Moonshot 在 Kimi K3 技术博客里把 LLM 的 agentic 能力直接推到了系统软件层级:模型不只在 benchmark 上和 Fable 5、GPT 5.6 Sol 贴身竞争,它真的在 sandbox 里连续 24 小时 profile、重写并 benchmark 了四个 GPU kernel 任务,在 AttnRes、KDA 和一个 512 维头部的 MLA kernel 上和 Fable 5 持平、显著压过 Opus 4.8、GPT 5.5 和 5.6 Sol。更有杀伤力的是另一个 case:K3 自己写出了一个 Triton-like 编译器 MiniTriton,带上自研的 tile-level IR、MLIR 之上的优化通道和 PTX 代码生成 pipeline,在多组 roofline benchmark 上和 Triton、torch.compile 互有胜负,还能稳定跑完 nanoGPT 端到端训练,loss 曲线几乎贴着参考实现走。K3 的架构骨架是 Kimi Delta Attention(线性注意力)+ Attention Residuals(跨层残差)+ Stable LatentMoE(896 选 16),搭配 SiTU 激活和 Gated MLA,官方给出的 scaling efficiency 比 K2 提升约 2.5 倍,2.8 万亿参数全部由 MXFP4 权重 + MXFP8 激活训出来,服务侧则依赖 64 卡以上的 supernode 配置才跑得动。技术报告还没发,论文里承诺的细节要等 7 月 27 日权重开源一起落地。问题是这些 case 都跑在 Moonshot 自家 sandbox 里,能不能复现还得等社区下场——但把「自己写编译器」写进 model card 这一步,确实把 agentic benchmark 的天花板往上抬了一截。