快手 KwaiKAT 团队 7 月 26 日发布 KAT-Coder-V2.5,在统一 Claude Code harness 下 PinchBench 拿到 94.9 分,首次压过 Claude Opus 4.8 的 93.5;同时把 35B 总参 / 3B 激活的 MoE 变体 KAT-Coder-V2.5-Dev 以 Apache-2.0 推到 Hugging Face。 但比刷榜更值得拆的是训练栈底下的工程改造。KwaiKAT 最初把 RL 曲线的迟缓归罪到算法本身,审计后才发现 16% 的轨迹失败来自 sandbox,不是策略。沙箱镜像把磁盘用到 95%,让超时 invalid rollout 占 6%–7%;远端 sandbox 初始化的环境变量错位再误翻 6%–7% 的 reward;Gateway Server 套的 chat 端点在 ~200 turn 规模上制造 40% 的 token drift。三项基础设施改动叠加之后,sandbox 反馈错误率从 16% 压到 2% 以下,训练塌陷减少一个数量级。 支撑这层的是 AutoBuilder:把可执行环境构建成功率从 16.5% 拉到 57.2%,堆出 10 万+ 个跨 12 种语言的可验证仓库任务,每个任务都是「golden patch + test patch + 自动生成的三段式描述」三元组,验证不读 exit code,而是解析结构化测试输出,要求 ≥90% 的预期测试在多次运行中复现。数据飞轮也不只过滤「最终 pass」的轨迹,而是给「接近 pass」的任务加 process-level hints,让 0 通过子集回到 ~20% 通过率,再以 hint-free 重放洗掉泄漏。 开源变体 KAT-Coder-V2.5-Dev 的底子是 Qwen3.6-35B-A3B 加 127K SFT 与 RL 后训练。这意味着 agentic coding 能力可以以 35B 总参、3B 激活的 MoE 形态在单卡 4-bit 量化下跑通,Qwen 系开源生态又多了一块拼图。Agentic coding 的下一程竞争,不在模型多大,而在沙箱稳不稳、数据过不过滤、reward 会不会被 hacking。KAT-Coder-V2.5 的真正卖点不是 PinchBench 那一分,而是把 RL 训练从「算法题」改写成了「基础设施题」。