Poolside Laguna S 2.1:9 周训练的 118B MoE 把 SWE-Bench 顶到 78.5%

7 月 21 日,Poolside 把 Laguna S 2.1 全部权重推到 Hugging Face 开源(OpenMDW-1.1 协议),同步发了官方 GGUF、MLX、INT4、FP8、NVFP4 量化版和 DFlash 推测解码草稿模型。架构是 118B 总参、每 token 激活 8B 的 MoE,256 路由专家里选 10 个再加 1 个共享专家,48 层、1:3 全局 / 滑动窗口混合注意力,1M 上下文。 最反常识的成绩单:SWE-Bench Multilingual 78.5%,Terminal-Bench 2.1 70.2%,DeepSWE v1.1 40.4%。8B 激活跑出 78.5% multilingual SWE-bench,意味着它能在单台 NVIDIA DGX Spark(桌面级 Grace Blackwell)上拿到和 Tencent Hy3 295B-A21B 接近的水平。Hermes Agent、pi、OpenCode、OpenClaw、Cline 当天就把 S 2.1 接进默认模型列表——这是「agent 时代尺寸曲线必须重新画」的明确信号。 让人议论的不是学术分数,是工程:5 月 22 日开训,7 月 21 日发布,9 周;409k agentic / 非 agentic 训练环境,后训练第一次用 FP8 RL 加速;rollout 预算拉到「单任务几万到几十万 token、几百步」级别;同一 prompt 在多个 harness 上并行 rollout,防止只适配自家脚手架。Poolside 公开了所有最终评测轨迹,最出圈的一段:模型在无人监督的沙箱里自己重发现了 Erdős #397 猜想——一道 2026 年 1 月才被 GPT-5.2 Pro 解决的 50 年悬案,而且给出的 8 指数线性族与公开的 6 指数解结构不同。 更耐看的是它改自己 harness 的 case:Poolside 把自家 agent 框架喂回去,20 轮循环迭代,最后整体提速 5.2%、内存分配下降约 70%。他们在 blog 里写得很直白:「我们没加更多 intelligence,我们加的是『验证、不放弃、不宣布胜利』的工程行为。」 服务侧:OpenRouter 256K 免费 + 1M 付费端点(定价 $0.10 入 / $0.20 出 / $0.01 cache 读 / M token),Baseten、Vercel AI Gateway 同步上线。vLLM、SGLang、Ollama、TRT-LLM day-0 支持。 我的判断:S 2.1 是 2026 下半年「小而精的 agentic coding 模型」路线的集中体现。MoE + 8B 激活 + 强 RL + 多 harness 训练 + DFlash 推测解码——这套组合拳比单纯堆参数更值得复刻。Poolside 下一档 Laguna 已经开预训练,但 S 2.1 的意义在于:它把「单机跑前 10% agent 编码能力」从 PPT 变成了可下载的权重。 当 8B 激活就能在 SWE-Bench 上摸到 70%+,我们还需要 1T+ 总参的闭源大模型来写代码吗?