50.0% 对 50.9%,差 0.9 个百分点,价格差 64%。这是 Cognition 9 月 10 日发布的编码模型 SWE-2 交出的成绩单:在自家的 FrontierCode 1.1 Main 上,它把自己和 Anthropic 的 Fable 5.1 摆到了几乎同一条线上,而成本只有对方的零头。

开源底座的"再训练"红利

SWE-2 的底座不是自研基座,而是月之暗面 2.8T 参数的开放权重模型 Kimi K3——一个已经为 agentic coding 做过大量 RL 的模型。Cognition 在官方博文中称,他们的 RL 配方在这个"熟模型"上仍然找到了可观余量:多个基准上再涨 5-6 分,整条成本-性能前沿被平移。按官方说法,这也是该团队首次把 RL 后训练扩到万亿参数量级。

方法论上真正的看点,是单次 RL 训练同时覆盖全部推理档位。奖励函数写作 R = S − λe·C:S 是任务成败,C 是 rollout 成本(美元推理费与时间的混合),λe 则按基座 Pareto 前沿在每个档位的切线斜率去设。直观效果:模型不会被诱导"降档偷懒"——高努力档位假装成中档可以省成本,但 reward 不会因此增加,只有真实推高前沿才会。配套工程同样扎实:长度加权 reward baseline 稳住训练 KL;DSpark 投机解码加 SpecForge 训出的新 draft 模型把接受长度拉长 15%,并在线持续追踪策略变化;NVFP4/FP8 内核加量化感知训练压住显存。行为变化很直观:SWE-2 medium 做出首次真实编辑的中位步数从 SWE-1.7 的 48 步降到 18 步,平均轮次少 58%,均费便宜 81%——过度探索的毛病被"会判断哪段代码值得读"替代了。

成绩单与那盆冷水

官方表格四行基准:FrontierCode 1.1 Main 50.0%(Kimi K3 44.2、Grok 4.6 48.0、GPT-5.6 Sol 47.5、Fable 5.1 50.9、GPT-6 Astra 53.3、SWE-1.7 42.0);DeepSWE 1.1 拿 73.0%,仅次于 GPT-6 Astra 的 74.1%;Terminal-Bench 2.1 得 92.8%,是唯一一行压过表内全部对手的成绩。冷水在第四行:Terminal-Bench 4 只有 27.3%,而 Fable 5.1 是 55.8%、GPT-6 Astra 57.9%——第三方分析直言,"与前沿打平"在前三行成立,第四行不成立。长程终端任务上的这个差距,是"便宜 64%"叙事里最该被记住的脚注。

所以呢

SWE-2 已上线 Devin Desktop 与 CLI,并陆续铺到 Devin Web 和 Fusion。对行业,这件事的分量不在某一行跑分,而在它再次验证了一条路径:开放权重的价值不只是免费用,而是可以被第三方用一套公开方法论后训练成逼近前沿的商用模型。当 2.8T 的开源底座,遇上会训练整条 Pareto 前沿的团队,闭源厂商的溢价空间还剩多少?

参考:Cognition 官方博文;cellcog.ai 基准拆解;AI/TLDR 摘要。