8 月 18 日,Ornith AI 发布了开源模型家族 Ornith-1.5,一次放出三档规模:397B MoE、35B MoE(每 token 激活约 3B 参数)和 9B 稠密模型,后者还带一个量化后的 Mobile 版本,可以直接部署到 iPhone 和 Android 设备。这一代的主题不是堆参数,而是把 6 月 Ornith-1.0 提出的 self-scaffolding(自脚手架)框架,扩展成一个端到端的自我改进循环。

自我改进循环:模型自己出题、自己搭考场

官方博客对这套循环的描述相当激进:给定一个环境或代码库,模型会提出难度递增的新任务,专门挑自己还没解出过的类型下手;接着为每个任务生成或改进任务专属 scaffold——包括指令、工具、任务分解策略与编排;最后基于任务和 scaffold 产出解题 rollout。Reward 从 rollout 反向传播到全部三个阶段,用 GRPO 联合优化。也就是说,系统不只学着解更好的题,还同时学着出更有训练价值的题、搭更有效的考场。

任务侧的 reward 由三个信号相乘得到:有效性(任务可验证,验证失败直接归零)、前沿难度(用模型自身 rollout 的成功率估计,目标成功率设在 0.2——任务一旦被模型稳定解开,reward 自然衰减,逼着出题器继续升级难度)、新颖性(与历史任务缓冲区查重,防止重复刷同类题)。Harness 侧同样是三项相乘:任务对齐、reward 保真、抗 reward-hacking。这套设计把「课程」从人工策划变成了模型自产自销。

成绩单:397B 在 agentic coding 上逼近闭源前沿

官方公布的评测里,397B 旗舰在 agentic coding 一线表现最强:Terminal-Bench 2.1(Terminus-2)拿到 86.1,高于 Claude Opus 4.8 的 85.0;DeepSWE 56.0,接近 Opus 4.8 的 59.0;SWE-bench Verified 86 与 Opus 4.8 的 85.8、Kimi K3 的 86.2 处在同一档。对比同规模开源对手,它领先 GLM-5.2(Terminal-Bench 82.7、DeepSWE 46.2)和 DeepSeek-V4-Flash-0731(82.7、54.4)。

35B 档更值得注意:Terminal-Bench 2.1(Terminus-2)67.8,领先 Qwen3.6-35B(52.5)、Gemma-4-31B(42.1)和 Meta 的 Muse Glimmer-30B(51.7)15 分以上;SWE-bench Verified 79.0 对 73.4、52.0、76.0。DeepSWE 上 35B 拿到 22 分,而前代 Ornith-1.0-35B 和 Qwen3.6-35B 都是 0 分。9B 档 SWE-bench Verified 70.6、Terminal-Bench 47.0,明显超过 31B 的 Gemma 4,逼近 35B 的 Qwen3.6——考虑到它只有 9B 且量化后能塞进手机,这个成绩值得端侧团队认真看看。

397B 自己的代际进步也相当陡峭:DeepSWE 从 1.0 的 8 分涨到 56 分,Frontier-Bench v0.1 从 2.7 涨到 13.5。

边界与判断

需要说清楚的是,「追平闭源」只成立于 agentic coding 这一条线。Frontier-Bench v0.1 上,397B 的 13.5 距离 Opus 4.8 的 21.1 和 Kimi K3 的 23 还有明显差距;GPQA Diamond 92.8 对 Opus 4.8 的 93.6 也仍是落后。开源阵营在最难的任务上依然没有越过闭源前沿——而且这些分数目前全部来自官方自报,社区复现还没开始。

但对行业来说,Ornith-1.5 的价值可能不在分数,而在方法论的可复现性:它把「合成任务 + 自评 harness + GRPO」的完整配方——包括 reward 的乘法设计、有效性硬门控,以及评测防作弊细节(SWE-bench 评测时抹掉 git 历史、禁用网络防止检索现成答案)——全部写进了发布博客。当通用数据的边际收益越来越薄,下一轮能力增长到底来自更大的集群,还是来自模型自造训练信号,Ornith 用一个 397B 的开源实现给后一条路线投了票。至于这条自我改进循环会不会在更高难度上撞上「自己骗自己」的 reward 漏洞,他们的三信号乘法是第一道防线,真正的答案要等社区拿权重去复现(来源:ornith.ai/ornith_1_5.html)。