8 月 20 日,开放权重模型家族 Ornith-1.5 上线 Hugging Face,很快冲上 Hacker News 首页,拿到 165+ 赞、58+ 评论。官方口径很响:397B 旗舰在 Terminal-Bench 2.1 拿下 86.1,微胜 Claude Opus 4.8 的 85.0,MIT 许可,397B/35B/9B 三档齐开。但几乎同一时间,社区的一组独立测试数字,给这份成绩单泼了冷水。

自报成绩单:赢在毫厘之间

explainx 整理的官方表格,Ornith-1.5-397B 在 Terminal-Bench 2.1 报 86.1(Claude Opus 4.8 为 85.0),SWE-bench Verified 报 88.4(对手 87.6);但在 DeepSWE 上,56.0 反而低于 Opus 的 59.0。官方注明数字为五次运行平均,且做了防作弊处理——评测前剥离仓库 git 历史、解题期间断网。在 reward hacking 丑闻不断的 benchmark 环境里,这算加分项。

技术故事本身也有新意。Ornith-1.5 把"自我改进"做成了训练期闭环:模型自己出题、自己搭脚手架、自己跑求解,三个阶段通过 GRPO 联合训练。出题侧的奖励由三部分构成——有效性是硬门槛,无效任务直接零分;难度瞄准约 0.2 的通过率,太高太低都不划算;新颖性作为辅助信号,防止生成器刷重复题。这套机制针对的正是"固定人类题库"的天花板。

独立测试讲了另一个故事

问题出在 35B 档。官方表格里,Ornith-1.5-35B 的 Terminal-Bench 2.1 报 74.8,把 Qwen3.6-35B-A3B 的 52.5 甩出二十多分。但 explainx 报道,一位 HN 用户自己跑了 Ornith-1.5-35B 对比 Qwen3.8-27B,结果方向完全反过来:Terminal-Bench 2.1 上 67.8 对 73.0 落后,SWE-bench Pro 59.6 对 61.7,HLE 25.6 对 30.8;差距最大的是 DeepSWE,22.0 对 42.2,几乎差出一倍。六项对比里,Ornith 只在 NL2Repo 一项反超,GPQA Diamond 打平。

当然要说明:这是单人非正式复测,且拿 27B 稠密模型对比 35B MoE,架构并不对等。但 DeepSWE 恰恰考察长周期软件工程能力,是最难突击应付的一类 benchmark,这个维度的巨大落差,很难全用"测试环境差异"解释。

自报的永远是自报

社区还挖出两个细节。其一,有用户在身份探测中发现该模型"稳定自称 Claude",这通常指向训练语料被 Claude 生成文本污染,而不是权重抄袭;其二,HN 考证认为 397B 底座是 Qwen3.5-397B-A17B 后训练而来,团队背后是 Jiwei Li——两条都未经官方确认,姑且听之。

平心而论,Ornith 的自我改进训练法值得研究,量化版 9B-Mobile 宣称可部署到 iPhone 和 Android,也是边缘侧的实用方向。但这次事件再次说明:厂商表格与独立复测之间的落差,是开源模型圈的结构性问题,五次平均的自报跑分也改变不了这一点。下次再看到"开源模型击败 Claude"的标题,先问一句——谁跑的分,跑了几次,在谁的环境里跑的。