9 月 1 日,聚合基准平台 BenchLM 刷新了 9 月榜单。开源权重阵营的第一名换了人:腾讯 8 月 28 日发布的 Hy4 preview 以 79.87 分(满分 100)登上开源权重榜首,反超 Qwen3.8 Max 的 79.4 分,同时在 228 个已排名模型的总榜上位列第 6。上个月同一榜单的开源第一还是 Qwen3.8 Max(79.2 分),一个月内开源旗手完成交接。
总榜格局:Anthropic 包揽前三
先把总榜前几名摆出来:Claude Mythos 5(83.57)、Claude Fable 5(83.32)、Claude Opus 5(83.24)、GPT-5.6 Sol(82.39)、Kimi K3(80.78),然后才是 Hy4 preview。前五名在榜单上都不是开源权重模型,Hy4 是它们身后第一个开放权重的模型。按厂商平均分算,Anthropic 以 83.4 分(20 款模型)领先,OpenAI 76.5(38 款)、阿里巴巴 74.7(23 款)随后。BenchLM 的六个月发布记录显示 178 次发布、5 次领跑者更替,Hy4 preview 被标为 8 月发布的最高分模型。
Hy4 的分数是怎么来的
BenchLM 的总分由 8 个加权类别构成,权重最高的是 Agentic(22%)和 Coding(20%)——恰好是 Hy4 最强的两块:Agentic 类别排名第 8(142 个模型中,95 百分位),Coding 排名第 12(147 个中,92 百分位)。
细看单行基准,Hy4 有四个项目拿下全场已验证最佳:WideResearch 83.9%、JobBench 61.7%、BankerToolBench 78.6%、数学类 Apex 74.2%。知识类也不弱:GPQA 92.3%,Humanity's Last Exam(带工具)55.4%。编码侧 Terminal-Bench 2.1 拿到 85.4%,距离榜首 GLM-5.3 的 88.2% 只差 2.8 个百分点。
工程侧,Hy4 preview 提供 1M 上下文窗口,腾讯在 Apache 2.0 许可下同时发布 BF16 检查点和 FP8 量化版,官方部署配方支持 vLLM 和 SGLang 自托管,但该检查点没有官方托管的 token 定价。
三盆冷水
第一,证据标签是 Estimated。Hy4 的档案页只有 28 行可展示的基准证据(平台共追踪 408 个基准槽位),Reasoning、Knowledge、Math、Multimodal 等类别都未达到排名门槛——平台明确说明这代表证据深度不足,不是能力为零,但选型时确实无从比较。
第二,两个明显的短板项目。ProgramBench(从零重建程序)只有 17.5%,该项目最佳是 Claude Opus 5 的 93.0%,差距 75.5 个百分点;Agents' Last Exam 22.8%,Qwen3.8 Max 是 52.4%。SWE-bench Pro 65.7% 对 Claude Mythos 5 的 80.3% 也还有 14.6 个百分点的距离。
第三,它叫 preview。速度未测、首 token 延迟未测、参数量未标注。从 4 月的 Hy3 Preview 到 7 月的 Hy3 再到现在,腾讯的 Hy 系列还在快速迭代期。
怎么读这次换榜
开源阵营的竞争焦点已经变了:不是「总分能不能逼近闭源」,而是在 Agentic 和 Coding 这两个权重最高、商业上最值钱的类别里正面竞争。Hy4 的登顶发生在 Agentic 权重 22% 的评价体系下,而且它的四个全场最佳全部来自 Agent 和工具使用类基准。
对选型的人来说,这份榜单的正确用法不是看总分,而是点进单行证据:如果你的工作流是浏览器研究、金融工具调用,Hy4 的单行数据现在是全场最好;如果是长程程序重建,它目前还不行。排名是快照,证据才是决策依据——这话说给所有看到「登顶」两个字就准备冲进去的人。
参考:BenchLM 9 月榜单(https://benchlm.ai/)与 Hy4 preview 档案页(https://benchlm.ai/models/hy4-preview)。