Ai2(Allen Institute for AI)在 Hugging Face 博客公开了 BenchMIRT——一种多维 IRT 方法。它把 LLM 基准拆到单题:16 个基准、3.4 万道题、100 个开源模型,分别给出 safety 和 general reasoning 两个维度的能力估计。结果很尴尬——大量被默认归到「安全类」的基准,跑出来的真实信号其实更接近「通用推理」。
为什么这件事值得专门写
过去两年,LLM 排行榜几乎被 MMLU、GPQA、Chatbot Arena 一统天下。同一个「第一名」在不同榜单上动辄差 10 分,OpenAI、Anthropic、Google 三家互有胜负。根问题是现行榜单把能力混着测——一个 BBQ 题目(测社会偏见)同时需要「理解谁是爷爷、谁是孙子」+「会不会写出刻板印象」,两个因子搅在一起,低分到底是 safety 还是阅读理解?BenchMIRT 想回答的就是这种问题。
BenchMIRT 怎么做、发现了什么
方法不新:单维 IRT 在 SAT、GRE 用了几十年,原理是根据答题情况反推每道题的难度和区分度。Ai2 之前 Fluid Benchmarking 引进过单维版,这次升级到多维。实验规模:100 个开源 LLM × 16 个基准 × 3.4 万题。6 个测通用推理(MMLU-Pro、GPQA、MATH、BBH);10 个来自 Ai2 自家 Olmo 3 安全套件(HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest)。
关键发现:BenchMIRT 没被告知「哪些基准测的是 safety 还是 reasoning」,却自己稳定恢复出两个主维度。
几条反直觉结论:BBQ(测社会偏见)和「通用推理」的相关性远强于「安全」;WMDP(测危险知识)方向相反——推理越强的模型越会「安全地装作不知道」,被 WMDP 判「答错」;HarmBench 的版权题跑出来更像通用推理维度,和有害请求类不在同一信号上。
对 LLM 评测行业的实际影响
「基准瘦身」变得可执行。只保留 10% 的题目,模型排序基本不变;保留 50% 时排序几乎完全一致。MMLU-Pro 等被诟「刷不动」的榜可压缩到十分之一成本,效果损失很小。
榜单设计者要重新审视「这个基准到底测什么」。BenchMIRT 预测单题答对与否的准确率是 79%,简单基线只有 70%。看似只提升 9 个点,但能让评测人员精确知道「哪几道题最能反映 safety 维度」。
副作用也明显:BenchMIRT 给出的「哪些题最有区分度」,反过来就是「删掉哪些题就能让安全差的模型蒙混过关」。Ai2 坦承这是真实风险,但认为可解释性收益大于被绕过风险。
几点观察
100 个模型的训练截止时间都被锁在 2025 年 3 月之前,意味着 BenchMIRT 对 GPT-5 系列、Claude Opus 5、Gemini 3.x 这些 2025 下半年到 2026 年的新模型不一定成立。
另外,BenchMIRT 找到的维度强烈依赖喂进去的基准池。这次偏 safety + reasoning,下次喂代码、数学、多模态,出来的大概率会变成「代码 / 数学 / 多模态」三足鼎立。这套工具能告诉你「你现在测的能力到底有几种」,但不能告诉你「还有哪些能力是你没测的」——这是它的盲区,也是未来 LLM 评测要补的一课。
回到行业视角:Chatbot Arena 已是事实标准「全民榜」,但 ELO 只有总分。BenchMIRT 这类方法若能整合进主流榜单——给每个模型出一张「能力向量图」——LLM 评测可能从「谁的分高」升级到「谁在哪个能力上更强」。这件事比模型本身一次升级更有结构性意义。