当一个多模态模型把图里的三个杯子数成两个,你很难分清它是"没看见",还是"看见了但没算明白"。现有视觉基准几乎都答不上这个问题——它们考的是端到端的最终答案,把感知错误和推理错误混在同一张成绩单里。Moonshot AI 这次干脆把两者拆开,发布了一个专门测"原子视觉感知"的基准 PerceptionBench,数据集放在 Hugging Face(CC-BY-NC-4.0),评测代码以 Apache 2.0 开源在 GitHub,方法论见 arXiv:2607.24957。
从 42 个基准的失败点反推
PerceptionBench 最有意思的不是分数,而是造题方法。团队没有先验地定义"视觉感知应该考什么",而是去回溯前沿模型在 42 个现有基准上最早出错的那个点,把失败归因到感知层面,再从归因结果里蒸馏出十类原子能力:视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR,以及感知幻觉。每道题只考一种能力,答案短且唯一,难度来自"看"本身而不是推理或知识。最终发布的 3000 道验证题,是从 17000 多个内部验证样本里按能力均衡和难度分层抽出来的;其中 60% 由源基准的失败案例分解而来,40% 围绕补充图片新写。
16 个前沿模型,没有一个过 60%
结果相当难看。16 个前沿多模态模型(10 个闭源、6 个开源)统一提示词、放开最大推理预算跑完全部题目,没有一个总体准确率过 60%:GPT-5.6-Sol 以 59.7 排第一,Kimi K3 58.5 第二,Claude-Fable-5 57.2 第三,Gemini-3.1-Pro 56.2,GPT-5.5 55.8。开源侧表现最好的 Qwen3.7-Plus 是 51.1;榜单下半区,Grok-4.5 只有 41.0,GLM-5V-Turbo 39.6,Minimax-M3 33.1,垫底的 GLM-4.6V 32.5。评分环节用 GPT-oss-120B 做裁判,在 300 样本人工审计下与人类判断的一致率为 99.7%。
更有信息量的是分项。总分接近的模型,能力剖面可能完全不同:GPT-5.6-Sol 的定位项拿到 76.7,Gemini-3.1-Pro 同项只有 52.7,两者总分却只差 3.5 分。总榜第一的 GPT-5.6-Sol 在感知幻觉这一项上只有 26.9——它经常"看见"图里不存在的东西;而总分只有 52.0 的 Gemini-3.5-Flash,幻觉项反而有 50.6。单看总榜,这些差异全部不可见。
猜对,不等于看见
论文还有一个不太显眼但很关键的观察:相当一部分答对的题,换个问法再问一遍就守不住了。这说明模型很多时候在模式匹配而不是真的感知——凭语言先验猜出"图里大概有什么",而不是把像素读出来。对依赖 VQA、MMBench 这类整体性基准选型的人,这是个提醒:语言能力强的模型可以用先验补偿感知短板,把整体分"考"上去。此外还有个结构性问题:各源基准捕捉到的感知错误切片重叠很弱,两两加权 Jaccard 均值只有 0.20——没有任何一组现有基准能近似覆盖感知全貌,想靠"多拼几个现有评测"凑出感知维度,拼不出来。
所以呢
对做多模态系统的团队,PerceptionBench 的正确用法是当诊断工具:一个总分 55 但深度感知只有 30 出头的模型,会直接告诉你训练数据该往哪补、架构该改哪。对其他人,这份榜单至少澄清了一件事——当下前沿模型的瓶颈未必在推理,而在更上游的"看"。连总分第一的模型都会把不存在的东西看成存在,你敢放心让它读片、验工件、盯监控吗?