在 ExplorationBench 的世界里,EMIT(100) 打印出来的不是 100,而是 127——因为这个外星编程语言的整数会被悄悄异或 27;而 PLUCK 操作符虽然手册写着「从 0 开始计数」,实际却从 1 开始数。手册是错的,先验知识是反的,唯一的办法是动手试。

这正是这个新基准的设计意图。一个 20 人研究团队(署名机构含腾讯混元)把「AI 能不能真探索」这个玄学问题,做成了可执行、可验证的测量框架。论文《ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds》9 月 24 日挂上 arXiv(编号 2609.30199),目前已进入 Hugging Face 论文日榜。

为什么需要外星世界

测「探索」一直有个死结:任务必须对模型是新的,否则考的是背诵;但答案必须能精确验证,否则没法判分。数学和代码满足第二条、不满足第一条——预训练数据可能早就见过;真正的科学发现满足第一条、不满足第二条——验证可能要专家审好几年。

团队的解法是造两个「外星世界」。AlienCode 是一门小型计算语言,藏着 31 个发现目标、70 道留出任务;AlienLogic 是一个推理规则被改动的自然演绎系统,24 个发现目标、70 道任务。两个世界都是确定性可执行的:程序由解释器判分,证明由证明检查器判分,全程不需要 LLM 当裁判。模型拿到一份故意写错的手册和几个示例,然后有四轮探索机会——提交程序或证明、读返回结果、修正假设;每个里程碑后关掉工具考闭卷。

结果:探索有用,但没那么可靠

十个前沿系统(每个世界各跑三条独立轨迹)的成绩单信息量很大:

  • 探索前,没有任何轨迹在 AlienCode 上超过 15.7%;四轮自主探索后,Best@3 最高冲到 87.6%(Claude Opus 5),十个里七个超过 60%。
  • 把环境反馈拿掉、让模型用同样轮数纯空想,成绩只剩 0.5%–11.0%——多想不等于多知道。
  • 谁设计实验很关键:自主选题中位数 66.0%,把自己最佳轨迹的探针原样重放降到 40.7%,换成固定探针序列只剩 5.7%。证据完全一样,差距来自「设计实验」这个动作本身。
  • 榜单还会互相打架:Grok 4.6 在 AlienCode 只排第五,到 AlienLogic 直接第一;DeepSeek-V4-Pro 在 AlienCode 以 12.9% 垫底,在 AlienLogic 却有 73.8%。两个榜单排名相关性只有 0.35——「探索能力」并不是一个可以随身携带的通用分数。

更扎心的是三个负面发现。说了不等于会做:把所需规则正确说出来的系统,对应任务也只有 70.9% 做对。探索不可靠:同一系统同一预算下,轨迹之间最大能差 72.8 分,30 条 AlienCode 轨迹里有 6 条收尾比中途里程碑还低。以及在 AlienLogic 里,直接把完整规则表喂给模型能拿 93%–97%,仍然强过所有系统的自主探索。

所以呢

这份数据对「AI 科学家马上要替代研究生」的叙事是一盆温度合适的冷水:前沿模型确实能在有限预算内从零摸出一整套陌生规则——这部分是真的强;但同样的系统换一条轨迹重跑,结果可能大幅缩水,把自己发现的规则背出来也不保证会用。把它当作「探索能力尚不可靠、不可迁移」的测量工具,可能比把它当新排行榜来刷更有价值。

参考:arxiv.org/abs/2609.30199