人类顶尖玩家在陌生文字游戏里能打出 84.3 的峰值分,Claude Opus 5.5 是 80.1,差 4.2 分。但把整场表现平均下来,局面反转:Opus 5.5 平均分 61.0,比人类 Top-1 参考的 53.5 还高。这组数字来自新加坡国立大学 Bryan Hooi 团队 10 月 8 日放出的 Learn2Play Bench(arXiv:2610.08215),已冲进 Hugging Face Daily Papers 日榜第二,拿下 131 个赞。
先把「背题」这条路堵死
现有智能体基准有个通病:规则要么写在说明书里,要么预训练时早见过,分不清模型是在「学」还是在「背」。Learn2Play 设计 20 个全新文字游戏模板,规则刻意新颖甚至反直觉,只能靠试错摸出来——模型权重全程不动,经验只留在上下文里。种子生成实例,反馈可复现、计分全自动;部分游戏换「局」不换「规」,专测学到的规则能不能迁移。协议:每个模板固定一颗规则种子、跑 3 次独立试验,普通游戏 5 局、挑战游戏 10 局,分数按参考天花板归一,挑战局权重 3、普通局权重 1。
榜单:均值反超,峰值还差一口气
15 行榜单(11 个 OpenCode backbone 加 4 档人类参考)最扎眼的是三行:Claude Opus 5.5 峰值 80.1、均值 61.0,均值一项超过所有人类参考,包括每个游戏取最高分玩家拼出的 Top-1(53.5);人类 Top-1 仍以 84.3 守住峰值第一;学得最陡的是 Qwen 3.8 Max,学习增益 +25.2 居榜首。GPT-6 Astra 峰值 76.2 排模型第二,Kimi K3 68.5,DeepSeek V4 Pro 54.2,GPT-5 Mini 垫底 34.0,连人类均值参考(43.6)都没过。
固定模型换 harness,白捡 7 个点
第三个发现对工程侧最实用:backbone 不变,只换智能体 harness,性能能涨、预估推理成本还能降。成本-性能图的极端案例是 Claude Code 配 Opus 5:峰值冲到 81.8%,比 Opus 5 裸当 backbone 的 74.5 高出 7 个点以上,离人类 Top-1 只剩 2.5 分。Astra 账单透明:全程 150 美元、600 局验证完成,每局 0.25 美元。
完整记录胜过聪明总结
两个反直觉观察。其一,把完整的动作与反馈记录原样塞回上下文,比让模型先把经验总结成规则或策略再带着上场,学得更好——「总结」本身就是信息损耗。其二,人类玩家峰值更高的同时,探索策略更多样、重复动作更少;模型则在同样的坑里反复跌。
读数之前,先泼三盆冷水
项目页自己标注:榜单为人工维护的快照(10 月 8 日更新),不自动刷新;所有数字是聚合点估计,不做显著性检验;人类参考是「每个游戏取最强玩家」的拼盘,不代表普通人,且人类答题不许用任何 AI 工具或代码。代码仓库是匿名评审快照,12 星 3 次提交,20 个模板用 Python 3.10+ 标准库就能跑(如 python play.py poisoner --seed 2),试玩门户 learn2play.fun 需登录。
参考:arxiv.org/abs/2610.08215 · 项目页 liushiliushi.github.io/learn2play-bench-website · 代码 github.com/liushiliushi/Learn2Play-Bench。
平均分追上甚至超过人类,意味着「稳定地学」这件事模型已经做得不错;还差的那 4.2 分峰值,考的是第一次撞上反直觉规则时敢不敢多试几条路——目前为止,这还是人类的主场。