古诗词一直是大模型刷分的舒适区。在既有基准上,Qwen3-Max、Gemini-3-Pro 这类旗舰模型对唐诗宋词的判读准确率常年高企。但一篇收录进 ACL 2026 长论文名录的新工作提出了一个尴尬的问题:模型到底是「懂」诗,还是「背」过诗?

研究者搭建了名为 Neo-Classic 的评测基准,专门检验大模型的语言美学推理能力——也就是超越记忆检索、对格律和篇章结构做真正推理的能力。论文公开于 arXiv(编号 2609.19154),并收录于 ACL 2026 会议论文集(第 64 届年会长论文卷,页码 27442-27465)。

考卷怎么出:让背书失效

旧基准大多在历史语料上做验证或生成,模型完全可以靠预训练时「见过」来答题。Neo-Classic 换了一条路:基准由一套构造主义的样本外数据集加上一组反向理解探针组成,全部诗歌都由当代专家按严格格律新写,与训练语料天然隔离,直接检索这条路被堵死。配套的五个行为探针层层加码,专门检验层级化的约束满足能力。

成绩单:从历史到新诗,集体跳水

研究团队测了 Qwen3-Max、Gemini-3-Pro、DeepSeek-V3.2 三个旗舰模型。结果呈现两个层级的滑坡:第一,同样的题型,把文本从历史语料换成当代新作,性能差距拉出 20% 到 50%;第二,篇章级的排序任务上,标准准确率只有 0 到 13%。给推理增强型模型加上专家级指导后,成绩爬升到 36%,但与人类专家仍有明显差距。

局部会背,全局不会想

作者给出的判断很直接:当前大模型能捕捉局部形式模式,但在稳健的语言美学推理所需的全局层级规划上仍然挣扎。换句话说,模型能对上某一联的格律,却难以围绕整首诗的篇章结构做统筹。

所以呢

这篇论文值得注意的地方,不在「大模型古诗不行」这个结论本身,而在方法论:用构造主义的样本外数据加反向探针,把「记忆」和「推理」拆开分别计量。对中文能力评测尤其有参考价值——凡是语料里海量存在的文体,高分都可能是背诵的利息。什么时候模型在没人写过的新文本上也能做结构推理,什么时候才算真的读懂。对做评测的人来说,这是一套值得抄的出题思路。

参考:arXiv:2609.19154 / ACL 2026 长论文 DOI