一次"失败"的 54 小时,顺手改写了数论教科书的一行

先把结论说清楚:Claude 没有证明黎曼猜想。这个自 1859 年悬置至今、挂着克雷研究所百万美元悬赏的难题依然开放。但 8 月 10 日,Anthropic 公布了一个让数论学界集体侧目的结果——一个未发布的研究版 Claude 在 Claude Code 智能体框架里跑了大约一天半,把黎曼 zeta 函数零点落在临界线上的已被证明比例,从 41.6% 推进到了 67.2%(Forbes 报道)。

这个数字是什么概念?此前 37 年里,人类数学家在这个纪录上的全部进展是 0.8 个百分点。Claude 这一跑,单个结果推进了 25.6 个百分点——这是该问题 165 年历史上最大的一次单点跃进。Menlo Ventures 合伙人 Deedy Das 的评价是:这是自 2013 年张益唐有界素数间隔以来,解析数论领域最重磅的结果。

它是怎么做到的:31M token、60 个子代理、650 次死胡同

这次运行的工程细节本身就是一份值得拆解的样本(以下数据来自 Forbes 对 Anthropic 论文的转述):

  • 两次会话共输出 3100 万 token,部署了 60 个子代理,执行了 2400 条 shell 命令;
  • 第一个会话生成了 650 个候选思路,全部是死路;
  • 出证明的那个会话跑了约一天半,期间不断用数千个已知 zeta 零点做数值校验。

第一场 650 连败,第二场破纪录——这就是把"失败"按 token 计价之后的研究范式。

方法论上,Claude 做的是一次教科书级的跨流派综合:一条线是 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 等人改造 Montgomery 经典技巧的系列论文(使其不再依赖黎曼猜想成立),另一条是 Bombieri 2000 年的工作。两条线都在文献里躺了很多年,只是从没有人把它们"放在一起读"。数论分工细到一个人的职业生涯可以完全装进一个子领域,而 Claude 的优势恰恰是没有专业壁垒——它一次性读完了全部文献

更值得玩味的是引导者:据华尔街日报报道,推动这次尝试的 Jarred Sumner 正式数学教育止步于一学期高中几何,他靠不断鼓励模型"再试试"来引导整个过程,第一句提问里甚至拼错了 Riemann 的名字。这不是段子,这是对"专业知识垄断"的一次正面冲击。

验证:机器检查 + 两大佬人审

Anthropic 没有要求任何人"信它"。内部数学家 Levent Alpöge 和 Ralph Furman 先过了一遍论证;Claude 随后把证明形式化成 Lean 语言,通过了机器验证——这是大多数正式发表的数学论文都享受不到的审查强度。外部审阅者的名单也很有分量:Brian Conrey(1989 年那个纪录的保持者)和 Dan Goldston(Claude 所综合工作之一的作者)。

当然,诚实的限制也写在了明处:结果未走常规同行评审;跑出结果的模型未发布,无法端到端复现;Anthropic 自己也明说,不指望这套技术路线通向黎曼猜想的完整证明。

所以呢:贵的知识,便宜的综合

Forbes 这篇分析里有一句话值得每个做研究的人抄下来:昂贵的知识,廉价的综合。几十年的专业文献积累是昂贵的,而把它们连接起来的算力账单,相比之下几乎可以忽略。这个比例,就是前沿模型在科研里的商业案例——只是这周之前,它还是融资 PPT 上的一句话,现在它是一条经过机器验证的定理。

对普通读者的启发或许更朴素:下一次你面对一个"专家才有资格碰"的问题,记住这个画面——一个高中几何都没读完的人,一句拼错名字的提问,加上一个愿意失败 650 次的模型,就摸到了数论圣杯的边。专业壁垒保护的从来不是真理,是准入。