AI 公司与数学界「错位」:两个月三次刷屏,把同行评审甩在身后
OpenAI 1 万智能体 88 小时找到 Navier-Stokes 失效特例,Anthropic Claude 11 天写完费马大定理 1300 万行 Lean 形式化证明;25 位菲尔茨奖得主联名发公开信,点名 AI 公司把解题当 benchmark…
生命科学、化学材料、物理世界模型——AI 正在从"语言工具"变成"实验伙伴"。本专题收录 AI 在三大科学方向的关键节点:UniPert 统一基因与化学扰动空间、GPT-Rosalind 端到端生命科学推理、达摩院 AI 智能体 28 小时找到 4 种超导新材料、Anthropic Claude Science 把工作台做成标准品。
OpenAI 1 万智能体 88 小时找到 Navier-Stokes 失效特例,Anthropic Claude 11 天写完费马大定理 1300 万行 Lean 形式化证明;25 位菲尔茨奖得主联名发公开信,点名 AI 公司把解题当 benchmark…
OpenAI 宣称用 1 万个智能体找到 Navier-Stokes 方程失效特例一周后,克雷数学研究所公开回应:成果须先在同行评审期刊发表、满两年并获数学界普遍认可,而 OpenAI 尚未给出完整证明,官方确认最早要到 2029 年。
包括陶哲轩、邓煜在内的 25 位菲尔茨奖得主联名发布《A Severe Misalignment of AI in Mathematics》宣言:AI 公司把解题当 benchmark 竞赛,与数学界追求概念理解的目标严重错位,仓促发布更引发归属权与剽窃争议。
OpenAI 用约 1 万个 AI 智能体、88 小时发现带外力 Navier-Stokes 爆破特例;NYU 数学家公开指控其抓取未发表成果,引爆数据伦理争议。
OpenAI 宣称用约 1 万个 AI 智能体在 88 小时内找到带外力 Navier-Stokes 方程的爆破特例,自估复跑成本约 1500 万美元;因两位数学家此前已用 Codex 做出相关工作,事件陷入抢发与数据使用争议。
NTU S-Lab 等机构发布 Puffin-World:统一多模态架构同时建模物理、几何、外观三种原生世界状态,配套 Puffin-16M 数据集(15M 三元组+1M 轨迹)。四个相机感知基准全部拿下中位误差第一,代码、模型、数据集已开源。
腾讯生命科学实验室与中南大学联合研发的 UniPert-G2CP 算法登《Cell》主刊,系国内首个 AI 虚拟细胞研究。算法把基因扰动与化学扰动映射到统一语义空间,解决细胞特异性响应难题;覆盖 4994 个基因、7860 个化合物和 5 种癌症细胞系,核心模块 UniPert…
2026 年 6 月 30 日,Anthropic 在 Pro/Max/Team/Enterprise 套餐中正式开放 Claude Science beta——面向科研工作者的 AI 工作台应用,macOS 与 Linux 同步上线。…
百年超导探索终于有了 AI 队友。 7 月 3 日,阿里达摩院联合人大高瓴人工智能学院、中科院大学发布业内首个专攻超导材料发现的 AI 智能体 **ElementsClaw**——仅 **28 个 GPU 小时**扫遍 240 万种稳定晶体,预测 6.8…
2026 年 6 月 23 日,英伟达正式推出 NVIDIA BioNeMo Agent Toolkit,把过去十年沉淀的生命科学库、工具和开放模型打包给 AI Agent 和科研人员使用。找证据、跨论文推理、跑计算实验、推荐下一步这条科学发现链路,第一次有了官方端到端支撑。…
arxiv 2606.13662(Amy Xin 等,Lei Hou / Juanzi Li 共同作者)抛出一个并不讨巧、却很有杀伤力的判断:随着模型能力继续拉高,自主科学发现(autonomous scientific discovery)的瓶颈正在从"写更好的 agent…
OpenAI 在 6 月 3 日为 GPT-Rosalind 系列推出重大更新,核心是同步发布 LifeSciBench —— 一个由外部生命科学专家评判的端到端评测基准。与传统基准只考察单点能力不同,LifeSciBench…
一款新药从靶点发现到FDA获批,平均需要10到15年。这个漫长周期里,早期研究的质量会像复利一样向下游传导——选对靶点,临床成功的概率就会更高。问题在于,生命科学研究者面对的不是单一任务,而是文献、数据库、实验数据、不断演进的假设之间的反复横跳,流程碎片化,难以规模化。…