科学界积累了几十年的可执行知识——大气模型、海洋环流、等离子体模拟、量子多体计算,这些代码能跑出与真实世界对得上的数字。但它们始终没能成为大模型训练经验的主力:工具链碎片化、领域约定隐式化、正确性标准专业化。PhAI Labs 牵头的 45 位研究者把这道墙拆了:9 月 16 日发布的 ScienceIDE(arXiv:2609.19134)把全球科学代码库改造成智能体可交互、可验证的训练环境,次日登上 Hugging Face Daily Papers 日榜第二位。
科学经验的瓶颈在哪
论文把这个问题命名为「科学经验瓶颈」:科学代码里的知识是可执行的,却无法直接转成可靠的学习经验。通用代码基准有现成的测试套件,科学代码的「对错」却要靠重编译、重跑物理算例、对比参考输出才能判定。于是团队的做法不是造数据集,而是造环境:在专家定义的科学算例和验收标准指导下,智能体把代码仓库本身变成可编程环境,支持任务生成、执行和科学验证,同一套环境同时服务 SFT、强化学习和评测。
任务机制:奖励是「仿真又对了」
每个任务都在容器里跑,固定住一份未修改的上游科学代码。两条任务路线:Repair 向源码注入一个语义缺陷,智能体要找到并修好它,让物理算例重新通过;Implementation 把某个例程的实现体挖空,让智能体重写出能复现原有结果的版本。打分公式很讲究:reward_repair = max(0, (reward − floor)/(1 − floor)),floor 是未修复版本本来的得分——什么都不改的智能体拿零分,奖励只能来自「仿真在数值上重新正确」,而不是骗过 diff 比对。
仓库发布 64 个环境中的 15 个(Athena++、MITgcm、Gkeyll、DScribe、NEST、EDKit、Stim 等),覆盖天体物理 MHD、海洋生物地球化学、等离子体动力学、材料描述符、量子多体;另外 49 个只留名字作为测试集。85 个 ScienceIDE-Hard 任务发布 30 个,每个都经过执行验证:官方修复在评分容器里拿满分,未修复版本留有奖励空间,智能体镜像里不含任何答案。
模型学到什么
用验证过的交互轨迹,团队训练了 PhAI-IDE-4B/9B/72B 三个模型(Hugging Face 已开放)。科学任务上:SFT 后 9B 在 LAPS 环境从 0.3125 提到 0.5000,4B 在 PLUTO 尘埃颗粒环境从零起步拿到 0.3333;RL(从 Qwen3.5-4B 起步,异步 GRPO)在 LAPS 从 0.357 拉到 0.857,MITgcm 生物地球化学环境从 0.286 到 0.571。更有意思的是正迁移:4B 在 CodeXGLUE 缺陷检测涨 6.99 个百分点,9B 在 BBH Word Sorting 从 27.20 涨到 63.20,足足 36 个百分点——科学修复经验外溢到了通用能力。
不过增益并不均匀,论文自己也报告了 9B 在 HumanEvalFix Python 上的下降。
所以呢
RL 后端没有自研训练器,直接跑在改造自 veRL 的 PSRL 上——重心显然在环境,不在训练框架。项目明确标注 preview 状态,完整环境集和任务生产管线放在 ScienceInfra 仓库待成熟后放出。这件事的真正信号是:当你能给 AI 一台「自己判断对错」的物理世界裁判,几十年沉睡的科学代码就变成可再生的训练资源。对做垂直领域智能体的团队,「验收标准先行、环境其次、模型最后」这个顺序值得抄。
参考:arXiv 2609.19134,github.com/aitofound/ScienceIDE