从零预训练一个 2B 参数的语言模型要花多少钱?清华 PACMAN 组用一篇新论文给出了一个让整个学术圈都坐不住的答案:不到 6900 美元,而且是在消费级 RTX 5090 显卡上完成的。这个名为 Puro-2B 的项目还把完整训练配方——数据、代码、模型权重——以 Apache 2.0 协议全部开源。

背景:预训练的成本墙

语言模型预训练几乎成了「prohibitive cost」的同义词,对学术界和开源社区来说尤其如此。论文里给了两个参照:即使在小规模上,训练 Llama-3.2-3B 的成本超过 150 万美元,复现 SmolLM3-3B 也要超过 70 万美元。开源社区虽然已有开放权重的模型和开源训练配方,但「成本可控、硬件可及、完全开源」三者兼得的预训练配方一直缺位。Puro-2B 补的就是这个缺口。

他们做了什么

团队用这套配方在消费级 RTX 5090 GPU 上从零训练了一组 Puro-2B 模型,最多喂到 1.4 万亿 token,全程使用 FP8 精度。其中最好的模型计算成本不到 6900 美元,在他们设定的评测协议下接近 Qwen2.5-1.5B 的表现。这个成本效率是靠一整套组合拳实现的:硬件选型、低精度训练、hyperball 优化、课程化模型平均(curriculum model averaging),以及数据配方的精细设计。

工程细节同样值得细看。训练代码基于 NVIDIA Megatron-LM(core_v0.16.0)改造,公开发布的补丁保留了一系列实战能力:packed NPY 预训练数据与可断点续训的阶段切换、MuonHyperball 优化器(对归一化层、embedding、bias、输出层等非矩阵参数走正确的 AdamW 路由)、逐层分布式优化器状态的内存均衡、分块 FP8 与非持久化 checkpoint 兼容,以及数据损坏安全的重跑跳过机制。

两个额外发现

论文还给出了两条超出配方本身的结论。第一,团队在 Puro-2B 模型集合上拟合出一条「成本缩放律」:训练成本与平均性能直接挂钩,拟合结果显示约 4400 美元——低于 5090 这个数字——就足以达到 Qwen2-1.5B 的性能。第二,作为端到端案例研究,他们考察了预训练数据课程如何影响后训练之后的下游表现。这类受控研究只有在拿到完整预训练管线(而不只是模型权重)的前提下才做得出来,这也正是全栈开源的价值所在。

所以呢

Puro-2B 的意义不在于 2B 模型本身有多强,而在于它把「从零预训练」的入场券价格压到了一个实验室就能承受的量级。论文链接:arXiv:2608.27370,完整配方见 HF 收藏页。当复现成本从百万美元级降到几千美元级,学术 lab 的预训练研究才会真正活起来——你觉得下一个被拉下神坛的会是哪个环节?