过去三年,大模型预训练的主流答案是「更多 token、更多算力」。9 月 9 日提交到 arXiv 的一篇技术报告给出了另一条路线:让模型在预测下一个 token 的同时,学会预测「下一个概念」。这篇 NCP-ArchPreview 在 9 月 11 日冲上 Hugging Face 日榜第一,拿到 127 个 upvote——社区显然被这个方向勾起了兴趣。

token 之上,再预测概念

论文的核心改动,是给标准 next-token prediction(NTP)加了一个并行的概念级目标 Next Concept Prediction(NCP)。模型先从自身隐藏状态里构建一个乘积量化(product-quantized)的概念词表,把跨越多个 token 的语义单元编码成离散概念;一个专门的 Concept Module 负责预测未来的概念,预测结果再回馈到 token 层面,引导后续生成。两个目标端到端联合训练,生成方式仍是标准的 token 级自回归,不引入另一套推理范式。

一半 token,追平同款 loss

规模数字是这篇报告最硬的部分:架构放大到 8.9B 参数,在 Dolma-3 数据集上训练 5.73T token,按论文自述,这是迄今规模最大的潜空间语言模型实证。效果上,只消耗 51.3% 的总训练 token,NCP-ArchPreview 就达到了 OLMo-3-7B 的最终预训练损失;完整预训练之后,下游宏平均反超 OLMo-3-7B 2.45 分,其中 GSM8K 提升达 5.99 分。对照实验单独验证了潜空间架构与 NCP 目标各自的增益;与严格参数对齐的 8.9B 基线相比,它用 85% 的计算量即可逼近后者的训练损失。

预训练结束,潜空间还在干活

这套概念空间在预训练之后仍有产出:只更新 1700 万参数的 VQ 模块,就能得到一个轻量的领域适配接口;把概念表示注入 DFlash2 投机解码草稿模型,平均接受长度提升 4.17%,开销几乎可以忽略。换句话说,概念层不只服务于训练目标,还能反哺推理加速与领域迁移。

名字里就写着「Preview」

冷静看,模型叫 ArchPreview 不是巧合:对比对象是开放基线 OLMo-3-7B,而非前沿闭源模型;「迄今最大潜空间语言模型」是作者自述,独立复现还需要时间。论文署名 Intern-NCP 团队共 28 位作者(含 Dahua Lin、Zhouhan Lin、Bowen Zhou 等),Hugging Face 页面已有 18 个模型引用这篇论文,社区跟进速度不慢。

算力越贵,目标函数的创新就越值钱。当「再加一倍 token」的边际收益持续走低,让每个 token 承载更难的预测任务,可能是比堆卡更划算的 scaling 方向。论文原文见 arXiv:2609.10715,社区讨论见 Hugging Face 论文页