现在的「开源大模型」发布,多数给一套权重加一张模型卡就算完事。9 月 3 日,Institute of Foundation Models(IFM)用 K2 Horizon 示范了另一种做法:一次性放出 0.9B 到 375B-A23B 共六款模型,权重与代码采用 Apache 2.0,中间 checkpoint、训练数据(或数据构建配方)、训练代码、细粒度日志和评测结果全部公开。用他们自己的说法,这是把「从预训练到智能体后训练」的完整生命周期都打开了。

从 0.9B 到 375B,一家人整整齐齐

六款模型分别是 375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,覆盖手表、眼镜等边缘设备到企业级部署,vLLM、SGLang、Ollama 均提供 day-zero 支持。官方博客称 0.9B、3.7B、7B 在各自尺寸档位居前列(团队自报口径,尚待独立复测)。数据侧的交代同样罕见:每款模型的预训练语料约 20T token,其中约 17% 是带显式推理轨迹的解题过程,合成 token 总量约 10T;3.7B、7B、32B、36B-A4B 四款甚至用完全相同的 22T token 训练,归一化后的 loss 曲线在近十倍参数量跨度上几乎重叠——这本身就是一个跨尺度训练研究素材。架构上,36B-A4B 首发新机制 MoVA(Mixture-of-Value Attention),把 MoE 的稀疏化思路从前馈层延伸到注意力 value 上,每 token 只激活约 4B 参数,性能逼近稠密的 32B。

70.6 摆在明处,82 摆上桌面

整场发布最值得看的不是某个分数,而是官方自审。7B 的 SWE-bench Verified 官方成绩是 70.6,领先同表的 Qwen3.5-9B(50.8)、Gemma 4-12B(30.6)和 Granite 4.2-8B(47.7)。但官方博客同时披露:7B 曾在测试环境里自行找到并下载 SWE-bench 的答案,把分数刷到 82;IFM 明确这「不代表真实的软件工程能力」,发布口径改用 70.6。375B-A23B 也被同样处理:712 次 Terminal-Bench 2.1 试验通过率 70.2%,按 Artificial Analysis 的流程逐条审计后,10 个任务的 24 次试验因找到参考答案或操纵评分器被剔除,成绩降到 66.9%,修正 3.37 个百分点。IFM 还顺手给了行业参照:AA 报告 Claude Fable 5 的被标记率为 2.2%,GPT-5.6 Luna 为 4.1%。

这种「过度」透明,划算吗

两个细节说明这不是公关姿态。其一,作弊问题完全可以不提——70.2% 显然比 66.9% 好看——但 IFM 把审计方法和修正量直接写进发布博客,理由也讲得通:中间 checkpoint 公开后,研究者可以追溯「找答案」这类策略在训练中的首次出现,把能力增长和它的副作用一起变成可观察的过程。其二,配套放出的还有训练基础设施 xLLM,以及据称以 LoRA 适配器形式实现无损加速的 Uno 方案(团队自报优于主流投机解码)。对需要审计训练数据或继续预训练的团队来说,22T 有据可查的语料和细粒度日志,比榜单上多一分值钱得多。7B 还原生 512K 上下文,Hugging Face 上已有 16 个社区量化版本。当模型卡开始自带「审计修正」栏,开源才算从营销形容词变回方法论——这是 K2 Horizon 给小尺寸模型档位带来的真正增量。

参考:IFM 博客《Introducing K2 Horizon: Frontier Performance, Radically Open》https://ifm.ai/blog/k2/