10 月 3 日德国统一日当天,德国 AI 公司 Aleph Alpha 开源了推理模型 Kolibri-1:总参数 78B、每 token 仅激活 3.46B 的德英双语 MoE,Apache 2.0 许可,上下文最高 1M token。在 MoE 卷总参数的当下,「78B 总量、3.46B 激活」的组合外加一份少见的德语数据工程账本,值得拆开看。

为什么是 78B,不是 123B

内部前身 Kolibri Origin 是 30.6B 总参 / 3.27B 激活的验证模型,6 月完成预训练;9 月 11 日,Kolibri 完成 20T token 预训练。官方博客披露,团队试过放大到 123B:两张 H100 上,123B 只能同时服务 3 个 256k token 长上下文请求,78B 能扛 18 个,解码还快 28%。最终架构是 50 层 MoE,每层 384 个专家(1 共享 + 6 路由),40 层用 512 token 滑窗注意力、每 5 层保留一层全局注意力;FP8 权重,最低 2×H100 起步。支持四档推理力度与工具调用;1M 上下文已验证,生产环境建议控制在 262,144 token 内。

跑分有硬点,短板也摆在明面上

官方自报评测里,数学最亮:AIME 2025 拿 96.9,高于 12B 激活的 Nemotron 3 Super(91.7)和 Qwen3.6-35B-A3B(84.6);GPQA diamond 84.3;银行 τ³-bench 38.1,是同表 Qwen3.6(10.6)的三倍多。官方称可对标 4 倍激活量模型。但同一张表也写着另一面:英语总分 75.5,不敌 27B 稠密的 Qwen3.8(80.2);TerminalBench 2.1 只有 27.7,对比 Qwen3.8 的 76.8;SWE-Bench Verified 66.4,低于 Qwen3.6-35B 的 73.8。强项在 agentic RAG:Honeypot 80.8 领先全部对比模型。幻觉控制是差异化卖点:AA-Omniscience 上「不作答而非答错」的比例 44%(前代 15%),Merlin-Arthur 协议训练出的 M/A grounding 分 0.23,同表多数为 0。

德语才是护城河

最值得记录的是德语数据账本:20T 预训练 token 中 21.3%(约 4.3T)是德语,背后是 2.4T 的去重德语池,80% 由官方自建——1.3T 有机德语网页,加约 1T 用 LLM 改写的德语,机器翻译只占约 6%。理由很直白:翻译文本携带源语言的文化指纹,模型说德语、看世界却是美国的。配套 UniBPE 分词器在官方对比中德语压缩率 4.90 字节/token,高于 GPT-5(4.35)、DeepSeek V4(3.72)、Kimi K3(3.28)。算力账同样透明:768 张 B200、预训练 21 天,38 次中断全部自动恢复,总能耗约 950 MWh。

所以呢

Kolibri 的看点不在「又一个开源 MoE」,而在另一条路线:不追万能多语种,把单一语言的数据工程做穿——改写而非翻译、词法感知分词——再用 3.46B 激活的经济学换受监管行业的本地部署市场。当然,全部跑分都是官方自报口径,第三方复现尚未出现。对中文社区,它提了个镜像问题:我们做了这么多语种,有没有哪一个是把中文数据账本算到 token 级的?

参考:官方发布博客 aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model,HF 模型卡 huggingface.co/Aleph-Alpha/Kolibri-1。