一个没发新闻稿的发布

8 月 13 日,韩国 Motif Technologies 把 Motif 3 的最终权重悄悄上到了 Hugging Face。没有博客,没有 X 上的官方通告,只是三个仓库在几分钟内同时出现 —— Motif-3-Base、指令微调的 Motif-3 和量化版 Motif-3-NVFP4,外加一份同时发布的 arXiv 技术报告 arxiv.org/abs/2608.09119

真正让开发者社区炸锅的不是参数规模,而是许可证:三份权重全部从 7 月 beta 的"仅供研究"切换到 MIT,从此商业使用、二次预训练、再分发都不再需要首尔点头。

数字看上去很熟悉,但架构是自研的

Motif 3 是 314B 总参数 / 13.2B 激活参数的 MoE,8 个专家 + 1 个共享专家、约 12.5 万亿训练 token、原生 256K 上下文。论文与官方模型卡 huggingface.co/Motif-Technologies/Motif-3 把规格摆得很细。

值得划重点的是三个自研组件 —— 不是任何已有开源架构的再参数化:

  • GDLA(Grouped Differential Latent Attention):把 Microsoft Research 与清华 2024 年的 Differential Transformer(用两组 softmax 注意力相减压制"注意力沉没")与 DeepSeek-V2 的 MLA(KV 压缩)结合起来,80 个 query 头配 16 个 KV 头,既降噪声又把 KV 缓存压住。
  • Expert-Specific PolyNorm:把 MoE 每个专家内部的 SiLU 换成可学习的逐专家多项式归一化,目标是缓解大模型训练中出 activation outlier 的老毛病。
  • mHC(manifold-constrained hyper-connections):把普通残差加法换成四条并行残差流的 doubly-stochastic 混合。配上一个 MTP head,做 inference 时能自我推测解码。

这个"全部自己来"的要求,是韩国政府 Dokpamo 计划的硬条件 —— 据 TechTimes 报道,Naver Cloud 与 NC AI 因为在模型里塞了 Qwen 冻结编码器权重被踢出局,1 月份就已出局。

跑分、吞吐量与一句话盘点

Artificial Analysis Intelligence Index 给 Motif 3 打 47,在 Dokpamo 四队里排第一,比 Upstage Solar Open 2(37)、SKT A.X K2(35)、LG K-EXAONE 2.0(31) 都高(口径见 BigGo Finance 的 Dokpamo 榜单)。厂商自报数据:τ²-Bench Telecom 94.7、SWE-Bench Verified 76.2、Terminal-Bench 2.1 74.9、GPQA Diamond 83.4 —— GPQA 这个分数接近闭源前沿 88-93 的下沿,SWE-Bench Verified 76.2 也能挤进开放权重第一梯队。

但有两点要看见:

  1. ** 第三方独立复现还没完成**。OrcaRouter 在独立分析里写得很直白:"这些指标是 Motif 自评的,外部还没跑完"。这点对任何新模型都正常,但写在标题党之前很重要。
  2. ** Motif 输出非常啰嗦**。最终版跑 2.6 亿 token,对照同档开放权重中位数 1 亿 —— 推理成本估算要把这条算进去。

部署要求 8 张 B200 或 H200,需要 Motif 自家 vLLM 分支(MotifTechnologies/vllm,Docker 镜像 ghcr.io/motiftechnologies/vllm:v0.20.2-motif3.rc3),目前没有任何推理服务商把它挂上去。

30 个人、5 个月与一份主权 AI 的最小可行证明

Motif Technologies 母公司是 Moreh,2020 年成立,2023 年拿了 AMD 与韩国电信投的 2200 万美元 B 轮。Motif 本身今年 2 月才成立,5 月 B 轮融资 1690 万美元(韩元约 240 亿),整个团队约 30 人。韩国政府通过 Dokpamo 划了约 768 张 B200 给他们。

5 月被选中,8 月 4 日向 NIPA 提交最终版 —— 从立项到能用的开放权重一共 5 个月。这大概是 2026 年"小型团队 + 国家级算力 + 严格原研约束"组合跑出来的最具说服力的样本之一。如果年底 Dokpamo 的两支胜出队伍要承担"AI for All"国家助手 50% 推理的硬性要求,那 Motif 的 MIT 权重已经是全球开发者可以现在就接住的入口。

所以呢

对一个被 DeepSeek / Qwen / Kimi / Llama 把"开放权重"卷成标配的行业来说,Motif 3 真正的意义不在分数 —— 它给出了一个干净的、原研架构 + 顶级宽松许可证 + 国家主权背书的组合样本。对国内团队:别再死磕许可证分发了,Dokpamo 这种"30 人 5 个月做出全球第一梯队"的模式比千亿参数竞赛更值得复盘。