Ling-3.0 Flash:蚂蚁 InclusionAI 用「KDA+MLA 混合线性注意力」+ 1/64 稀疏 MoE,把 124B 总参 / 5.1B 激活参数压成 Agent 生产级 Flash 模型
8 月 2 日,蚂蚁集团发起、定位为「开放科学型 AGI 实验室」的 InclusionAI,在 Hugging Face 上放出了下一代原生混合推理模型 Ling-3.0 Flash。它的核心叙事不是「再做一个更大参数的 MoE」,而是用一组相当激进的架构选择,把 124B 总参数 / 5.1B 激活参数 的模型,做到推理速度、长上下文效率、Agent 工作流都可比肩 1T 级旗舰的水平。
一组反直觉的工程取舍
按照 InclusionAI 给出的参数表,Ling-3.0 Flash 在架构上有四个值得展开的点:
- 混合线性注意力从预训练第一层就开始,而不是「先训全注意力、再蒸馏出线性层」。模型采用 5:1 交替堆叠的 Kimi Delta Attention(KDA)+ MLA:35 层 KDA + 7 层 Gated MLA,再加 2 层 Dense,共 44 层。这种从一开始就走 hybrid-linear 的做法,目的是让线性注意力天然吃到预训练分布,而不是事后打补丁。
- KDA 细粒度对角门控 + 1/64 稀疏 MoE:512 个 routed expert,每 token 激活 8 个,再加 1 个 shared expert。换算下来路由稀疏度约 1/64,这是当前主流 MoE 模型(1/8 到 1/16)之外更激进的一档。
- 注意力头 32、Hidden 2560、专家中间层 768:用偏小的 hidden / 专家容量换「激活参数足够轻」,这是「能跑在 4×H20 / 4×Blackwell」的关键。
- 训练上下文从 8K → 32K → 256K 三段式 schedule,而不是一步到位塞 256K。配合 SGLang 的
dev-Ling-3.0-flash镜像,推理端可以用 1/64 MTP(NEXTN)做投机解码。
为了吃下长上下文场景,Ling-3.0 Flash 原生集成 SGLang HiCache + Mooncake 分层缓存(物理双池 + 集群共享 L3),官方称在长输入场景下能把 TTFT(首 token 时延)降低 60%–80%——这对 Deep Research / BrowseComp 这类「开十几个页面、不停回灌历史」的任务,几乎是基础设施级的改进。
评测表现:5.1B 激活参数打 1T 旗舰的「Key Bench」
InclusionAI 给出的评测覆盖几类最容易被 Agent 框架卡脖子的任务:
- SWE-Bench Pro:56.6%(同档位 128B 范围内第一档)——这是 OpenHands harness 下、256K 上下文、decoding 用
temperature=0.6, top_p=0.95, max_new_tokens=32K的实测,直接衡量「拿到一个真实 GitHub issue 之后,能不能自己改完并跑通测试」。 - SWE-Bench Multilingual:72.4%——多语言软件工程评测,对 Java/JS/Python 等主流语言 + 新功能 / Bug Fix / 重构多种开发场景的综合考验。
- MathArena AIME 2026:93.2、HMMT Feb 2026:87——数学竞赛级任务。
- HLE(Humanity's Last Exam):22.7——通用知识推理基线。
- Tau3-banking-AA、MCP-Atlas、SkillsBench——分别对应金融域工具调用、MCP 工具全景、技能泛化。
工程生态上,官方明确列出 Ling-3.0 Flash 已经吃下的框架:Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw。换句话说,不是只能跑自家 demo,而是直接接入了当下最主流的 agent harness——这对一个开源 Flash 模型来说,比单卡跑分更有信号意义。
为什么是「Flash」而不是「Pro / Max」
InclusionAI 在模型名里刻意保留「Flash」后缀,定位上和 Google 的 Gemini 3.7 Flash 类似:不是旗舰本身,而是旗舰的快速版。真正的 1T 级旗舰是 Ring-2.6-1T(对应 12.4 倍总参、约 8.1 倍激活参数);Ling-3.0 Flash 的目标是在 5.1B 激活参数这一档,做到「能进生产环境的 Agent 模型」。
这种「同款架构不同规模」的 split,在 2026 年的开源 LLM 圈里已经形成一种共识:旗舰负责拉天花板评分,Flash / Mini / Lite 负责把成本、显存、TTFT 压到一个能塞进实际业务的水平。Ling-3.0 Flash 的 124B 总参 + 5.1B 激活 + 1/64 稀疏,本质上是在「每个 token 算力」和「每个 token 记忆」之间找一个新的 sweet spot。
推理部署成本:4 张 H20 / 4 张 Blackwell 起步
InclusionAI 给出的部署命令几乎是当前开源社区的「标准模板」:
- SGLang:
docker pull lmsysorg/sglang:dev-Ling-3.0-flash,然后 4×141GB 显存(H20-3e)或 4×Blackwell 节点,--tp 4 --context-length 262144 --speculative-algorithm NEXTN --mem-fraction-static 0.8即可拉起。 - vLLM:用 InclusionAI 维护的
ling_3_0分支(https://github.com/inclusionAI/vllm-ling-v3.git),启用 MTP--speculative-config '{"method":"mtp","num_speculative_tokens":3}',4 GPU 起跑。 - OpenRouter:Ling-3.0 Flash 在 OpenRouter 上有
inclusionai/ling-3.0-flash:free通道,直到 8 月 3 日前可免费调用;之后按 token 计费(具体定价 Hugging Face 模型卡未披露)。
样本参数官方建议是 temperature=0.6, top_p=0.95, top_k=20,thinking 模式默认开启——通过 chat_template_kwargs.enable_thinking=false 关闭。这意味着 Ling-3.0 Flash 把它默认当做一个「思考型」模型来卖:不主动调 thinking 的开发者,会拿到思考后的最终答案;要快的话再手动关。
我的判断:这条路线指向「Agent 时代的 Llama 3.1 8B」
把 Ling-3.0 Flash 的几个数字摆在一起:124B / 5.1B / 1/64 / 56.6 SWE-Bench Pro / 72.4 Multilingual / SGLang 原生 / HiCache / MTP / OpenRouter 免费——它实际上瞄准的是「Agent 时代的 Llama 3.1 8B / Qwen2.5-Coder-7B」那个生态位:不大,但性价比 + 开源 + 主流 agent harness 直接可用。
在中国 LLM 圈,这个生态位过去半年一直是 DeepSeek V4 Flash(284B 总参 / 13B 激活)和阿里 Qwen3.6 Flash(35B A3B)占着的。Ling-3.0 Flash 的入场,等于把「1/64 稀疏 + KDA 混合线性 + HiCache 长上下文」这套组合推到了开源社区面前——接下来值得看的不是 Ling 跑多高,而是 SGLang / vLLM 社区会不会把这套 MTP + HiCache 模板化,以及 Kimi、Qwen、DeepSeek 会不会在下一轮迭代里跟进同样的「hybrid-linear + 1/64」配方。
如果跟进了,2026 下半年的开源 LLM 大概率会出现一个明显的拐点:旗舰追 SOTA、Flash 拼 Agent 实用性,两者开始走完全不同的优化目标。Ling-3.0 Flash 是这条路径上目前最明确的一颗信号弹。
参考资料: