Ling-3.0-tiny:蚂蚁把 1.3B 激活的 KDA+MLA MoE 端到端跑在 M4 Pro 上,FP8 8.3 GiB 峰值、INT4 115 tok/s
一句话背景
2026 年 8 月 17 日,蚂蚁集团旗下 InclusionAI 在 Hugging Face 发布 Ling-3.0-tiny —— 一个 7.9B 总参数、约 1.2–1.3B 激活参数的混合线性注意力 MoE。它是 Ling-3.0 系列里最小的一档,目标是在 Apple Silicon MacBook、NVIDIA DGX Spark 这类本地硬件上跑生产级 Agent 任务。BF16 / FP8 / INT4 三种精度权重同步放出,MIT 许可证。SGLang(SGLang cookbook)、vLLM、Ollama(社区 PR #17643)在同一天给出官方支持。
这不是又一次"更小的模型"。这是把 KDA(线性注意力)+ MLA(多头潜变量注意力)这种原本只在大模型里验证过的混合注意力栈,端到端搬到 1.2–1.3B 激活参数的体级。
核心架构:从 5:1 到 3:1
Ling-3.0-tiny 跟一个多月前发布的 Ling-3.0 Flash(124B/5.1B)同属 Ling-3.0 系列,但在注意力排布比例上做了不同取舍:
- Ling-3.0 Flash:35 层 KDA + 7 层 Gated MLA,5:1 的比例,512 路由专家、激活 8 个
- Ling-3.0-tiny:3 层 KDA + 1 层 MLA 组成 4 层 block,3:1 的比例,128 路由专家、激活 8 个 + 1 个共享专家
Ollama PR #17643 的实现细节里给出了这层架构的工程化描述:每四层 block 交替 3 层 KDA 线性循环层 + 1 层 MLA 层,搭在一个稀疏 MoE FFN 上(128 路由专家,激活 8 个加 1 个共享)。KDA 部分走短卷积 + 分段 delta-rule scan + safe-gate decay + sigmoid-gated RMSNorm;MLA 部分是 576 维压缩潜变量 + interleaved RoPE + absorbed latent KV cache(把 576 维压缩潜变量直接缓存,不再展开成 per-head K/V,KV 内存砍约 10 倍)。
因为激活参数只有 1.2–1.3B,每少一层全注意力就意味着少一次 KV cache 的内存放大,这个权衡对端侧更敏感。所以 tiny 把 KDA 密度做高,MLA 只占 25%。Flash 反过来,大模型 KV cache 占比小,可以放心给 MLA 更多密度。
实测端侧账本(关键数字)
InclusionAI 在三种本地硬件上做了验证:
| 硬件 | 精度 | 输出速度 | 峰值内存 |
|---|---|---|---|
| Apple M4 Pro MacBook(48GB 统一内存) | FP8 | ~105 tok/s(Ollama MLX 优化后) | ~8.3 GiB(8K 上下文) |
| Apple M4 Pro MacBook | INT4 | ~115 tok/s | ~6.1 GiB |
| Apple M4 Pro MacBook | BF16 | ~68–71 tok/s | ~14.9 GiB |
| NVIDIA DGX Spark | FP8 | 100–105 tokens/s | — |
| Mac mini(MLX 后端,Ollama PR #17643) | BF16/FP8/INT4 | 同样定位端侧 | — |
Ollama 团队还专门做过 256K 长上下文压测:Ling-3.0 Flash FP4 128K prefill 在 GB10(128GB)上跑出 122,292-token 完整 prefill,峰值 ~96.7 GiB;tiny 走同样的 MLA chunked prefill 路径,在 M4 Pro 上 8K prompt 跑出 429 tok/s prefill、89 tok/s decode,峰值 28.3 GiB。
Artificial Analysis 的端到端测试里,Ling-3.0-tiny 跑出 18 秒 完成 500-token 响应(含 thinking 阶段),持续输出速度稳定在 160+ tokens/s,Artificial Analysis Intelligence Index v4.1.1 得分 25,Agentic Index 16。SGLang 团队自测 GSM8K 94.01%(单卡 BF16)。
BF16 / FP8 / INT4 三档:同一份权重,不同硬件路径
权重文件同步放出三档:
- BF16:~15.8 GB,SGLang / vLLM 默认启动精度
- FP8:
inclusionAI/Ling-3.0-tiny-fp8,blockwise E4M3(128×128) + dynamic activation,把 attention projection / dense MoE gate / lm_head 留在更高精度,~7.9 GB - INT4:
inclusionAI/Ling-3.0-tiny-int4,compressed-tensors W4A16 路由专家,~5.8 GB
MLX 量化精度验证(Ollama PR 实测,CUDA torch bf16 参考):
| 精度 | rel L2 | cosine | argmax | peak memory(M4 Pro) | decode(M4 Pro) |
|---|---|---|---|---|---|
| BF16 | 0.027 | 0.9996 | match | ~14.9 GiB | 68–71 tok/s |
| FP8 → MXFP8 | 0.077 | 0.9970 | match | ~8.3 GiB | ~105 tok/s |
| INT4 | 0.153 | 0.9883 | match | ~6.1 GiB | ~115 tok/s |
注意 INT4 反过来比 FP8 还快 —— 因为 INT4 路由专家用 GatherQMM 走 end-to-end 的量化路径,从不实例化 BF16 专家,省掉了 dequant + 重计算的内存带宽和 kernel 启动开销。
部署脚本直接挂在官方 Model Card 上:docker pull lmsysorg/sglang:dev-Ling-3.0-tiny 是 SGLang 预构建镜像,256K YaRN 上下文通过 --json-model-override-args 走 ROPE 旋转 + partial_rotary_factor=0.5 启用。这套部署在 H20-3e 单卡(141GB)或单卡 Blackwell 节点上就能跑起来。
Agentic 训练环境超过 1 万个
跟 Ling-3.0 Flash 一样,tiny 在 10,000+ 交互式训练环境里做过端到端闭环训练,覆盖 Coding、General、Deep Research 三类 Agent 任务。原生集成的 SGLang HiCache + Mooncake 分层缓存架构(物理双池 + 集群级 L3 缓存)在长链路交互里减少冗余重算,长输入场景下 TTFT(首 token 时间)下降 60–80%。
thinking 默认开启,通过 chat_template_kwargs.enable_thinking=false 关掉。SGLang 默认走 --reasoning-parser deepseek-r1 和 --tool-call-parser glm45(跟 Flash 的 ling3 解析器不同,因为 Chat Template 用的是 Bailing 的 <role> + <arg_key>/<arg_value> 结构)。
端侧 LLM 的"能跑"和"能用"分水岭
把它放到 2026 年 8 月的版图上看:
- 端侧 LLM 真正进入 thinking 默认开 + 长上下文不掉速。Apple Silicon 上跑 105 tok/s FP8 + 256K prefill 429 tok/s + 6.1 GiB INT4,意味着 16GB 内存的入门 MacBook 也能放下 INT4 权重,跑 thinking mode 不卡。LFM2.5-2.6B(220 tok/s,2.6B 全激活)、Qwen3.6-35B-A3B 之前的端侧模型都打到了 200+ tokens/s,但 thinking 默认开启 + 256K 长上下文不掉速 + KDA 线性注意力栈下沉到 1.3B 激活参数,Ling-3.0-tiny 是首批。
- KDA 类线性注意力不再是论文话题。2025 年底它还停留在 arXiv,2026 上半年主要在大模型里验证(Kimi K3 是旗舰,Kimi Linear 是论文)。Ling-3.0-tiny 把 KDA+MLA 的混合栈下沉到 1.2–1.3B 激活参数的体级,等于宣告"线性注意力 + MoE"作为完整配方在端侧可行。Ollama 团队的 PR 用了近 10 个 commit 才把这套架构的 MLX 实现稳定下来(从吸收式 MLA cache 到 KDA chunked prefill scan),说明这条路线的工程门槛不低。
- 中国开源生态在 Agent 时代补齐"中小尺寸"。Qwen3.6、Kimi K3 是旗舰(>100B),Ling-3.0-tiny / LFM2.5-2.6B / LFM2.5-VL-3B 是端侧(1-8B)。中间 8B-30B 这段仍是各家争夺焦点,但端侧的 production-ready 模型开始密集出货,意味着 Agent 框架(Hermes Agent、OpenClaw、Cline、OpenHands 等)的本地路径不再依赖云端 API。
我会盯着的下一步
- 真实 Agent 工作流上的 SWE-Bench Pro / MCP-Atlas / BrowseComp 跑分,而不是只看 Artificial Analysis Intelligence Index 或 GSM8K。Ling-3.0-tiny 官方测评覆盖到了这些但没给出独立复现数字。
- 1-bit 量化在 MoE + KDA 上是否能继续工作。Kimi K3 的 MXFP4 + QAT 是前车之鉴,但 MoE + KDA 的 1.3B 激活子网络在更激进的量化下是否仍然稳态,这是端侧真正普及的关键。
- Apple Silicon 上的 NPU / Neural Engine 加速。当前 Ollama + MLX 走的是 GPU 路径,Apple Silicon 的 ANE 还没有看到 Ling-3.0-tiny 的适配 demo,如果出现就是端侧 LLM 的下一个大事件。