一份「不用数据中心」的模型卡

inclusionAI 开源了 Ling 3.0 系列的入门款 Ling-3.0-tiny:总参数 7.9B、每 token 仅激活 1.3B 的混合推理 MoE 模型,MIT 许可证,权重已上 Hugging Face。与同系列此前定位生产级的 Flash 档不同,tiny 的目标很明确——把混合推理能力塞进本地和资源受限的部署环境。

架构:3:1 的 KDA+MLA,配上 128 选 9 的稀疏 MoE

Ling-3.0-tiny 继承了 Ling-3.0 系列的混合线性注意力架构,核心是两件事的叠加:

  • 3:1 KDA-MLA 堆叠:每 4 层块由 3 层 Kimi Delta Attention(KDA)加 1 层 Multi-Head Latent Attention(MLA)组成,官方称这样在长上下文处理效率、参数效率和计算成本之间取得平衡;
  • 稀疏 MoE FFN:128 个路由专家里,每个 token 只激活 8 个路由专家加 1 个共享专家——这正是 7.9B 总参数只动用 1.3B 的原因。

模型原生支持混合推理:thinking 模式默认开启,也可以通过 enable_thinking 按请求关闭,同一个模型里既给快速响应也给多步推理。官方同时放出了 BF16、FP8、INT4 三档权重,覆盖从服务器到消费级硬件的部署组合。

端侧账本:三组数字

这份模型卡最有意思的地方,是它直接给出了消费级硬件的实测数字:

硬件 精度 速度
NVIDIA DGX Spark FP8 约 100-105 tokens/s
M4 Pro MacBook FP8 约 86-90 tokens/s

8K 上下文长度下,峰值内存约 8.34 GiB。在 Artificial Analysis 的测试里,它输出速度超过 160 tokens/s,500 token 响应(含推理时间)端到端延迟约 18 秒;AA Intelligence Index v4.1.1 得分 25,AA Agentic Index 得分 16。

工具链现状:一个模型,三种成熟度

部署路径的差异值得单独说——这可能是端侧模型生态最真实的切片:

  • SGLang:最顺,官方预构建镜像 lmsysorg/sglang:dev-Ling-3.0-tiny 拉下来就跑,低延迟配方内置 MTP/NEXTN 投机解码,YaRN 扩展到 256K 上下文,单张 141GB 级 GPU(H20-3e)即可起服务;
  • vLLM:要装社区分支(ling_3_0 分支自行编译),还没进主线;
  • Ollama:支持还在 PR 阶段(#17643),且仅限 Apple Silicon 的 MLX 路径,需自行编译,尚未进入官方发行版——尽管官方已在 48GB 统一内存的 M4 Pro 上验证过。

评论:数字之外的信号

单看 25 分的 AA 智能指数,tiny 谈不上惊艳——它的卖点从来不是榜单名次,而是「1.3B 激活参数 + 8.34 GiB 内存」这个组合让混合推理在 MacBook 上有了可用的速度。社区反应是实在的:发布一周多,HF 上已有 13 个社区量化版本。

更值得留意的是工具链梯度:同一个模型,SGLang 有官方镜像、vLLM 等分支合入、Ollama 还在 PR——端侧开源模型的「发布」早已不是丢一包权重那么简单,推理框架的适配深度决定了它真正能被多少人用起来。MIT 许可证则把商业化顾虑也一并打消了。

对想在本地跑 agent 工作流的开发者,这份模型卡给出了一份可以直接对着采购预算算的账本;对行业,它再次印证一个趋势:混合线性注意力 + 稀疏 MoE 的组合,正在从旗舰专属下放到 8B 级。

素材来源:inclusionAI Ling-3.0-tiny 模型卡(Hugging Face):https://huggingface.co/inclusionAI/Ling-3.0-tiny