9 月 9 日,蚂蚁集团 inclusionAI 把 Ling 系列第一个原生多模态模型 Ling-3.0-flash-VL 的权重放上了 Hugging Face 和 ModelScope:总参数 124B、每个 token 只激活 5.5B,支持图像和视频输入,上下文窗口 256K,BF16 与 FP8 权重同步开放,FP4 和 INT4 版本按计划后续跟进。这是 Ling 系列从纯文本走向「能看、能想、能动手」闭环的第一步。

架构:稀疏 MoE 上面叠一整套混合注意力

模型卡给出的结构并不复杂:ViT 视觉编码器负责抽取图像和视频特征,两层 MLP 投影器把视觉特征对齐到文本表示;VideoRoPE 同时编码空间位置和时间顺序,支撑事件定位、长视频问答和视频片段剪辑这类任务;语言主干是 42 层的 KDA 与 Gated MLA 按 5:1 交替的混合架构,负责长上下文的高效处理;最外层用稀疏 MoE 把总容量抬到 124B,同时把单 token 计算压在 5.5B 激活。换句话说,视觉不是外挂的「看图插件」,而是被塞进了理解、推理、行动、验证的完整流程。

跑分:官方引用和独立评测对不上

官方模型卡写的是:Artificial Analysis Intelligence Index v4.1.1 得分 42,比纯文本的 Ling-3.0-flash 的 38 分高 4 分——蚂蚁以此论证「多模态联合训练反过来也提升了文本能力」。但 AA 自己的独立评测帖给出的数字是 25 分,同时把它放在「智能 vs 激活参数」帕累托前沿上:同等总规模里,Qwen3.5 122B A10B 只有 16 分,Mistral Medium 3.5 是 15 分。两个数字大概率对应不同版本的指数,但这也提醒所有人:发布方引用的跑分,永远先看版本号和口径再引用。

AA 的独立评测还给出了官方宣传页不会突出的短板:幻觉率 22%(对比 Inkling Small 的 63% 算克制),但知识召回只有 14% 的 AA-Omniscience 准确率;自动化办公基准 AutomationBench-AA 只有 16%,更难的 Terminal-Bench v4.0 直接 0 分。看图干活的故事讲得再顺,离「可靠的数字员工」还有明显距离。

部署现实:5.5B 激活不等于 5.5B 显存

一个容易误读的数字:激活参数 5.5B 压的是单 token 计算量,不是显存占用,部署时仍然要装下 124B 总权重。官方给的参考配置是 4 张 141GB 级显卡(H20-3e/H200 或 B300/GB300 节点)跑 256K 上下文(YaRN 扩展),80GB 的 H100/H800 需要扩到 8 卡张量并行。推理路径两条:SGLang 官方 Docker 镜像,或 inclusionAI 的 vllm-ling-v3 分支走 vLLM。

所以呢

开源多模态的竞争已经从「能看图」进入「能干活」的闭环竞争——GUI 操作、前端还原、医疗报告解读是发布方点名的三类场景。5.5B 激活的推理经济学,瞄准的正是闭源厂商走量最大的 flash 层定价。但对使用者来说,真正值得记住的不是官方引用的 42 分,而是独立评测里那个 0 分的 Terminal-Bench:多模态 Agent 的水,还深得很。

参考:Ling-3.0-flash-VL 模型卡 · Artificial Analysis 独立评测 · Pandaily 报道