Inkling-Small:不是把模型砍小,而是重新训练出更高效的多模态 MoE
Thinking Machines Lab 在 7 月 30 日发布了开放权重模型 Inkling-Small。名字里虽然有 “Small”,但它仍有 276B 总参数,只是每个 token 激活 12B;相比此前 Inkling 的 975B 总参数、41B 激活参数,规模约为四分之一。模型采用 Apache 2.0 许可,权重已放到 Hugging Face,并可通过 Tinker 体验和微调。官方发布页 给出的重点不是“更小”,而是用更少计算维持接近甚至更好的推理与 Agent 能力。
它为什么能缩到四分之一
Inkling-Small 是一个 42 层、仅解码器的稀疏 MoE Transformer。每个 token 会路由到 256 个专家中的 6 个,同时还有 2 个共享专家持续参与。它原生接收文本、图像和音频,三种输入都被投射到共享隐藏空间,再由同一个解码器联合处理;上下文窗口最高 100 万 token,输出仍为文本。
这次缩小并非简单蒸馏旧模型。官方说明,Inkling-Small 启动训练晚于大模型,因此团队调整了预训练数据组合和训练方法。其早期预览检查点一部分使用 Inkling 作为教师做在线策略蒸馏,随后又继续进行了两周的 Agent 编码强化学习。换句话说,它是在更小的激活预算下重新优化训练路线,而不是把大模型机械压缩一遍。
编码与推理更强,但事实性明显退步
官方评测显示,Inkling-Small 在 SWE-bench Verified 上取得 80.2%,高于 Inkling 的 77.6%;Terminal-Bench 2.1 为 64.7%,略高于 63.8%;纯文本 Humanity’s Last Exam 为 31.6%,也高于 29.7%。这些数字支持团队的判断:较小模型在推理、编码和工具使用上可以超过教师模型。
但代价同样清楚。SimpleQA Verified 从 Inkling 的 43.9% 降到 20.6%,Tau 3 Banking 从 23.7% 降到 15.5%。官方因此明确写道,Inkling 仍然在知识覆盖和事实性上占优。这组反差比单看榜单更重要:强化学习和蒸馏可以把有限计算集中到“会做任务”,却不自动补回知识覆盖。
真正的部署门槛仍然很高
Inkling-Small 提供 BF16 和 NVFP4 等数值格式。官方模型卡显示,BF16 检查点至少需要 600GB 聚合显存,可由 4 张 NVIDIA B300 或 8 张 H200 承载;NVFP4 将要求降到至少 180GB,可在 1 张 B300 上以 W4A4 运行,或在 2 张 H200 上以 W4A16 运行。支持的部署框架包括 SGLang、vLLM、TokenSpeed、Unsloth 和 Hugging Face。
所以,这不是普通消费级显卡能本地跑的“小模型”。它的意义,是把一个原生文本、图像、音频模型从超大集群门槛,压到单张数据中心级 GPU 或双卡 H200 的范围。对需要私有部署、工具调用和多模态输入的团队,这种变化比“总参数少了多少”更实际。
Inkling-Small 给出的信号很直接:开放权重模型的下一轮竞争,不只是继续堆总参数,而是把激活参数、推理预算、量化格式和训练配方一起优化。真正有价值的“小”,不是名字更小,而是单位计算能完成更多任务——同时把它不擅长的事实检索,明确交给检索与校验系统。