端侧大模型又添一员。OpenBMB 联合清华大学 NLP 实验室与 ModelBest,发布了 MiniCPM5 系列的第二款模型 MiniCPM5-2B:一个 25.2 亿参数的 dense Transformer(总参数 2,516,756,480,非嵌入参数约 19.8 亿),42 层,GQA 注意力(16 个查询头、2 个 KV 头),原生 128K 上下文,面向手机、笔记本等资源受限的本地部署,Apache-2.0 协议开源。

2B 打 4B:数字怎么读

官方在 34 项基准上给出平均分 53.9,对比集里 4B 级最高是 Qwen3.5-4B 的 51.1——2B 的平均分压过所有更大的对比模型。分项看更明显:AIME 2025 拿到 86.5(Qwen3.5-4B 为 78.8),LiveCodeBench v6 拿到 69.1(同对比 56.4),长上下文 NoLiMa 68.1,中文搜索智能体 BrowseComp-ZH 43.5。最扎眼的是 SWE-bench Verified 的 46.4——真实仓库级编程修复超过对比集内全部 4B 级模型(LFM2.5-2.6B 仅 6.0)。需要说明,这些是官方评测集内的自报数字,部分分数带 Artificial Analysis 官方发布标记。

RL 教师 + 在线策略蒸馏

训练分三段:base 训练、mid-training、post-training。post-training 先用 400B tokens 的深度思考 SFT 打底,再为数学、代码、agentic、写作等领域训练专门的 RL 教师,最后用 On-Policy Distillation(OPD)把 16 个 RL 专家(含 5 个 agentic 专家)蒸馏进一个发布模型。官方称 RL+OPD 阶段为推理与通用能力平均带来 10.96 分提升,agentic 能力 6.96 分。数据侧同步开源:UltraX 预训练网页数据、UltraData-Code 分层代码数据、50 万条 agent SFT 样本与 8 万余条 RL 样本全部放出。

部署生态铺得很开

模型用标准 LlamaForCausalLM 架构,主流推理引擎直接加载,无需自定义 kernel 或模型代码 fork。权重提供 GGUF、MLX、GPTQ、DSpark 草稿模型等多种格式,llama.cpp、Ollama、LM Studio、vLLM、SGLang、ArcLight 全部有官方 cookbook。SGLang 在发布当天给出 day-0 支持,并报告在 RTX 5090 上开启 DSpark 投机解码后,单用户解码速度超过每秒 250 token。国内芯片侧,FlagOS 平台把模型适配到了英伟达、昇腾、摩尔线程、昆仑芯等 9 种芯片。

所以呢

两个背景值得注意。一是 Artificial Analysis 刚在 9 月 4 日发布 Intelligence Index v4.2,加大了私有测试集权重,MiniCPM5-2B 随即登顶该指数 4B 以下开源模型;二是 cryptobriefing 提醒,1B 版本在旧指数拿到的 17.9 与 2B 版本的新指数成绩不可直接比较——方法论变了,跨版本分数没有可比性。对开发者,真正有信号的是 SWE-bench 这类真实任务分数:2B 模型开始够到一年前 4B 级都碰不到的线,端侧跑 agent 的实用窗口正在打开。但 benchmark 领先与真实效用并不总同步,值不值得换,得在自己的设备上跑一遍。

参考:官方模型卡(huggingface.co/openbmb/MiniCPM5-2B),cryptobriefing 与 SGLang 的报道。