一句话:Nanbeige / 看准(BOSS直聘旗下)推 4B 总参 / 3B 激活的紧凑 Agentic 模型,在 11 项评测上把 Qwen3.5-9B 和 Gemma4-12B 摁在身下。
技术背景:2026 年的 open-weight LLM 战场有一条清晰的"小模型反超大模型"叙事 —— GLM-5.2、Kimi K3 用 MoE 把激活参数做小,Nanbeige 选的是另一条路:Looped Transformer,即同一组 transformer 层在网络里被复用多次,把容量挤出来的同时参数总数不涨。Nanbeige4.2-3B 是这条路线上目前最强的开源 checkpoint,3B 非词嵌入参数、256K 上下文、自家训练栈 SFT + outcome/process 双奖励 RL。
核心数据(11 项评测全部领先 9B 对标):
- SWE-bench Verified 63.6 vs Qwen3.5-9B 53.1、Gemma4-12B 44.2
- SWE-bench Pro 46.9 vs Qwen3.5-9B 33.8、Gemma4-12B 21.9
- Terminal-Bench 2.0 44.1 vs Qwen3.5-9B 29.2、Gemma4-12B 21.1
- GPQA-Diamond 87.4(3B 模型比大多数博士还高)
- HMMT-Feb-2026 82.8
- Office-QA-Pro 21.1(OpenClaw 框架 + 真实 PDF 上下文)
- MCP-Atlas 57.8(MCP 工具调用榜单前列)
机制核心:LoopSplit 把循环层切开做轻量推理、mHC with depth attention 在循环内部加多头压缩、concat n-gram embeddings 让相邻 token 信息流贯穿 —— 三件套联手让 4B 参数装下了原本 9B 起步的能力。RL 阶段把 SFT 的轨迹在第二轮按 outcome + process reward 重新打分,显著收紧工具调用的稳定性。
部署门槛:SGLang / vLLM / llama.cpp / Ollama / MLX 五栈全支持。GGUF Q4_K_M 量化后能在 MacBook 本地跑,OpenClaw 框架实测日常任务 / 办公 / 深研究 6 项基准全超 Qwen3.5-9B。这意味着 3B 模型在 Apple Silicon 上已经够用,云 API 调用不再是必选项。
个人评论:Nanbeige 的发布信息密度很高 —— 模型卡写清了 Looped Transformer 在循环维度和注意力维度的具体收益,但缺一个对比 DeepSeek V4 MLA / Hunyuan Hy3 KDA / Qwen3.5 GQA 的横向 subsection。"小模型 > 大模型"这条叙事走到 2026 下半年,真正的胜负手已经不在参数总量,而在(1)循环复用带来的有效深度 + (2)RL 阶段是否给出 process-level reward + (3)agent 工具栈的连续训练 —— Nanbeige 这条路线,前两条都做了。Nanbeige4.5 也已经在路上,Lora-NB(老板直聘)把招聘垂直场景的 agent 能力下放给 3B 模型,这是 SaaS 公司把模型当基础设施用的典型打法。
所以呢:不是参数越大越强 —— 看架构 + 训练管线 + 部署链路的整体工程深度。如果你想跑一个能在 MacBook 上帮你处理文档、查资料、写代码的本地 agent,3B 已经不是"够用就行",而是"超额交付"。