当大模型的竞争焦点从"聊天"转向"干活",IBM 给出了自己的答案:发布 Granite 4.2 系列开源语言模型,3B、8B、30B 三种尺寸全部引入原生思维链推理(thinking),Apache 2.0 许可,可直接商用(官方发布:https://research.ibm.com/blog/introducing-granite-4-2)。这是一次针对企业 agent 场景的明确押注——模型不再只负责生成回复,而要在多步任务里规划、调用工具、自我纠错。
原生思维链,做成了三档开关
Granite 4.2 最值得玩味的产品化细节,是把"思考"变成了显式可切换的模式:thinking 模式下模型先输出完整的逐步推理再给答案;non-thinking 模式跳过推理直接回答;low-effort thinking 只做极简推理,内部独白可以短到一句"Simple answer"。三档切换通过 chat template 参数完成,不需要换模型。
工具调用也与推理集成:模型会先想清楚"该调哪个工具、为什么调",再发起调用,工具定义沿用 OpenAI function schema。能在终端环境里导航代码库、处理多步开发任务的软件工程 agent,是这次训练的重点目标之一。
训练流水线:多阶段 RL + 1T 合成代码
按 IBM Research 的说法,这些能力不来自堆参数,而来自重新设计的训练流程。Granite 4.2 在 Granite 4.1 基座上做后训练:先过监督微调,再进入多阶段强化学习。第一段"foundational RL"覆盖全部三档尺寸,强化数学、科学、编码、推理和工具调用,混合可验证奖励与奖励模型评估;8B 和 30B 额外追加"agentic RL"阶段,专攻软件工程、终端编码和搜索驱动的工作流,最后叠加 RLHF 对齐。
两个关键补充:一是用 IBM CodeAlchemy 管线生成的 1 万亿 token 合成代码参与训练;二是引入 mid-training 中间训练步骤以解锁更多推理能力。推理侧加了 speculative decoding 层,输出更快、并发更高,直接压低企业服务成本。IBM 还与 Hirundo 合作,用机器遗忘(machine unlearning)技术在不重训的前提下削减不良输出。
Benchmark:30B 拿下 SWE Bench Pro 同级最高分
评测覆盖 AIME25(推理)、LiveCodeBench v6(编码)、IFBench 与 τ³-bench(指令遵循)、BFCL v4(工具调用)、SWE Bench Pro 和 Terminal-Bench 2.1(agent)。结果分层很清晰:3B 档在所有任务上明显领先同级;8B 档在推理和指令遵循上持平或超过对手,且是同尺寸里唯一报告 SWE Bench Pro 成绩的模型;30B 档拿下 SWE Bench Pro 最高分,面对同级或更大模型保持全面竞争力。
顺带发布的语音模型,470M 跑到 RTFx 12,600
同场发布的还有 Granite Speech 5.0 Turbo CTC 与非商业版 CTC NC:470M 参数、去掉 LLM backbone 的 CTC 架构,面向笔记本、手机等边缘设备。官方测试中其在单张 H200 上 RTFx 约 12,600,而 Hugging Face Open ASR 榜单的速度领先者约 6,000——吞吐翻倍,一秒可转录三小时录音,适合呼叫中心这类高音量转录场景。
所以呢
在全网都在卷万亿参数 MoE 的 2026 年,IBM 用 dense 架构 + 三档推理开关 + Apache 2.0 给出了一条差异化路线:不追绝对智能上限,而是把"够聪明、可审计、可私有化部署"做到企业敢用的程度。对要做私有 agent 的团队,一个 3B 全面领先同级、8B 跑完整 agent 评测、30B 敢和更大模型掰手腕的全开源家族,值得进选型清单。毕竟在企业市场,许可证和部署自由度,往往比榜单第一更有说服力。