Agent 工作流里塞满了不起眼的小决策:这条请求该路由给哪个模型、上一步结果要不要重试、异常该不该转人工。过去这些决策要么写成硬编码规则,要么直接丢给大模型——前者脆弱,后者又慢又贵。微软在 10 月 9 日交出了自己的答案:Microsoft-Decision-1,一个不生成文本、专门做判断的小模型。
不写文章,只做判断
与 LLM 不同,决策模型(decision model)为结构化输出而生:给定一组固定选项,模型对每个选项返回一个校准过的概率分数,软件可以直接拿这个分数行动。官方列出的适用场景包括模型路由、分类、优先级排序、验证、工作流控制、agent 护栏和 AI 评判——都是 agent 基础设施里高频、低复杂度但量极大的环节。底座是 Qwen3.5-9B,经过后训练做单遍打分;微软表示后续会换用包括 MAI 和 OpenAI 在内的其他底座。模型已在 Microsoft Foundry 和 OpenRouter 上线。
值得玩味的是:微软手里有 Phi 系列,与 OpenAI 的合作也在加深,但第一版选了阿里的 Qwen3.5-9B 当底座——9B 这个量级在延迟和成本上刚好卡在「决策」这个位置。
数字都在官方评测里
微软的评测覆盖 36 项对训练保密的基准、近 15 万道题,官方称准确率居参测模型之首;速度上比第二名 H2O-Lightning-4B v1.1 快 2.5 倍,比 GPT-6 Sol 快 35 倍。OpenRouter 独立页面给出参考:P50 延迟 0.27 秒,上下文 32,768 token。
官方用 8 种方式扰动同一请求(改写、重排、格式噪声),平均决策翻转率 1.3%,选项改写或重排时零翻转;安全测试覆盖 5,250 条请求、11 项基准。定价是这类模型的杀手锏:输入每百万 token 0.042 美元,输出免费。
微软自己就是第一个客户
最有说服力的是内部案例。Xbox Research 用它处理超过 1 万条开放反馈和评测,质量与 GPT-6 Sol 相当,速度快 14 倍、成本低 200 倍;Copilot 团队用它评估对话和 agent 回复质量,与 GPT5.6 Luna 质量相当、快 100 倍;Microsoft Discovery 的自适应重规划用它打分,一致性比 LLM 评分高 46 倍。微软是先算清了自家的账,才把这个模型拿出来卖。
两周四家入场,品类成立
过去两周 Cloudflare 开源了 Clef,亚马逊放出了 Strands Decider,Perplexity 发布 pplx-decider,加上 9 月底的 Firelex Jeff 和今天的微软,「决策模型」正在从论文概念变成 agent 栈的独立层。逻辑并不复杂——LLM-as-judge 的成本和延迟痛点是真实存在的,当 agent 每天要做上百万次小判断,「用 GPT-6 判断要不要调用 GPT-6」就成了笑话。生成和判断正在分工:大模型负责难的,小模型负责快的。
真正的看点:当判断本身便宜到可以随处嵌入,agent 的护栏、路由和质检会从「事后补丁」变成「出厂内置」。(官方原文地址:https://commandline.microsoft.com/microsoft-decision-1-model-foundry/ ;OpenRouter 模型页:https://openrouter.ai/microsoft/microsoft-decision-1 )