微软把编码模型价格砍到四分之一:138B/5B 稀疏 MoE 加原生视觉全量进入 Copilot
背景:小尺寸编码模型的第二轮价格战
2026 年 8 月 11 日,微软把 MAI-Code-1.1-Flash 推进 GitHub Copilot 的正式发布通道。这是继 MAI-Code-1-Flash(Build 2026 亮相)之后,微软 MAI 团队在「小尺寸编码模型」这条线上的迭代版本。按照 GitHub 官方 changelog 的说法,新模型在编码质量、指令遵循、工具调用和性能四个维度都有改进,同时新增了原生视觉支持。
值得注意的是同一天 GitHub 还发了另一条公告:MAI-Code-1-Flash 进入弃用倒计时,退役日期定在 2026 年 9 月 10 日。也就是说这不是并行两档,而是一次直接的代际替换。
核心内容:参数、价格、以及那条 token 曲线
按 LLM Stats 整理的模型卡数据,MAI-Code-1.1-Flash 的规格是:
- 架构:Transformer + 稀疏 MoE,138B 总参数 / 5B 激活参数
- 上下文:256K tokens
- 模态:文本 + 图像输入,文本输出
- 预训练截止:2025 年 12 月;训练窗口为 2026 年 3 月至 8 月
价格是这次发布最外显的变化。GitHub Copilot 列表价为输入 0.20 美元/百万 token、缓存输入 0.02 美元、输出 1.20 美元;年付订阅按 0.25× premium request 计费。官方明确表述是「比 MAI-Code-1-Flash 低 73%」,归因于模型侧和服务侧的双重效率提升。
厂商自测的 benchmark(在同一套 VS Code / Copilot harness 下跑,属自报数据)更有意思:
| 基准 | 1.1-Flash | token 消耗 | 1-Flash | token 消耗 |
|---|---|---|---|---|
| SWE-Bench Verified | 72.6% | 8.6K | 71.6% | 10.8K |
| Terminal Bench 2.1 | 62.9% | 17.0K | 51.7% | 14.2K |
SWE-Bench 上分数只涨了 1 个百分点,但单题 token 从 10.8K 降到 8.6K,降幅约 20%。发布文还引用了另一组数字:Copilot CLI 场景 Terminal-Bench 2.1 提升 22%、.NET 任务提升 15%、代码存活率提升 4%、回访率提升 9%,token 流式输出快 25%、每任务 token 少 25%。
视觉能力是新增项,内部测试给出:Text2WebApp 通过率 74.1%、ScreenShot2WebApp 42.1%、Vision2Web Level3 仅 11.5%。
评论:这次卖的不是分数,是单位成本
如果只盯 SWE-Bench 的 72.6%,这次升级平淡无奇——一个百分点在当前榜单密度下几乎是噪声。但把「分数 / token」这个比值拿出来看,故事就完全不同了:同样的题,少烧 20% 的 token,还便宜 73%,叠起来单位任务成本的下降是量级性的。
这跟今年上半年整个行业的叙事转向是一致的。竞争焦点已经从「谁的能力排名更高」,滑向了「同等智能水平下谁更便宜」。微软给出的技术归因是训练侧的 RL 环境规模(模型卡称超过 15 万个 RL 环境,发布文说法是「数十万个 Copilot 内 RL 环境」)加上服务侧优化——本质上是用后训练的工程量去换推理时的经济性。
自适应解答长度控制这个设计尤其值得留意:简单问题短输出、难题多给预算。这看起来像个小工程 trick,但它直接指向了 agentic coding 的核心痛点——大量 token 浪费在对简单任务的过度推理上。
几个需要打折看待的地方:所有 benchmark 都是厂商自报、自家 harness 内跑的,未经第三方复现;模型卡上的定价栏写的是「待最终确定」,实际以 Copilot 定价页为准;Business / Enterprise 用户需要管理员手动打开策略开关,默认关闭。Vision2Web Level3 只有 11.5% 也说明视觉编码在复杂场景下离可用还有距离。
所以呢
对于日常在 Copilot 里跑轻量编码循环、仓库问答、重构、工具调用 agent 的开发者,这是一次几乎无痛的降本升级——尤其是 0.25× 的 premium request 倍率,意味着同样的配额能跑四倍的请求量。
更值得琢磨的是背后的趋势信号:当头部厂商开始把「每任务少花 25% token」写进发布文的核心卖点,说明模型能力的边际收益正在让位于推理经济性。下一代编码模型的竞争,可能不再是谁在 SWE-Bench 上多拿两分,而是谁能在同样的分数线上把成本再砍一半。