微软叫停 tokenmaxxing:GitHub Copilot 默认模型从 Claude 切到 GPT-5.6 Sol,各部门戴上 AI token 预算紧箍咒

8 月 4 日,微软执行副总裁、CoreAI 工程负责人 Jay Parikh 在一封内部邮件里给微软 11 万工程师画了一条线:「tokenmaxxing 不是我们优化的目标」(原始报道见 404 Media,CNBC 当日跟进)。邮件落地的两项硬动作,直接把大厂 AI 军备竞赛拉回到成本纪律上:

  1. GitHub Copilot 内部默认模型从 Anthropic Claude 切换到 OpenAI GPT-5.6 Sol。微软允许员工继续选用 Anthropic、Google、Moonshot AI、xAI 等其它模型,但 Parikh 要求「大部分时间默认用 GPT-5.6 Sol」。
  2. 自 2026 年 7 月起,各业务部门拿到 AI token 预算目标(AI token budget target),员工可以在个人账单里看到月度 token 支出。CoreAI 暂未给单个团队或员工设独立预算,但 Parikh 在邮件里写明:「像管理其他所有关键资源一样管理 token 花费。」

为什么是 GPT-5.6 Sol,而不是更便宜的中国开源模型

表面看,微软选择 GPT-5.6 Sol 是因为「比其他模型更便宜」,但底层逻辑是 IP 套利。CNBC 在报道里点出:这是 9 个月前 OpenAI 完成公司重组、把对微软的知识产权授权延长到 2032 年的实际兑现——既然持有 OpenAI 的 IP 权益,自然把内部负载向 OpenAI 模型倾斜。

微软发言人对 CNBC 的官方表态是:「我们把 OpenAI GPT-5.6 Sol 设为微软内部 GitHub Copilot 的默认模型,同时继续提供多种可选模型,工程师随时可以切换。」这等于把 Anthropic Claude 从「默认位置」降级为「可选位置」——尽管微软去年 11 月还宣布向 Anthropic 投资最高 50 亿美元、Anthropic 同时承诺在 Azure 上花 300 亿美元,关系没有破裂,但优先级已经悄悄重排。

值得注意的是,微软并没有直接换成 DeepSeek V4 Flash 这类更激进的低成本选项。CNBC 的报道强调,微软的选择是「便宜的前沿旗舰」,不是「最便宜的模型」——这反映大厂内部的一个微妙平衡:能力门槛不能掉,只能在能力相当的池子里挑成本最优

Tokenmaxxing 是怎么失控的:一份硅谷账单样本

把视野放大,这只是 token 通胀崩盘前最后一波企业级反应。量子位整理了同期各家公司的账单细节(均为公开报道口径):

  • Atlassian:月度 AI 支出在不到一年内增长到原来的三倍,超过 1500 万美元,公司随后设置支出限制,要求员工控制模型使用成本。
  • Uber:整个公司到 4 月就烧光了 2026 全年的 AI 编程预算,Cursor 给 Uber 的新一轮报价上涨到此前 4 到 5 倍。Uber 随后规定每名员工使用每种 Agent 编程工具每月不得超过 1500 美元。
  • 亚马逊:内部搞了 KiroRank 排行榜,按员工在 Kiro 平台上的 AI 使用量打分,引发刷榜;月底排行榜被关停,高级副总裁 Dave Treadwell 提醒:「请不要为了使用 AI 而使用 AI。」
  • OpenAI 内部:一名员工曾一周处理 2100 亿 tokens,「足够把整个维基百科填满 33 遍」。
  • Meta:内部出现名为 Claudeonomics 的员工自建排行榜,统计 8.5 万多名员工的 AI 使用情况,颁发「Token Legend」「Cache Wizard」虚拟称号;Meta 同期把 AI 使用纳入绩效考核,Shopify 也跟进。

黄仁勋在 3 月的 All-In Podcast 公开站台:「如果一个年薪 50 万美元的工程师每年消耗的 token 不到 25 万美元,我会深感担忧。」GTC 2026 上他更进一步,愿意在工程师几十万年薪之外再提供相当于一半年薪的 token 预算。这套言论被大厂内部消化成 KPI,反过来把 token 烧穿。

模型选择经济学:从「token 等于智能」到「智能边际 = token 边际」

Parikh 在邮件里没有否定 AI 价值,但给出了一个清晰的经济学判断:生产率提升的边际收益,必须匹配 token 的边际成本。不是每个问题都值得调用最强、最贵的前沿模型。模型跑得更久、上下文塞得更满、Agent 开得更多,也不等于最终成果更好。

CNBC 引述的内部数据显示,许多工程师每月 token 花费在「几百到几千美元之间」,高消费工程师一个月烧掉数千美元已成常态。Wall Street 对四家 hyperscaler(微软、亚马逊、Alphabet、Meta)2026 年合计 7000 亿美元资本支出开始要回报,最新季度 Microsoft 现金生成同比下降 23%,Amazon 和 Alphabet 自由现金流甚至转负——这才是 token 紧箍咒的真正上层驱动。

一线影响:GitHub Copilot 的隐性「代码风格」会怎么变

对开发者来说,微软把默认模型从 Claude 切到 GPT-5.6 Sol,意味着两件事:

第一,代码补全和 Copilot Chat 的「默认味道」会迁移。Claude 系模型在长上下文推理、复杂重构上有口碑,换成 GPT-5.6 Sol 后,日常补全体验可能会有可感知的差异——尤其是涉及多文件编辑、test generation、PR review 这类任务。

第二,Anthropic Claude 不再是「打开就能用」的路径。CNBC 报道里写明,微软同时收紧了对 Anthropic Claude 的内部访问——尽管没有完全禁用,但默认位置让位意味着工程师要主动切换才会用到。这与微软去年宣布的 50 亿美元 Anthropic 投资在叙事上形成张力:投资归投资,内部预算归内部预算。

行业含义:大模型竞争从「能力排行」转向「同等智能成本」

把这条新闻放回大模型竞争主线上看,微软的默认模型切换不是孤立事件——它呼应了 7 月底 OpenAI 对 GPT-5.6 系列降价 20%–80%、DeepSeek V4 Flash 0731 用 50 分能力把单任务成本压到 GPT-5.6 Luna 的 35% 这一连串动作。华泰证券在 8 月初的研报里把这一轮概括为:大模型竞争由能力排名进一步转向「同等智能成本」。

对模型厂商而言,这是一道新的考题:能不能在能力相当的前提下,把单 token 成本压到客户愿意「默认选用」的水位。对企业 IT 而言,这意味着 LLM 选型从「哪个最强」开始转向「哪个最值」。对一线工程师而言,token 紧箍咒才刚戴上——以后跑模型前得多想一秒,「这笔 token 真的能换回等价的产出吗」。

微软这一动作落地,某种程度上是 tokenmaxxing 时代的正式句号。下一步看的不是模型会不会更强,而是 Wall Street 愿不愿意继续为「更强」付溢价。


参考资料