从 28 天 2.8 万美元开始的那封内部邮件
OpenAI 的 GPT-5.6 Sol 在七月上线,被微软内部定为 GitHub Copilot 与相关工作流的默认模型——这条消息最先是 CNBC 与 404 Media 在八月初放出来的,执行副总裁 Jay Parikh 的原话是「Tokenmaxxing is not what we are optimizing for」。Solidot 八月三十日补了一块市场公开稿里没仔细展开的数字:那是员工自愿提交的内部账单——7 万家公司支出数据由支付服务集团 Ramp 收集,微软 223,000 名全球员工里抽样了 350 名美国员工,按 28 天一个观察窗口,只要看一眼分布就知道这封邮件为何会被写出来。
分布两端
- 极端高位:Customer and Partner Solutions(客户服务与伙伴解决方案部门)有一名工程师 28 天内烧掉 2.8 万美元的 AI 费用;
- 次高位:多名员工月支出超过 1 万美元;
- 中位水平:全体样本 28 天 AI 支出中位数约 300 美元;
- 部门冷热差:CoreAI 部门中位数最高,达 975 美元;而少数部门某些人 28 天只花了几十美元;
- 样本规模:350 名美国员工,占微软 223,000 全球员工的极小部分,这个分布是基于自愿上报的账单(而非审计口径)。
材料出处:404 Media(Futurism 转引)、CNBC(直接引用 Parikh 备忘录全文)、**Gadget Review(Ynet News 转引同源数据)**三家独立报道交叉给出 2.8 万、1 万+、300 美元中位、CoreAI 975 美元中位这四个核心数字,无版本冲突。
这件事的技术含义不只在金额
把同一份账单放在模型选型逻辑里读,可以拆出三层判断:
第一层:贵模型不再自动获胜。Customer and Partner Solutions 那位 2.8 万美元的 case,显然不是用最便宜的模型跑通业务——更像是典型 tokenmaxxing:选择最强模型、不主动收敛上下文、不主动换路径,直到月底账单自己跳出来。Parikh 的邮件重点不是单价,是把「用最强模型随手解决」这条肌肉记忆打断。
第二层:GPT-5.6 Sol 切默认的真实理由。CNBC 引用 Parikh 原话:「Internally, shifting more workloads to OpenAI models helps us get greater value from our token investment」。OpenAI 七月发布的 GPT-5.6 Sol 比上代 GPT-5.6 便宜一个数量级、但能力接近前沿。微软把内部默认模型切过去,本质是用更便宜的同档位模型吞掉一部分 tokenmaxxing 的需求,而不是让工程师主动选小模型——这是采购层面的杠杆,不是工程层面的自律。
第三层:CoreAI 部门中位数 975 美元很反直觉。CoreAI 是写 Copilot、写 GitHub、写模型本身的部门,他们用 AI 是为了造 AI,975 美元中位数最高反而合理:他们工作在 Agent、长程任务、自动化工作流这些「天然吃 token」的边界上。真正异常的反而是中位数 300 美元两侧那条长尾:少数人烧 2.8 万、1 万+,意味着这部分员工不是在「用 AI 干业务」,而在内部排行榜上做 token 通胀。
对企业的启发
这件事给所有把 AI 工具大规模铺下去的公司的启示只有一句话:别用平均数管理 token 账单。一位中位数 300 美元的部门和一位尾部 2.8 万美元的同事,在同一个 G&A 报销口径里拉平均,数字会显得「还好」——但尾部那一两位就能吃掉几十人份的预算。Ramp 这类支付聚合数据最有用的不是平均值,是「每部门 P95/P99 + 中位数」的并列视图。
所以正确动作不是继续喊「别用太多 AI」,而是把模型路由做细:默认用 GPT-5.6 Sol 这种中等价位 + 高能力的档位、给真正需要长上下文的 Agent 工作流开一个独立配额、为单次任务设 token 上限。微软这封邮件其实是把这套流程的开关打开;Copilot 默认模型切到更便宜档位,是把这套流程的采购侧焊死。等下一次账单周期出来,我们才会看到尾部那条 2.8 万美元的曲线有没有缩回去——这才是 tokenmaxxing 话题真正有没有降温的判据。
本文事实来源:404 Media 报道与 OpenAI 后续披露 + CNBC Tech 报道 + Gadget Review + Ynet News,Solidot 中文综述整理。