9 月初,开源 CMS Wagtail 的核心团队给自己出了道题:整个月的工程任务,只准用 GLM-5.3-Flash 这一个开放权重模型。10 月 2 日,团队成员 Thibaud Colas 交出复盘,副标题是句自嘲——「task failed successfully」,任务失败了,但失败得信息量十足:一个月 2B token 花出去,单模型目标只完成了一半。
账本:2B token 花在哪了
团队的 AI 用量统计工具 AgentsView 给出的账目是:前半个月,他们 100% 跑在 GLM-5.3-Flash 上,这部分成本 68 美元、约 4kWh 电、365 克碳排放——对一整个月的 AI 辅助工程来说,这个数字便宜得有些反常。转折在后半月:另外 1B token 流向了其他模型,全月能耗约 35kWh,是他们原本预期的三倍半。
三条裂缝
一是 vibe coding 的代价。 实验性的 Wagtail MCP 服务器原型选错了模型,几乎一夜之间烧掉 450M token、150 美元、5kWh 电。团队自己估算,选对模型的话,同样的结果成本大概率只要五分之一。
二是推理基础设施掉链子。 他们依赖的第三方推理供应商容量不足,GLM-5.3-Flash 的服务质量出现退化,后半程被迫切换到 DeepSeek V4.1 Flash 和 Qwen 3.8 Flash。团队的解释相当直白:这个模型在他们画出的性价比 Pareto 前沿上位置太靠前、太受欢迎,而供应商的 GPU 家底远不如囤卡的大厂,扛不住这么多人同时挤上来。
三是实验预算天然超支。 团队要给 Wagtail 自家任务做模型基准,基准研究本身就必须覆盖多家模型,这部分 token 无论如何记不进单模型目标的账。
顺手晒出的 14 模型基准
复盘里最值钱的附产品,可能是一张 14 个模型在 Wagtail 任务上的基准表预览:准确率、能耗、成本三列并排。榜首是 DeepSeek V4.1 Flash——95% 准确率、单任务 14.9Wh、0.09 美元。
所以呢
三点观察。第一,「失败」要打引号:团队自己的结论是,日常开发工作完全可以在一两个 flash 档便宜模型上运转——被验证失败的,是「单模型」这个更激进的目标。第二,瓶颈正在从「模型行不行」挪到「推理容量够不够」:当一个便宜好用的开放模型被所有人同时盯上,第三方推理服务的扩容速度就成了新的短板。第三,一个容易被忽略的细节:主角 GLM-5.3-Flash 加上两个备选,清一色出自中国团队——国产开放模型跑进西方开源工程团队的日常工作流,已经不是口号,而是账本上的既成事实。
10 月,这个团队换了计量方式:不再数 token,改按成本和能耗算账,目标是让 flash 档模型吃下多数推理任务。这套思路,值得所有正在做 AI 预算的团队抄作业。
参考:Wagtail 团队复盘原文;九月挑战公告。