7 月 8 日到 16 日,Grok 4.5、GPT-5.6、Muse Spark 1.1、Inkling、Kimi K3 五款前沿模型相继亮相,密度史上最高。但当五家实验室的能力都跑到了够用的水平线之上,benchmark 表就已经不是排名,而是营销选择。Build Fast with AI 通过 API 与真实工作流测试这五款模型后发现:真正决定选型的,变成了单 token 价格、许可证条款、能否微调,以及你究竟在跑哪种任务。 Kimi K3 把"规模买能力"推到极致,2.8 万亿参数、1M 上下文、原生视频输入,跑出 91.2% BrowseComp 和 93.5% GPQA Diamond 开源档第一,代价是 /5 的高定价。GPT-5.6 Sol 在自研 Cerebras 硬件上跑到 750 tok/s,Tier 拆分( Sol/Terra/Luna)直接覆盖从批量到旗舰的全价格带。Inkling 是榜单上唯一 Apache 2.0 真开源权重(975B 总参 / 41B 激活),附带可调思考强度拨杆,Thinking Machines 自己说它"不是最强模型"——明牌定位为基础底座,不是榜单选手。Meta Muse Spark 1.1 把价格砸到 .25/.25,却同时拿下 MCP Atlas 88.1 分的工具调用 SOTA,支持文本/图像/视频/音频/PDF 单端点接入,是迄今最便宜也最多模态的智能体大脑。Grok 4.5 走 X 平台原生搜索 + 500K 上下文的差异化路线,/ 价格配上独立 Artificial Analysis 验证的智能指数,稳坐价值档。 价格跨度已经超过 12 倍但能力差距只几个百分点。Build Fast with AI 的测试里,Muse Spark 在 3D 房屋生成任务上花 4 美分,Fable 5 要 1.82 美元——同样的输出,45 倍价差。当单一榜单不再能定义胜负,选型逻辑就要重写:把 80% 日常流量路由到 Muse Spark 1.1、Grok 4.5 或 GPT-5.6 Luna,把 Sol 或 Fable 5 留给那 20% 真正的硬骨头;只要任务可重复,Inkling 的微调路径就是比租用闭源模型更划算的长线投资。 七月的真正信号不是某个模型封神,而是"能力门槛"被五家同时跨过之后,大模型竞争从卷分数正式切换到卷成本、卷许可、卷生态——开源权重重新回到牌桌中央,价格战从 token 蔓延到按完成任务计费,定制化反而成了最稀缺的护城河。