Anthropic 7 月 24 日发布的 Claude Opus 5,API 定价纹丝未动,仍是 $5/$25 每百万 token。真正有意思的不是它跑分多高,而是它把一个叫 **effort(思考强度)** 的旋钮做成了产品功能,而且官方实测显示 **medium 档** 是甜区。 ## "省力模式"也能拿好成绩 Opus 5 的 effort 参数控制模型推理时愿意花多少 token 思考,而非控制输出长度。系统卡里最扎眼的一组数据:**OSWorld 上,Opus 5 medium effort 跑出 24% 得分,单任务成本仅 $0.89**,把 Opus 4.8 和 Fable 5 都甩在身后,而后者单任务动辄 $12-20。换句话说,中等 effort 不是"将就",而是**当前 token 预算下性价比最高的一档**。 背后的真相是:很多 frontier 模型在高 effort 上堆思考预算时,边际收益已经递减。Opus 5 的训练明显针对低-中 effort 区间做了对齐——`low` 和 `medium` 在多个评测上用几个百分点的质量损失,换 3-5 倍的成本下降和延迟缩短。 ## 真正的战场是 agent 成本曲线 对部署 Claude Code、computer use 这类 agent 的团队,benchmark 分数是 PPT 数字,**单任务美元成本**才是采购 KPI。Anthropic 同时宣布 Sonnet 5 在 medium effort 下"能匹配 Opus 4.8"——意味着同一个团队可以用 Sonnet 的预算做到上一代 Opus 的活。 Opus 5 medium 和 Sonnet 5 medium 这一对组合,等于在不动 API 价格的情况下,把 Anthropic 的实际有效推理成本拉低了 40-60%。这是 2026 年大模型竞争里**最隐蔽也最致命**的一种降价方式:不调单价,改 thinking 默认档位。 ## 评论 把 effort 当成 first-class API 参数暴露给开发者,是 Anthropic 过去一年最关键的产品决策。它把"模型+推理预算"打包售卖,让用户自己 trade-off。这条路如果走通,会把 LLM 市场从"我比 GPT 又高 X%"的军备竞赛,拉进"我替你每任务省 Y 美分"的运维竞赛。 对国内厂商的启示也很直接:Qwen、DeepSeek、Kimi 下一阶段拼的不只是 SWE-bench 跑分,**能不能像 Opus 5 那样,在 medium 推理预算下还稳得住质量和工具调用成功率**,才是 agent 落地真正的护城河。