7月24日,Anthropic 发布 Claude Opus 5,价格不变 ($5/$25 每百万 token),上下文 1M,模型 ID 写作 claude-opus-5。三个 API 变化比跑分更重要:thinking 默认开启(老代码里 `thinking: {"type": "disabled"}` 配 effort xhigh/max 直接 400)、最低可缓存 prompt 砍到 512 token、官方劝开发者把「再 verify 一次」这类提示词删掉——模型自己会 verify,再要求会过拟合到过验证。 跑分上,FrontierBench v0.1(74 个 agentic 任务,Terminal-Bench 2.1 继任)Opus 5 max effort 拿 43.3%,xhigh 拿到 44.4% 是其最佳成绩;Opus 4.8 只有 18.7%,Fable 5 是 33.7%,GPT-5.6 Sol 是 37.5%。SWE-bench Verified 96.0%,Multimodal 从 38.4% 跳到 59.4%。OSWorld 2.0 70.57%(4.8 是 55.7%),Zapier AutomationBench 26.0%(Fable 5 是 17.4%),GDPval-AA v2 拿下 ELO 1861/1827 头部两个名额。最炸裂的是 ARC-AGI-3 高 effort 验证 30.16%——之前榜首是 GPT-5.6 Sol 的 7.78%,Opus 4.8 是 1.52%。 「工具 > 思考」是这版最值得记住的工程信号:Chartography 不带工具 29.6%,挂上图片裁剪工具直接 83.0%;BenchCAD Vision2Code voxel IoU 从 0.366 涨到 0.821,顺便把 Mythos 5 的 0.678 踩了。安全上,Gray Swan 间接 prompt injection 15 次内的攻击成功率从 5.5% 跌到 2.0%(GPT-5.6 Sol 是 20.0%);浏览器场景 Claude Cowork 默认开 auto 模式时,129 个测试环境攻击成功率 0%。Cyber 能力跟着 general 涨,Anthropic 解锁了「源代码漏洞查找」,但二进制扫描、渗透测试、exploit 生成仍然锁死——RSP 把它定到 ASL-3,与 Opus 4.8 同级,UK AISI 的 'The Last Ones' 10 跑里通了 8 次。 模型 ID 仍是 opus 5 这一档,定价 $5/$25 不动,既是对 Fable 5($10/$50)继续做企业市场分层,也是对开源阵营(Kimi K3 $3/$15、DeepSeek V4 Flash 更便宜)的防守:1M context + 1/2 价格 + 跑分追到 Fable 5,Opus 5 把 Anthropic 整条产品线在 agentic、coding、长上下文三条线的中段都顶到了新水位。