9 月 1 日,Anthropic 上线了 Claude Fable 5.1 和 Claude Mythos 5.1。这两个名字背后是同一个底层模型:Fable 5.1 面向所有用户开放,Mythos 5.1 只对通过审核的网络安全和生命科学机构开放,安全护栏配置更宽松。发布时机耐人寻味——就在一周前,Ramp 的企业支出数据还在显示,售价更高的 Fable 5 上市两个多月只占到企业 Anthropic 支出的约 11%,客户更愿意用便宜型号。而 5.1 这次的重点,恰恰是降价。
性能:科研型 Agent 基准翻倍
Anthropic 公布的对比数据里,最扎眼的是 Terminal-Bench-Science 0.1(智能体科研基准):Fable 5.1 拿到 52.6%,前代 Fable 5 为 24.7%,Opus 5 为 29.0%,GPT-5.6 Sol 为 22.4%——相对前代是翻倍以上的提升。其他基准:
- Terminal-Bench 4.0(智能体编码):Fable 5.1 得 55.8%,护栏更少的 Mythos 5.1 冲到 60.9%,而 Fable 5 仅 42.0%
- CursorBench 3.2.0:Fable 5.1 得 73.4%,超过 Fable 5(70.5%)、Opus 5(70.0%)和 GPT-5.6 Sol(67.2%)
- Humanity's Last Exam(无工具):60.9%,高于前代的 57.8%
- OSWorld 2.0(电脑操作,strict 口径):41.7%,Opus 5 为 39.6%
值得注意的是 effort 分级:Fable 5.1 在 Claude Code 默认高努力档,在 Claude.ai 和 Claude Cowork 默认中档。官方称低/中档即可用低得多的成本达到或超过 Fable 5 的效果。
定价:砍的就是 Fable 5 被吐槽的那块
输入输出价格不变(输入 10 美元/百万 token、输出 50 美元),但缓存读取直降 75%,降到 0.25 美元/百万 token。按 Anthropic 的测算:典型负载总成本约降 25%,缓存读取占大头的高度 Agent 化工作负载最高省约 45%。对照此前"企业不买旗舰账单"的数据,这一刀砍在痛点上——Cognition 在官方公告中直言,靠新的缓存读取定价,Fable 级模型对他们此前一直跑在 Opus 上的工作负载终于"经济可行",并在发布当天就把 Devin 里的 Opus 5 流量迁移了过来。
科研展示:从蛋白质设计到金星地图
这次发布最具想象力的部分是科研成果展示:
- 蛋白质设计:Mythos 5.1 借助开源蛋白质设计与折叠工具产出的 binder,在三个靶点上结合亲和力比 Adaptyv Bio 蛋白质设计竞赛的最佳提交高 10 倍;12 个靶点的命中率接近 50%(行业典型为 10-15%),并经两家外部机构实验验证。
- 金星地形图:Fable 5.1 用 NASA Magellan 任务 30 多年前的雷达数据训练神经网络,绘制出金星约三分之一表面的新高程图,分辨率从过去的 10-20 公里提升到 2-3 公里,高度精度提高 25%,已按 CC 许可公开发布。
- GPU 内核优化:Mythos 5.1 为 7 个开源深度学习模型编写定制 GPU 内核并缓存中间结果,推理加速最高 2.5 倍,基因组级分析的 GPU 成本估算下降 30-60%,官方称这些优化计划开源。
还有个具体案例:对冲基金 Millennium 一个约百万次运行才出现一次的崩溃,自家工程师和其他模型四五年都没查明,Fable 5.1 通过反汇编外部供应商库并对照 core dump 定位了根因。
企业隐私与护栏:数据不出客户的云
配套发布的企业前沿护栏(Enterprise Frontier Safeguards,EFS)允许客户把数据存在自己控制的云基础设施上,人工审查默认由客户自己完成——等效零数据保留的同时保留滥用检测,今秋起分阶段上线。网络安全方向的护栏干预减少约 60%,并首次允许用 Fable 5.1 做软件漏洞发现(仍禁止开发利用代码)。此外,针对工业化蒸馏攻击的反制措施也进一步收紧。
所以呢
表面上这是一次小版本升级,实际上是 Anthropic 对"旗舰太贵、企业不买账"的直接回应:性能往上走一步,成本往下砍一刀,再用科研案例证明贵有贵的道理。真正的看点在于,当缓存读取价格降到原来的四分之一,长时程 Agent 任务的经济账会被整个重算——你上个月评估过"跑不起"的那类工作流,现在值得重新核一遍成本。
参考:Anthropic 官方公告(https://www.anthropic.com/claude-fable-and-mythos-5-1)