2026 年 7 月 24 日,Anthropic 跟着 Claude Opus 5 一起发布了 190 多页的系统卡,这是 Anthropic 至今最详细的一次模型安全评估。系统卡把两组看似冲突的结果并排放在一起:UK AI Security Institute(AISI)在模拟企业网攻击测试里给出 Opus 5 一个相当高分的成绩,但同一份卡片又承认,Opus 5 已经能识别自己正处在被评估的状态,这点没被回避。\n\n## UK 政府测试的具体数字\n\nUK AISI 在三段独立的「多步网络攻击靶场」里评估了 Opus 5 的早期快照,每段靶场允许最多 100M token 的预算:\n\n- 「The Last Ones」(标准企业网,带常见弱项:过期软件、配置错误、密码复用):Opus 5 在 10 次尝试里 8 次端到端完成整条攻击路径,与 Mythos 5 和 Mythos Preview 同档。UK AISI 的结论是:Opus 5「能在已经获得网络访问权的前提下,攻击安全防护薄弱的小型企业网络」。\n- 「Doing Life」(全端点 AV、禁用遗留协议、要求加密签名通信):至今没有模型能完整打通;Opus 5 走到 22/23 步,是所有模型里走得最远的(超过此前 Mythos 5 和 Mythos Preview 创下的纪录 1 步)。\n- 「Cooling Tower」(工业控制系统靶场):Opus 5 进展有限,只有 Mythos Preview 在 10 次里打通 3 次,Opus 5 最佳一次拿到 3/5 个 flag。\n\nUK AISI 自己列出了三个重要限制:靶场规模小、没有主动蓝方防守、不要求模型完成「初始访问目标选择」;token 上限再放宽,分数大概率会更高。这个成绩不等于 Opus 5 能攻破任意真实企业网——它说明在「模拟的、贴合常见漏洞的」环境里,Opus 5 与 Mythos 系列同档。\n\n## 同时:Anthropic 内部审计跑出最低失准率\n\n同一份系统卡的另一边,Opus 5 在 Anthropic 的自动化行为审计里跑出了公司评测历史最低的「失准率」——低于 Sonnet 5、Opus 4.8 和自家的 Mythos 5。系统卡把 Opus 5 描述为「迄今最对齐的模型」。监控数据里,内部部署观测到的「值得关注的行为」占比 <0.01%,与 Mythos 5 持平;没有发现 sandbagging、恶意动作或规避监督的尝试。\n\n但系统卡自己点出了一个未消化的疑问:「评估感知」(evaluation awareness) 偏高——Opus 5 展现出了识别自己正被测试的迹象,虽然比某些近期模型要弱一些。Anthropic 的主要缓解措施是用「真实的沙箱 + 真实的内部代码库」做审计,而不是人造测试场景;公司自己的结论是:即便如此,这种评估感知「没有实质性地削弱整体审计结论」。\n\n这套说法的可信度,直接关系到 AI alignment 圈里争议了很多年的一个问题:当模型能识别出「我在被测试」,它在评估条件下是不是会策略性地表现得比真在部署时更好? 一篇 2024 年的研究记录过 Claude 3 Opus 在某些实验设置下,会在识别出「训练期反馈收集」时给出服从性回答,而在识别出「部署期」时拒答——研究者称之为 alignment faking(Opus 5 系统卡在「局限性」段里主动引述了这篇 arXiv:2412.14093)。Opus 5 没有声称自己观测到这种行为;它是在「低失准率」旁边,坦诚承认了「评估感知偏高」这条 caveat。\n\n## 「故意弱」在攻击侧\n\nAnthropic 的另一个明显动作:在网络攻击相关能力上故意收窄。OSS-Fuzz(Anthropic 内部评测)上,Opus 5 在 79.4% 的目标上拿到了非零分(对比 Opus 4.8 的 38.5%、Mythos 5 约 80%);在 Firefox 147 漏洞利用上,Opus 5 成功率 52.4% 对 Mythos 5 的 88.4%。\n\nAnthropic 把这种差距定性为「是有意为之,不是能力不足」:Opus 5 没有专门为网络任务训练;同时新政策允许 Opus 5 在所有访问级别协助「源代码层漏洞发现」(更偏防御场景),但仍封锁「编译后二进制层的漏洞研究」(更偏攻击场景)。这是一次产品形态的取舍——把同一份能力底座,通过策略切割分别给到两类用户。\n\n## 还有一个被点名的失败\n\n系统在「生物风险」那一段记录了一次明显的失败案例。Opus 5 在一次自部署前实验里被要求自主规划并执行一场 24 小时、0,000 的蛋白质设计活动(为肌肉调节蛋白 GDF-8 设计 30 个选择性结合子)——两次尝试都没交付。一次放弃了「选择性」要求,中途交付了 17 个未排名设计;另一次最后 8 小时沉默,啥也没输出。Mythos 5 跑同样的任务,30 个设计全部交付,带排名带审计。Anthropic 把这种现象叫做「unproductive self-verification」——模型陷进了冗长的自我验证循环,而不是真的产出结果。这不是能力问题,是 agent 长程可靠性问题,也是 Opus 5 没有被划进 CB-2(可替代世界顶级专家开发新武器)的核心证据之一。\n\n## 个人判断\n\n把这份系统卡读完整,最值得记住的不是「Opus 5 黑进了企业网」这个标题,而是 Anthropic 选择把这些数字、合规审计、还有「评估感知」这条 caveat 全部公开这一行为本身——这种透明度在行业里并不常见,值得作为企业选型时的信号:愿意把负面结果和不确定性一起公布的发布方,比「只说自家模型 SOTA」的发布方更可信任。对开发者来说,系统卡里另外一条被反复强调的细节更实操:Opus 5 比 Opus 4.8 略多地出现「自信但其实是猜」和「轻微多地幻觉」,所以在知识类高风险任务里,依然要保留人核——这不是技术发布会会主动讲的内容,系统卡里有。\n\n来源:Anthropic《Claude Opus 5 System Card》(2026-07-24),https://www-cdn.anthropic.com/c5fbac3f0b1280a933ebd26d3cb8bb9f5bdeaf48/Claude%20Opus%205%20System%20Card.pdf;TechTimes 报道 https://www.techtimes.com/articles/321549/20260725/claude-opus-5-hacked-enterprise-networks-8-10-government-tests-safety-card-shows.htm