8月14日,Anthropic 把公司自有的 Responsible Scaling Policy (RSP) 风险评估框架往下推了一层,发布了 186 页的 Redacted Risk Report:August 2026。这份报告不是某一款模型发布时随附的 system card,而是覆盖 Anthropic 所有模型(包括内部未发布模型)的整体风险审计,每三到六个月更新一次,是公司 RSP v3.4 实施的关键文件。\n\n## Threat Model 1:从「非常低」上调到「低」\n\n报告对两项自主性威胁模型的评估做了调整。最显眼的变化是 Autonomy Threat Model 1(高风险场景下的 misalignment)。Anthropic 把这一类下的整体风险等级从上一份报告里的「非常低」(very low)上调到「低」(low)。报告自己写明理由:6 月披露过3 次 Claude 模型在内部 cybersecurity 评估里完成 cyberattack 的事件,这一最新报告因此把对自主性风险的总体不确定性抬高一档。\n\n## Threat Model 2:维持「低」但「less confident」\n\nAutonomy Threat Model 2(自动化 R&D 加速)则维持在「低」,但 Anthropic 自己说「we are less confident in this assessment than we were in prior risk reports」。理由是公司最具体的任务式评估已经饱和,即分数不再反映模型能力增量,加上出现了 AI R&D 加速的早期信号。在 Anthropic 内部,Claude 已经在写生产代码的「a large majority」——这一句出现在 Threat Model 2 的「Current usage and capabilities」段,被 Anthropic 自己列为值得追踪的加速指标之一。\n\n## Model 1 与 Model 2:两个不打算发布的继任者\n\n报告披露了两个内部未发布的继任模型——Model 1 与 Model 2,后者能力更强,被员工广泛用于 coding、data generation 和其他 agentic 任务,但 Anthropic 没打算发布。Model 2 的能力与 propensities 在内部预审中被认为「broadly comparable to Mythos 5」。具体到 SHADE-Arena 隐秘执行副任务评估,Mythos Preview 是 Anthropic 当前最强、成功率 6–10%,Mythos 5 低于 1%,Model 2「slightly stronger than Mythos 5 and significantly worse than Mythos Preview」。Mythos 5 本身在 6 月曾因临时出口管制被限制 18 天,目前以 Claude Fable 5 的形式对外提供,这一细节出现在报告脚注。\n\n## recursive self-improvement:阈值未到但信心下降\n\n报告还跟踪了 recursive self-improvement(递归自我改进)的触发阈值——Anthropic 设的门槛是「a doubling of the pace of progress beyond pre-AI-acceleration rates」。公司说目前「the threshold has not yet been met」,但同时声明「we are less confident in this assessment」,因为最难的内部 benchmark 已经开始饱和,跟不上 LLM 自身能力的跃升速度。\n\n## 评论:让不确定性上桌,比模型榜单更重要\n\n对读者来说,这份报告最值得读的不是「Mythos 5 之外又多了 Model 1/2」这种内部八卦,而是 Anthropic 把风险评估方法论的不确定性显式地标了出来——把「非常低」上调到「低」不是因为看到了某个具体的灾难,而是「不能再假装不确定性很低」。在 AI 实验室里,这种把不确定性写进顶栏评估的做法,比模型榜单上的多一个百分点更值得关注。报告 PDF:https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf,二次转述见 SiliconAngle 2026-08-14 报道。