一次罕见的"四家同时掉线"
2026 年 9 月 3 日美东时间上午,ChatGPT、Claude、Grok、Gemini 这四款主流 AI 服务在不到三小时内接连出现严重服务中断。Ars Technica 援引各厂商状态页与 DownDetector 数据复盘了这一窗口,结论很直白:四款前沿模型在同一时段集中故障,这种事"几乎前所未见"。
Anthropic 先开口,9:23 起报告部分故障
时间线上,Anthropic 是最早响应的厂商。根据 status.claude.com 的事件 461yvfrzpwtt,美东 9:23 报告 Claude Mythos 5.1、Claude Fable 5.1 与 Claude Opus 5 出现"elevated errors",约 15 分钟后定位原因,12:16 标注已修复,整个事件大约三小时。中午刚过,Claude Sonnet 5 又单独拉了一次事件(报告 288w7p4hk1l1),显示同一个工作日内多个模型家族先后承压。
OpenAI 10:43 跟进,12:55 收尾
OpenAI 在 10:43 通过 status.openai.com 发布事件 01M1KWEDH417T2CF44YYHZDFCR,通报 ChatGPT 与 Codex 出现"elevated errors"和性能下降。半小时内缓解措施上线,12:55 标记为 resolved。Ars 提到 OpenAI 同期公布的 ChatGPT 90 天可用性为 99.63%、ChatGPT Codex 为 100%,意味着这次属于"压在小数点后两位"的罕见情况。
Grok 和 Gemini:沉默,但数据不会说谎
xAI 的 Grok 在用户端直接弹出"is experiencing issues"错误提示,DownDetector 报告数从 9 点前的不足 10 条,在 9:45 冲到 1365 条,之后回落到 273。Google 方面,Gemini 从未公开承认故障,但 DownDetector 上 Gemini 报告数从 10:30 左右的 23 条在 11:00 跳到 412 条,StatusGator 也把 Gemini API 在 10:45 至 11:15 之间的状态标为"likely outage"。两家公司的策略一致:不在状态页留痕,把认领压力留给第三方监测平台。
云厂商没事,但社区数据有波动
事件中值得注意的是,AWS、Azure、Cloudflare 这三家最常被怀疑的底层云服务商,在自家状态页上没有公开重大故障记录。然而 DownDetector 显示这三家的报告数当日早间都出现过可见峰值,提示"上层的服务故障可能短暂把流量挤到其他 SaaS、绕了一圈再回到云本身"。Ars 把它解读为一种"上层模型层出问题,下层公共云基本没出问题"的分裂图景,这本身就是值得记住的信号。
个人评论:这是"模型层单点"不是"云层单点"
这一次事件最值得行业反思的是故障切片的位置。四个模型来自四个不同公司、跑在多家不同云上、用着不同的推理栈和 GPU 集群,但它们几乎同时出问题,意味着问题不太可能在物理基础设施层。更可能的解释有几条:一是大量企业级流量在背后接了多家模型的容灾切换,一家挂了流量被推到下一家形成连锁压力;二是某个上游供应商——比如 CDN、身份认证、DNS、负载均衡的 SaaS 层——在那一刻成为隐式共享依赖;三是某个训练/推理框架在版本同步发布时出现了时间窗内的回归。
无论哪种解释,这次事件都提醒我们,所谓"前沿模型可用性 99.x%"这个数字,是被状态页而非真实用户体验度量的。当四家头部产品在同一个工作日的同一个上午集体哑火,企业和个人用户真正面对的是"全球 AI 服务可用性"这个新指标——它远低于任何单一厂商自我报告的数字。
下一次有人告诉你"多模型备份就够稳了",可以把这篇文章翻出来。
参考链接