美国主流AI服务突发大规模宕机:ChatGPT、Claude、Grok集体“罢工”
北京时间2026年9月4日凌晨,美国主流AI服务遭遇了一场罕见的大规模集体宕机。OpenAI的ChatGPT、Anthropic的Claude以及xAI的Grok几乎同时出现服务异常,大量用户无法正常使用。
宕机时间线
本次事件从美国当地时间9月3日早晨开始发酵。8:30左右,Claude首先出现小规模故障报告,最初受影响的是Claude Sonnet 5模型。随后故障迅速扩大——9:23,Anthropic报告Claude Mythos 5.1、Claude Fable 5.1和Claude Opus 5出现“错误率升高”。
10:20左右(美东时间),OpenAI的ChatGPT开始出现不稳定,Downdetector上的故障报告在11:00(美东时间) 达到峰值——接近38,000份用户报告。同一时段,谷歌Gemini、微软Copilot也出现服务中断报告激增。
截至北京时间9月4日凌晨0:40,ChatGPT、Claude和Grok均处于故障状态。1:10左右,各服务陆续恢复。Claude于16:16 UTC(北京时间9月4日00:16) 全面恢复。整个宕机持续约3小时40分钟。
受影响范围
· OpenAI:ChatGPT聊天机器人和Codex代码工具报错率飙升· Anthropic:波及Mythos/Fable 5.1、Mythos/Fable 5、Opus 5、Opus 4.8、Opus 4.6等七个模型· xAI:Grok聊天机器人服务中断· Cursor:AI编程工具因依赖Claude和ChatGPT,同样确认故障
Downdetector数据显示,OpenAI故障报告超12,000份,Claude约1,200份,Grok约1,000份。
可能原因
关于此次集体宕机的根源,各方推测集中在几个方向:
Cloudflare底层设施异常是主要怀疑对象。有分析指出,用户访问AI服务的请求会先经过Cloudflare进行安全判断和内容分发,而Cloudflare状态页面显示当天出现了两个技术问题:影响R2自定义域名的HTTP/3问题,以及部分WARP用户地理位置识别错误。Anthropic技术人员也在社交媒体透露,事件由“基础设施问题”引发。
另一猜测指向微软Azure云服务。ChatGPT、Claude和Grok均依赖Azure提供算力,而该平台在同一时段也出现了故障报告激增。
此外,AI行业长期存在的算力瓶颈也被提及。Anthropic此前就承认过高峰期基础设施负荷影响性能,甚至豪掷460亿美元租算力来缓解压力。
值得一提的是,Cloudflare方面否认自身存在宕机。截至发稿,各方尚未公布完整的事后检讨报告。
恢复情况
截至北京时间9月4日凌晨,各服务已基本恢复正常。Anthropic确认Claude已完全恢复,OpenAI状态页显示已应用修复并持续监控。
关于Fable还能用的“怪事”
用户提到“中转的Fable还能用”——这其实并不奇怪。所谓“中转”,通常指通过第三方API聚合平台(如OpenRouter、APIDock等)接入Claude模型。这些平台可能缓存了部分请求、有多条备用路由,或故障期间仍在处理存量任务。此外,Anthropic在恢复过程中先修复了Fable系列模型,最后才处理Opus 4.8和Opus 5——这也解释了为何部分用户通过中转仍能调用Fable。
结语
三家头部AI平台同时宕机实属罕见。无论最终原因是Cloudflare、Azure还是算力链的某个环节出问题,这次事件都暴露出AI行业过度依赖少数底层基础设施的结构性风险——一旦底层出状况,上层应用就会连锁反应。好在这次恢复还算及时,但下一次呢?