9月3日深夜,大概23点前后,不少人正用AI收尾工作、赶代码,结果遇到了同一件事:页面怎么刷都刷不出来。
一开始还以为是自己的网络问题,重启路由、切换节点,统统没用。打开微博一看才发现——不是你的问题,是它们的问题。ChatGPT崩了,Claude崩了,Grok崩了,Codex罢工了,连带着不自己研模型、只调上游API的Cursor,也跟着一起挂了。
这可能是全球第一次主流AI服务的大面积集体宕机。微博哔哩哔哩

先说确认过的事实
综合OpenAI官方状态页、微博多路博主的核验和社区的复盘,时间线大致是这样:
北京时间23:00左右,社区复盘显示Claude最先出现异常。微博
23:10前后,ChatGPT报404、Codex停止工作、Grok无法使用的反馈集中爆发,有用户同一时间发现Cloudflare也在报故障;
DownDetector上,针对OpenAI的故障报告短时间内超过1.2万条。微博
OpenAI官方状态页确认当天出现"Elevated errors across ChatGPT and Codex"(ChatGPT和Codex全面错误率升高),波及约15个ChatGPT组件和4个Codex组件,对话、文件上传、Search、Deep Research、图片生成、登录、API全都受影响,并表示已实施缓解措施、进入恢复监测。微博
Anthropic确认正在调查Claude的错误;马斯克旗下的Grok也出现服务中断;
对比之下,谷歌的Gemini这次基本正常——有用户直接切过去问Gemini,确认"不是我这边的问题"。微博
9月4日凌晨起,各家服务陆续恢复;
还有一个事实:国内AI服务这波基本没受波及。微博


几家巨头为什么会"一起"倒下?
这是目前讨论最热的问题。先把结论说在前面:官方根因还没公布,现在流传的所有"原因"都是推测。
社区里主流的推测有这么几种:
第一种,上游基础设施异常。有分析指向接入层出了问题(社区里流传Cloudflare相关的说法)——请求根本到不了后端,算力本身是完好的。微博这个解释能说通为什么几家不同基础设施的服务会"同时倒"。
第二种,重试放大引发的连锁反应。有复盘认为,Claude先挂之后,大量失败请求自动重试、滚雪球式放大,把压力传导给了其他服务。
第三种,电力问题。有科技博主猜测与数据中心供电有关,但这同样没有官方证据。微博

至于更离谱的传闻,比如说"这是OpenAI在为新旗舰Astra(网传即GPT-6)上线做压力测试",目前没有任何实锤,当故事听听就好。微博36氪
但哪怕原因没定论,这次宕机暴露的信号已经足够清楚:今天的AI巨头们,共用着一套高度集中的底座——同一批云、同一批算力、甚至可能同一个接入层。微博有网友的总结很扎心:鸡蛋确实没放在同一个篮子里,但篮子在同一辆车上。微博
对普通用户意味着什么?
分三种情况说。
如果你是轻度用户,偶尔用AI问个问题、写段文案:不用慌。这次宕机前后只持续了几个小时,凌晨大部分服务就恢复了,撞上了算运气不好。但这件事值得记住——你依赖的AI,不像自来水那样永远稳定。
如果你每天靠AI干活:这次宕机等于一次实战演练,有两个观察值得注意。其一,这次Gemini基本正常,手里常备一两个主力AI、能随时切换,就能应付大多数情况;其二,国内AI服务这次基本没受波及,对国内用户来说,这本身就是一个现成的备用选项。微博
如果你是API开发者、或者在搭AI工作流:这次宕机之后,社区共识非常一致——别把工作流绑死在单一模型上。多模型网关、故障自动切换、混合部署,这些以前只在架构评审里才聊的话题,一夜之间成了必修课。微博ChatGPT崩的时候,你的产品不应该跟着崩。
接下来值得盯的三个信号
OpenAI、Anthropic会不会公布详细的根因报告——如果公布,就能确认这次到底是不是"共用底座"的问题;
OpenAI的新旗舰Astra(网传即GPT-6)本来发布在即,这次宕机会不会影响它的节奏;
行业会不会把"多模型冗余"变成AI应用的标配——这次宕机,很可能就是个转折点。
有用户说得好:神灯下面,依然是笨重的变压器、发烫的芯片、埋在土里的跨洋光缆,以及可能随时出错的路由表。神灯偶尔会熄灭。微博
对真正拿AI当生产力的人来说,这次宕机之后最重要的不是围观原因,而是问自己一句:如果明天它再崩一次,我手里有什么,能让活儿继续干下去?