美东时间9月3日上午9时23分左右,一场美国AI行业有记录以来罕见的大规模集体服务中断集中爆发。OpenAI旗下ChatGPT与编程工具Codex、Anthropic旗下Claude系列、xAI旗下Grok先后出现大面积故障,谷歌Gemini与微软Copilot同期收到大量中断报告,AI编程工具Cursor也公告称部分服务因上游大模型故障而被迫中断。整场事件持续约3小时40分钟,从消费端聊天、开发者API到企业级应用全场景遭波及,全球数百万用户的正常工作节奏被打乱,也让外界第一次如此直观地看到头部AI服务对共享云基础设施的深度依赖。
故障的扩散路径在时间线上格外清晰。率先告急的是Anthropic,其官方状态页面显示当天早间Claude多个型号请求错误率飙升,涵盖Mythos 5.1、Opus、Fable 5.1等核心模型,网页端、API接口与Claude Code等关联工具同步中断;仅两分钟后,xAI的Grok服务全端下线,网页、移动应用与API接口均出现访问超时;大约一个半小时后,OpenAI的ChatGPT与Codex也出现大规模访问错误。故障监测平台DownDetector的数据显示,事件峰值期间全球针对OpenAI服务的报告超过3.7万份,其中约八成集中在ChatGPT,针对Claude与Grok的报告也分别达到上千份量级。
恢复过程同样是逐家推进的。Anthropic在确认原因并部署修复措施后,于美东时间上午11时16分率先恢复Claude主要服务;随后ChatGPT与Grok也逐步恢复正常。整场大规模宕机持续约3小时40分钟,截至北京时间9月4日凌晨,受影响服务已全部恢复。值得注意的是,OpenAI当日本来正忙于预热新一代旗舰模型的发布,官方社交媒体此前发布的预热视频配文"群星即将就位",结果遭遇服务中断,引来大量用户调侃,也让这场故障在舆论场获得额外的关注度。
三家公司的归因口径各不相同,这成为外界解读事件性质的关键线索。OpenAI发言人表示,故障源于太平洋时间当天上午7时43分开始的一次路由错误,导致部分用户无法通过多个平台访问ChatGPT与Codex,公司已部署解决方案;Anthropic技术部门员工在社交媒体透露,事件由"基础设施问题"引发,公司一度无法给出预计恢复时间;xAI则在事后表示,问题源于当天早间其孟菲斯计算中心的一次故障,并称所有系统随后恢复正常。三家公司目前均未确认几起故障是否存在共同原因。
尽管官方没有给出共同归因,舆论的猜测已经指向共享底层设施。有分析指出,Anthropic、xAI与OpenAI的算力架构均重度依赖微软Azure等公共云平台,而Cloudflare状态页面当天也记录了两项影响自定义域名与WARP用户的服务问题;一旦某个底层环节出现波动,可能同时扰动多家依赖它的AI服务。这种"一损俱损"的连锁反应此前并非没有先例,但如此多头部平台在同一时段集体中招仍属罕见,也把AI产业供应链集中化的系统性风险摆到了台面上。
这场宕机的行业启示远超"服务恢复"本身。当训练与推理算力集中在少数几家云厂商手中,头部AI公司实际上共享着同一批底层基础设施,任何一环的闪失都可能演变成全行业的连锁事故。对AI公司而言,单云依赖在成本谈判上有吸引力,却在可靠性上埋下隐患,多云冗余、故障隔离与降级预案正从"可选项"变成"必答题";对使用AI服务的企业来说,把关键业务流程绑死在单一AI供应商身上同样危险,跨供应商备份与本地兜底方案应纳入风险清单。
颇具戏剧性的对照发生在故障当晚:就在海外大模型集体掉线时,国内大模型厂商智谱在社交平台发文"We are still up",一句"我们还在线"迅速出圈,并顺势宣布旗下GLM-5.3-Flash在夜间时段免费开放使用。这一插曲虽带营销色彩,却也点出了行业格局的另一面,当全球AI服务因基础设施集中化而变得脆弱时,多元化的算力布局与差异化的服务生态本身就是一种抗风险能力。对用户而言,这场持续近四小时的大规模宕机是一次提醒:AI再强大,它脚下的云底座也并非坚不可摧。
这场宕机也推动了一个容易被忽视的讨论:AI行业的可靠性数据正在变得比营销数据更重要。如今每家头部AI公司都把状态页当作基础设施运营的标配,第三方监测平台实时汇总各家的故障报告,用户与开发者可以像看天气一样查看AI服务的健康度。当"某某模型又崩了"成为开发者社区的日常话题,可靠性表现开始直接进入企业选型与合同谈判的考量,服务等级协议与赔偿条款的权重同步上升,头部厂商也因此在算力冗余与故障演练上投入更多资源。
对行业而言,把故障当作公共事件而非家丑来处理,可能是这次集体宕机留下的最大遗产。三家公司均在数小时内公开确认问题、披露大致原因并通报恢复进展,Anthropic与OpenAI还给出了相对具体的归因口径,这种透明度在数年前几乎不可想象。随着AI服务渗透进金融、医疗、制造等关键行业,监管与公众对重大故障信息披露的要求只会越来越高,主动披露正在从公关策略变成合规底线,而每一次大规模宕机,都会把行业向更稳健的工程体系推进一步。