资讯中心

  • 首页 谷歌云因维护失误遭遇长达4小时停摆

谷歌云因维护失误遭遇长达4小时停摆

2026-09-06

9月1日,谷歌云经历了一次由于维护错误导致的重大服务中断。一个工程师在进行数据中心路由器扩容操作时,不慎将所有光纤连接拔掉,使得部分云资源无法连接到外部网络。此次故障持续了4小时11分钟,从07:41到11:52,仅影响了美国艾奥瓦州地区的us-central1-b可用区,其他可用区未受到影响。

在事件发生时,工程师按照预定计划进行路由器扩容,这些路由器支撑着us-central1-b区域的一部分计算资源。谷歌的数据中心网络由多台独立的路由设备和光纤链路构成,设计上可以抵御单点故障,确保服务的连续性。然而,在这次维护过程中,流程出现了问题。工程师在短短13分钟内先后拔掉了所有相关设备的光纤连接,包括冗余链路,导致整体服务中断。谷歌称,在所有连接断开之前,没有及时传达相关警告。

故障期间,用户无法访问受影响的虚拟机,这些虚拟机也无法连接到可用区之外的资源,进而波及了容器、应用托管、数据库及数据分析等多项云服务。例如,部分Google Kubernetes Engine的集群和节点无法使用,Cloud Run和App Engine经历了请求延迟和中止,而Cloud SQL的某些实例也失去了连接。此外,BigQuery和虚拟私有云(VPC)等产品也出现了丢包和连接中断的问题。 龙8头号玩家

在故障发生后,谷歌的自动监控系统迅速检测到异常,并启动了事故响应机制,及时将流量转移到正常的基础设施上。技术团队也找到断开的光纤,进行了重新接回。最终在09:19,谷歌宣布底层网络恢复正常,但部分服务的恢复过程较慢,Cloud Run和App Engine的相关业务直到11:52才完全恢复。