Google 雲端近日發生約 15 小時服務中斷,影響範圍集中 europe-west4-a 區域內的 VMware Engine(GCVE)、NetApp Volumes 與 Bare Metal Solutions(BMS)三項服務。Google 的事故說明,對應資料中心先出現電力故障,引引發冷卻系統失效;因上游電網發生電氣故障,影響資料中心配電設備與冷卻設備。
Google 表示,為了避免高溫環境危害客戶資料,已主動降低工作負載。事故分析仍在進行,後續將補充最終報告與預防措施。但外界關注焦點不只事故,還有突顯雲端服務的「韌性」並非所有服務都一樣。雖然 Google 與其他大型雲端業者都建議客戶分散負載至不同區域與可用區,但這次事件顯示,部分受影響服務可能仍是依賴單一資料中心,當該設施出問題,即使同區域其他部分正常運作,服務也可能中斷。
分析人士指出,真正問題在於透明度不足。客戶通常被建議採用多區域、多可用區架構來提升容錯能力,但往往無法得知特定代管服務是否依賴單一資料中心。不少企業誤以為雲端抽象層提供比實際更高的基礎設施冗餘,但分析師說這類架構並不罕見,AWS、Azure 與 Google 都有依賴專用硬體、儲存平台或緊密耦合基礎設施的服務,未必像核心運算與儲存服務分散至多個設施。
這起事故也讓人聯想到 Google 雲端在 2023 年 europe-west9-a 區域發生的另一宗事件,當時是因為非 Google 區域設施發生漏水,導致部分服務在單一建築失效後無法正常運作。分析師認為,雲端區域的實際架構往往不易辨識,客戶也常感覺意外。Google 已向客戶致歉,並承諾最終報告將交代後續預防方法。
(首圖來源:Google)






