電力設備AI產業能源

Google Cloud europe-west4-a 停電並失去冷卻,三項服務中斷最長近 13 小時

Google Cloud europe-west4-a 停電並失去冷卻,三項服務中斷最長近 13 小時 能源, AI, 產業

Google Cloud 的初步事故報告指出,2026 年 7 月 15 日 europe-west4-a 資料中心先發生上游公用電力故障,接著失去冷卻能力,Google Cloud VMware Engine、Bare Metal Solution 與 Google Cloud NetApp Volumes 相繼中斷。Google 將三項服務的整體服務中斷時間合計列為 14 小時 55 分鐘。

Google 表示,資料中心溫度快速上升後,主機伺服器、儲存叢集與網路交換器被關閉,以避免高溫造成設備損害。這起事故影響的是 europe-west4-a zone 的特定服務,並非 Google Cloud 所有區域同時中斷;Google 目前仍把報告標為 preliminary,後續會再發布完整根因與預防措施。

Google Cloud europe-west4-a 先停電再失去冷卻

Google 的事故時間線顯示,電力故障發生在資料中心上游電網,影響配電設備與冷卻設備。冷卻中斷後,機房環境溫度升高,Google 為保護硬體與客戶資料,主動關閉部分基礎設施,這也讓受影響服務的資料平面與控制平面一起出現中斷。

europe-west4-a 這個 zone 承載的服務包含 VMware Engine private cloud、Bare Metal Solution 伺服器和 NetApp Volumes 儲存。Google 的公開報告把故障順序、保護性關機和客戶影響分開記錄,事故原因仍是初步判定,完整根因分析尚未公布。

Google Cloud europe-west4-a 停電並失去冷卻,三項服務中斷最長近 13 小時 能源, AI, 產業

三項服務在不同時段恢復

Google Cloud VMware Engine 的影響時間為美西時間 7 月 15 日 17:09 到 7 月 16 日 02:33,共 9 小時 24 分鐘;NetApp Volumes 從 7 月 15 日 16:39 到隔日 01:10,共 8 小時 31 分鐘;Bare Metal Solution 從 18:37 到隔日 07:34,共 12 小時 57 分鐘。三項服務的個別時間不同,不能用單一恢復時間概括。

Google 先與第三方資料中心營運商恢復主要電力與冷卻,再依序啟動並驗證伺服器、儲存節點與網路。公開報告指出,GCVE 和 NetApp Volumes 已恢復全部受影響使用者,Bare Metal Solution 在報告更新時仍有少數客戶需要個別處理。

Google 以溫度與硬體遙測觸發復原

Google 表示,工程團隊在美西時間 7 月 15 日 16:39 透過自動化溫度與硬體無法連線遙測收到警報。環境恢復到安全溫度後,現場與遠端團隊以受控順序啟動主機、儲存與網路,並執行自動化復原 playbook 讓交換器、路由、儲存設備和運算叢集逐步回線。

這份公開說明能確認 Google 的復原順序和保護性關機,但尚未提供上游電網故障的更細節原因,也未公布最終預防措施。報告仍保留後續完整 incident report 的承諾。

多區部署成官方事故處置建議

Google Cloud Service Health 對區域服務的說明指出,多區域部署能把服務分散在不同地理區域;這起事故的公開更新也建議具備 multi-regional deployment 的客戶把流量導向替代站點。Google 尚未在初步報告中公布新的事故防護期限,最終報告仍待發布。

消息來源:Google Cloud Service Health:Incident reportGoogle Cloud Service Health

延伸閱讀
你的 GA4 流量有一半是假的:揭開「新加坡暴衝」背後的算力與爬蟲大戰
文章・AI
Anthropic Claude Mythos 對 Cloudflare 營收結構的衝擊分析
文章・雲端基礎設施
AWS 下修 GPU 與 Trainium 管理費,雲端 AI 工作負載價格戰進入容器層
文章・產業
Written by
黃郁棋

《科技人》站長,在科技業打滾十年的老屁股,每天都覺得自己要被新技術取代了,完了完了。

打賞科技人|祝您有個美好的一天

科技人原創 BGM

音樂目錄載入中

預設暫停,等你按下播放

0:00 0:00