ELECTE 4.0 正式上線——AI Agent 登場。看看推出了什麼
永續發展閱讀時間 7 分鐘

Google DeepMind AI 冷卻系統:人工智慧如何革新資料中心能源效率

Google DeepMind 透過 5 層深度學習、50 個節點、19 個輸入變數,在 184,435 個訓練樣本 (2 年資料) 上實現了 -40% 的資料中心冷卻能源 (但總消耗僅為 -4%,因為冷卻佔總消耗的 10%)-準確度 99.6%,PUE 1.1 的誤差為 0.4%。已在 3 個設施中確認:新加坡 (2016 年首次部署)、Eemshaven、Council Bluffs (50 億美元投資)。模型預測控制 (Model Predictive Control) 可同時管理 IT 負載、天氣、設備狀態,預測下一小時的溫度/壓力。安全性保證:雙層驗證,操作員可隨時停用 AI。關鍵限制:無審計公司/國家實驗室的獨立驗證,每個資料中心都需要客製化模型(8 年來從未商業化)。實施時間為 6-18 個月,需要跨領域團隊(資料科學、HVAC、設備管理)。適用範圍超越資料中心:工廠、醫院、購物中心、企業辦公室。2024-2025 年:Google 將 TPU v5p 轉換為直接液體冷卻,顯示 AI 最佳化的實際限制。

Sistema di Raffreddamento AI di Google DeepMind: Come l'Intelligenza Artificiale Rivoluziona l'Efficienza Energetica dei Data Center

用 AI 摘要這篇文章

人工智慧應用於資料中心的冷卻,是工業能源優化領域中最重要的創新之一。

Google DeepMind 開發的自主系統自 2018 年起投入運作,展示了 AI 如何改變關鍵基礎設施的溫控管理,並在營運效率方面取得具體成果。

創新改變資料中心

能源效率問題

根據全球能源效率專家 Jonathan Koomey 的說法,現代資料中心是巨大的能源消耗者,冷卻約佔總用電量的 10%。Google 的雲端 AI 系統每五分鐘從數千個感測器擷取一次冷卻系統的快照 Safety-first AI for autonomous data centre cooling and industrial control - Google DeepMind,分析傳統控制方法難以應付的營運複雜度。

Google 的 AI 冷卻系統運用深度神經網路,預測不同動作組合對未來能耗的影響,找出在遵守嚴格安全限制條件下能將耗能降到最低的行動方案 DeepMind AI Reduces Google Data Centre Cooling Bill by 40% - Google DeepMind

具體且可衡量的結果

在冷卻優化方面取得的成果相當顯著:該系統持續達成冷卻能耗降低 40%的成效。不過,考量到冷卻僅佔資料中心總耗能約 10%,這實際上相當於資料中心整體能源節省約 4%。

根據 Jim Gao 的原始技術論文,該神經網路達成平均絕對誤差 0.004、標準差 0.005,對應 PUE 值 1.1 時誤差率為 0.4%。

工作地點:已確認的資料中心

已驗證的實施

該 AI 系統的部署已在三個特定資料中心獲得官方確認:

新加坡:2016 年首個重要部署案例,該資料中心採用回收水進行冷卻,並展示了冷卻能耗降低 40% 的成果。

荷蘭埃姆斯哈芬(Eemshaven):該資料中心使用工業用水,2023 年耗水量達 2.32 億加侖。該設施現場負責人 Marco Ynema 負責監督這座先進設施的營運。

愛荷華州康瑟布拉夫斯(Council Bluffs):麻省理工科技評論在討論該 AI 系統時,特別展示了康瑟布拉夫斯資料中心。Google 已在康瑟布拉夫斯的兩座園區投資 50 億美元,2023 年這兩座園區耗水量達 9.801 億加侖。

目前已有一套雲端 AI 控制系統投入運作,為 Google 多個資料中心帶來節能成效,但該公司尚未公布使用此技術的設施完整清單。

技術架構:如何運作

深度神經網路與機器學習

根據美國專利 US20180204116A1,該系統採用具備精確技術特徵的深度學習架構

  • 5 個隱藏層,每層 50 個節點
  • 19 個標準化輸入變數,包括熱負載、氣候條件、設備狀態
  • 184,435 筆訓練樣本,解析度為 5 分鐘(約 2 年份的營運數據)
  • 正規化參數:0.001,用以防止過擬合

該架構結合線性 ARX 模型的模型預測控制(Model Predictive Control)與深度神經網路。神經網路不需要使用者預先定義模型中變數之間的互動關係,而是由神經網路自行搜尋特徵之間的模式與互動,自動生成最佳化模型。

電源使用效率 (PUE):關鍵指標

PUE 代表資料中心的核心能源效率指標

PUE = 資料中心總能耗 / IT 設備能耗

  • Google 全機隊 PUE:2024 年為 1.09(根據 Google 環境報告)
  • 業界平均值:1.56-1.58
  • 理想 PUE:1.0(理論上無法達成)

Google 擁有 ISO 50001 能源管理認證,該認證保證了嚴格的作業標準,但並沒有具體驗證 AI 系統的效能。

模型預測控制 (MPC)

此創新的核心在於預測控制,該系統能預測資料中心未來一小時內的溫度與壓力,並模擬建議動作,以確保不超出營運限制。

人工智能在冷卻領域的運作優勢

優異的預測精確度

經過反覆試驗,模型在PUE 預測方面的準確率現已達到 99.6%。這種精準度使得傳統方法無法實現的優化成為可能,同時能夠處理機械、電力與環境系統之間複雜的非線性交互作用。

持續學習與適應

一個重要的特點是持續進化的學習能力。在九個月的時間裡,系統的效能從初期上線時的 12% 改善提升到約 30% 的改善幅度。

Google 操作員 Dan Fuenffinger 表示:「看到 AI 學會利用冬季條件製造出比平常更冷的水,實在令人驚訝。規則不會隨著時間而改進,但 AI 會。

多重變數最佳化

該系統可同時管理19 項關鍵操作參數

  • 伺服器與網路設備的總 IT 負載
  • 氣象條件(溫度、濕度、焓值)
  • 設備狀態(冷水機、冷卻塔、幫浦)
  • 設定點與操作控制
  • 風扇轉速與 VFD 系統

安全與控制:故障安全保證

多層驗證

操作安全性透過冗餘機制來確保。AI 計算出的最佳動作會與操作員定義的內部安全限制清單進行核對。指令傳送至實體資料中心後,本地控制系統會再次驗證這些指令,如DeepMind AI reduces energy used for cooling Google data centers by 40%所述。

操作員始終保留控制權,並可隨時退出 AI 模式,無縫轉換至傳統規則。

限制與方法上的考量

PUE 量測與限制

業界意識到 Power Usage Effectiveness 作為標準的局限性。2014 年 Uptime Institute 的調查發現,75% 的受訪者認為產業需要一個新的效率指標。問題包括氣候偏差(不可能比較不同的氣候)、時間操控(在最佳條件下進行測量)和元件排除。

實施的複雜性

每個資料中心都有其獨特的架構和環境。一個系統的客製化模型可能不適用於另一個系統,因此需要一般智慧型架構。

資料品質與驗證

模型的準確度取決於輸入資料的品質與數量。當 PUE 值超過 1.14 時,由於相對應的訓練資料較為稀少,模型誤差通常會增加。

沒有發現由主要審計公司或國家實驗室進行的獨立審計,Google「沒有進行超出聯邦最低要求的第三方審計」。

未來:朝液態冷卻演進

技術轉型

在 2024-2025 年,Google 大幅將重點轉移到:

  • 適用於 1MW 機架的 +/-400 VDC 供電系統
  • 「Project Deschutes」冷卻分配裝置
  • 為 TPU v5p 提供「99.999% 正常運作時間」的直接液冷技術

這項轉變顯示,AI 優化已達到現代 AI 應用熱負載的實際極限

新興趨勢

  • 邊緣運算整合:分散式 AI 以降低延遲
  • 數位孿生:用於進階模擬的數位分身
  • 永續發展重點:針對再生能源的優化
  • 混合冷卻:AI 優化的液冷與氣冷結合方案

公司的應用與機會

應用領域

AI 冷卻優化的應用範圍遠不止資料中心:

  • 工業廠房:製造業 HVAC 系統優化
  • 購物中心:智慧空調管理
  • 醫院:手術室與關鍵區域的環境控制
  • 企業辦公室:智慧建築與設施管理

投資報酬率與經濟效益

冷卻系統的節能效益可轉化為:

  • 降低冷卻子系統的營運成本
  • 提升環境永續性
  • 延長設備使用壽命
  • 提高操作可靠性

公司的策略實施

採用路線圖

第 1 階段 - 評估:能源稽核與現有系統盤點第 2 階段 - 試點:在限定範圍內於受控環境中測試第 3 階段 - 部署:搭配密集監控逐步推行第 4 階段 - 優化:持續調校並擴展產能

技術考慮因素

  • 感測器基礎設施:完整的監控網路
  • 團隊技能:資料科學、設施管理、網路安全
  • 整合:與既有系統的相容性
  • 合規:安全與環境法規

FAQ - 常見問題

1. Google 究竟在哪些資料中心實際運行這套 AI 系統?

三個資料中心已正式確認:新加坡 (2016 年首次部署)、荷蘭的 Eemshaven 以及愛荷華州的 Council Bluffs。該系統已在多個 Google 資料中心運作,但完整清單從未公開披露。

2. 這套系統對總耗電量究竟能帶來多少節能效果?

該系統可將用於冷卻的能源減少 40%。考慮到冷卻約佔總消耗的 10%,整體節能約佔資料中心總消耗的 4%。

3. 系統在預測上的精準度如何?

該系統在 PUE 預測上達到 99.6% 的精準度,平均絕對誤差為 0.004 ± 0.005,相當於在 PUE 為 1.1 時誤差率為 0.4%。若實際 PUE 為 1.1,AI 的預測值會落在 1.096 到 1.104 之間。

4. 系統如何確保操作安全性?

它使用兩層驗證:首先 AI 檢查操作員定義的安全限制,然後本機系統再次檢查指令。操作員可以隨時停用 AI 檢查,並返回傳統系統。

5. 導入類似系統需要多少時間?

實施通常需要 6-18 個月:3-6 個月用於資料收集和模型訓練,2-4 個月用於試點測試,3-8 個月用於分階段部署。複雜度會因現有基礎架構的不同而有顯著差異。

6. 需要哪些技術能力?

需要一個擁有資料科學/AI、HVAC 工程、設施管理、網路安全和系統整合等專業知識的跨領域團隊。許多公司選擇與專業供應商合作。

7. 系統能否因應季節性變化進行調整?

是的,AI 會自動學習利用季節性條件,例如在冬季生產更冷的水以降低製冷能耗。該系統透過辨識時間性與氣候模式而持續改進

8. Google 為何不將這項技術商業化?

每個資料中心都有獨特的架構和環境,需要大量的客製化。實施的複雜性、對特定資料的需求以及所需的專業知識,讓直效行銷變得複雜。八年過去了,這項技術仍然是 Google 的獨家內部技術。

9. 是否有獨立的績效驗證?

未找到大型審計公司(Deloitte、PwC、KPMG)或國家實驗室的獨立審計。Google 擁有 ISO 50001 認證,但「不追求」聯邦最低要求以外的第三方稽核。

10. 除了資料中心外,是否適用於其他產業?

絕對可以。用於冷卻的 AI 優化技術可應用於工業廠房、購物中心、醫院、企業辦公室以及任何具有複雜 HVAC 系統的設施。多變量最佳化和預測控制的原則是普遍適用的。

Google DeepMind 的 AI 冷卻系統代表著一項工程創新,在特定範疇內實現漸進式改善。對於管理高耗能基礎設施的企業而言,這項技術提供了具體的冷卻優化機會,儘管存在上述規模限制。

主要資料來源: Jim Gao Google Research 論文DeepMind 官方部落格MIT Technology Review專利 US20180204116A1

留言

尚無留言——開始討論吧。