ELECTE 4.0 正式上线——AI Agent 来了。看看有哪些新功能
可持续性阅读需 7 分钟

谷歌 DeepMind 人工智能冷却系统:人工智能如何革新数据中心能效

谷歌 DeepMind 通过 5 层深度学习、50 个节点、19 个输入变量,在 184,435 个训练样本(2 年数据)上实现了数据中心冷却能耗-40%(但总能耗仅-4%,因为冷却能耗占总能耗的 10%)、准确率 99.6%、PUE 1.1 误差 0.4%。在 3 个设施中得到证实:新加坡(2016 年首次部署)、Eemshaven、Council Bluffs(投资 50 亿美元)。通过同时管理 IT 负载、天气和设备状态,模型预测控制可预测下一小时的温度/压力。安全性保证:两级验证,操作员可随时禁用人工智能。关键限制:审计公司/国家实验室的独立验证为零,每个数据中心都需要定制模型(8 年来从未商业化)。实施时间为 6-18 个月,需要多学科团队(数据科学、暖通空调、设施管理)。适用范围超出数据中心:工业厂房、医院、购物中心、企业办公室。2024-2025 年:谷歌将 TPU v5p 过渡到直接液体冷却,表明人工智能优化的实际限制。

Sistema di Raffreddamento AI di Google DeepMind: Come l'Intelligenza Artificiale Rivoluziona l'Efficienza Energetica dei Data Center

用 AI 总结本文

应用于数据中心冷却的人工智能,是工业能源优化领域最具意义的创新之一。

Google DeepMind 开发的自主系统自 2018 年起投入运行,证明了 AI 能够如何改变关键基础设施的热管理,并在运营效率方面取得了切实成果。

创新改变数据中心

能源效率问题

现代数据中心是巨大的能源消耗者,据全球能效专家 Jonathan Koomey 称,冷却约占总用电量的 10%。Google 的云端 AI 系统每五分钟从数千个传感器采集一次冷却系统的快照 Safety-first AI for autonomous data centre cooling and industrial control - Google DeepMind,分析着传统控制方法难以应对的运营复杂性。

Google 的 AI 冷却系统利用深度神经网络预测不同行动组合对未来能耗的影响,从而在严格遵守安全约束的前提下,确定哪些行动能将能耗降到最低 DeepMind AI Reduces Google Data Centre Cooling Bill by 40% - Google DeepMind

具体和可衡量的成果

在冷却优化方面取得的成果十分显著:该系统能够持续实现冷却用能减少 40%。然而,考虑到冷却仅占总能耗的约 10%,这实际上意味着数据中心整体能耗节省约 4%。

根据 Jim Gao 的原始技术论文,该神经网络的平均绝对误差为 0.004,标准差为 0.005,相当于在 PUE 为 1.1 时误差为 0.4%。

工作地点:已确认的数据中心

已验证的实施

该 AI 系统的实施已在三个特定数据中心得到官方确认:

新加坡:2016 年首次进行的重大部署,该数据中心使用回收水进行冷却,并证明了冷却能耗降低 40%。

荷兰埃姆斯哈文(Eemshaven):该数据中心使用工业用水,2023 年耗水量达 2.32 亿加仑。该设施现场负责人 Marco Ynema 负责监督这一先进设施的运营。

爱荷华州康瑟尔布拉夫斯(Council Bluffs):《麻省理工科技评论》在讨论该 AI 系统时特别展示了康瑟尔布拉夫斯的数据中心。Google 在康瑟尔布拉夫斯的两个园区投资了 50 亿美元,这两处园区在 2023 年耗水量达 9.801 亿加仑。

一套基于云的 AI 控制系统目前已投入运行,为 Google 的多个数据中心带来能源节约,但该公司尚未公布使用该技术的完整设施清单。

技术架构:如何运作

深度神经网络和机器学习

根据专利 US20180204116A1,该系统采用了具备精确技术特征的深度学习架构

  • 5 个隐藏层,每层 50 个节点
  • 19 个归一化输入变量,包括热负荷、气象条件、设备状态等
  • 184,435 个训练样本,分辨率为 5 分钟(约 2 年的运营数据)
  • 正则化参数:0.001,用于防止过拟合

该架构采用了结合线性 ARX 模型的模型预测控制,并与深度神经网络相集成。神经网络无需用户预先定义模型中各变量之间的相互关系。相反,神经网络会自行搜索特征之间的模式与相互作用,从而自动生成最优模型。

电力使用效率 (PUE):关键指标

PUE 代表数据中心的基本能效指标

PUE = 数据中心总能耗 / IT 设备能耗

  • Google 全舰队 PUE:2024 年为 1.09(据 Google 环境报告)
  • 行业平均值:1.56–1.58
  • 理想 PUE:1.0(理论上不可能达到)

谷歌拥有 ISO 50001 能源管理认证,该认证保证了严格的运行标准,但并不具体验证人工智能系统的性能。

模型预测控制(MPC)

这项创新的核心在于预测控制,它能预测数据中心未来一小时内的温度和压力,并对推荐的操作进行模拟,以确保不超出运营限制。

人工智能在冷却领域的运行优势

卓越的预测准确性

经过反复试验,模型在PUE预测方面的准确率现已达到99.6%。这一精确度实现了传统方法无法企及的优化,能够同时处理机械、电气和环境系统之间复杂的非线性交互。

不断学习和适应

一个值得关注的方面是进化学习能力。在九个月的时间里,系统的性能从初期上线时提升12%提高到约30%的改善幅度。

谷歌操作员丹-富恩芬格(Dan Fuenffinger)说:"看到人工智能学会利用冬季条件生产出比正常温度更低的水,真是令人惊叹。规则不会随着时间的推移而改进,但人工智能会"。

多变量优化

该系统能够同时管理19个关键运行参数

  • 服务器和网络设备的总IT负载
  • 气象条件(温度、湿度、焓值)
  • 设备状态(冷水机组、冷却塔、水泵)
  • 设定值和运行控制参数
  • 风扇转速和VFD系统

安全与控制:故障安全保证

多级验证

运行安全性通过冗余机制得以保障。AI计算出的最优操作会先与运营人员定义的内部安全约束清单进行核对。指令发送到实体数据中心后,本地控制系统会再次进行核验DeepMind AI reduces energy used for cooling Google data centers by 40%

操作员始终保持控制权,可以随时退出人工智能模式,无缝切换到传统规则。

局限性和方法考虑

PUE 指标和限制

业界认识到电力使用效率这一指标的局限性。Uptime Institute 2014 年的一项调查发现,75% 的受访者认为行业需要一个新的效率指标。问题包括气候偏差(无法对不同气候进行比较)、时间操纵(在最佳条件下进行测量)和组件排除。

实施的复杂性

每个数据中心都有独特的架构和环境。为一个系统定制的模型可能不适用于另一个系统,这就需要一个通用的智能框架。

数据质量与验证

模型的准确性取决于输入数据的质量和数量。当PUE值超过1.14时,由于对应训练数据的稀缺,模型误差通常会增大。

没有发现由大型审计公司或国家实验室进行的独立审计,谷歌 "没有进行超出联邦最低要求的第三方审计"。

未来:向液体冷却发展

技术转型

2024-2025 年,谷歌将工作重点大幅转向:

  • 面向1MW机架的+/-400 VDC供电系统
  • "Project Deschutes"冷却分配单元
  • 面向TPU v5p的直接液冷,实现"99.999%正常运行时间"

这一变化表明,AI优化已经达到了现代AI应用热负荷的实际极限

新兴趋势

  • 边缘计算集成:分布式AI以降低延迟
  • 数字孪生:用于高级仿真的数字孪生技术
  • 可持续发展重点:针对可再生能源的优化
  • 混合冷却:AI优化的液冷/风冷组合方案

企业的应用和机遇

应用领域

用于冷却的AI优化应用范围远超数据中心:

  • 工业厂房:制造业HVAC系统优化
  • 商业中心:智能空调管理
  • 医院:手术室和关键区域的环境控制
  • 企业办公楼:智能建筑与设施管理

投资回报率和经济效益

冷却系统节省的能耗能带来以下效果:

  • 降低冷却子系统的运营成本
  • 提升环境可持续性
  • 延长设备使用寿命
  • 提高运行可靠性

企业的战略实施

采用路线图

第一阶段 - 评估:能源审计及现有系统梳理第二阶段 - 试点:在受控环境下针对有限区域进行测试第三阶段 - 部署:分阶段推广并进行密集监控第四阶段 - 优化:持续调优并扩大产能

技术考虑因素

  • 传感器基础设施:完善的监控网络
  • 团队技能:数据科学、设施管理、网络安全
  • 集成:与遗留系统的兼容性
  • 合规:安全与环境法规

FAQ - 常见问题

1. Google在哪些数据中心真正部署了该AI系统?

三个数据中心已正式确认:新加坡(2016 年首次部署)、荷兰的 Eemshaven 和爱荷华州的 Council Bluffs。该系统已在多个谷歌数据中心运行,但从未公开过完整的名单。

2. 该系统对总能耗的实际节省效果如何?

该系统可将用于冷却的能源减少 40%。考虑到冷却能耗约占总能耗的 10%,总体节能效果约占数据中心总能耗的 4%。

3. 该系统在预测方面的精确度如何?

该系统在PUE预测方面达到了99.6%的精确度,平均绝对误差为0.004 ± 0.005,相当于对于PUE值1.1而言误差为0.4%。如果实际PUE为1.1,AI预测值会在1.096到1.104之间。

4. 系统如何保障运行安全?

它采用两级验证:首先,人工智能检查操作员定义的安全限制,然后本地系统再次检查指令。操作员可以随时关闭人工智能检查,返回传统系统。

5. 部署这样一套系统需要多长时间?

实施通常需要 6-18 个月:3-6 个月用于数据收集和模型培训,2-4 个月用于试点测试,3-8 个月用于分阶段部署。复杂程度因现有基础设施的不同而有很大差异。

6. 需要具备哪些技术能力?

需要一支具备数据科学/人工智能、暖通空调工程、设施管理、网络安全和系统集成等专业知识的多学科团队。许多公司选择与专业供应商合作。

7. 该系统能否适应季节性变化?

是的,AI会自动学习利用季节性条件,比如在冬季生产更低温的水以减少制冷能耗。该系统通过识别时间和气候模式持续改进

8. 为什么谷歌不将这项技术商业化?

每个数据中心都有独特的架构和环境,需要大量定制工作。实施的复杂性、对特定数据的需求以及所需的专业知识使得直复营销变得复杂。八年过去了,这项技术仍然只属于谷歌内部。

9. 是否存在独立的性能验证?

没有发现大型审计公司(德勤、普华永道、毕马威)或国家实验室的独立审计。谷歌已获得 ISO 50001 认证,但 "不追求 "联邦最低要求之外的 "第三方审计"。

10. 除数据中心外,是否适用于其他行业?

完全正确。人工智能冷却优化技术可应用于工业厂房、购物中心、医院、企业办公室以及任何拥有复杂暖通空调系统的设施。多变量优化和预测控制的原理普遍适用。

Google DeepMind AI制冷系统代表了一项工程创新,在特定范围内实现了渐进式改进。对于管理高能耗基础设施的企业而言,尽管存在上述规模限制,这项技术仍提供了切实可行的制冷优化机会。

主要来源: Jim Gao Google Research论文DeepMind官方博客MIT Technology Review专利US20180204116A1

评论

暂无评论——来发表第一条吧。