有趣生活

当前位置:首页>科技>谷歌神经网络采用了bn结构吗谷歌数据中心神经网络运营优化介绍

谷歌神经网络采用了bn结构吗谷歌数据中心神经网络运营优化介绍

发布时间:2026-07-21阅读(1)

导读互联网的飞速发展加大了对大规模数据中心的需求,同时也带来能耗的巨幅上升,目前数据中心的能耗已经超过了1.3%的全球能源使用量。谷歌的数据中心以高能效著称,通....

互联网的飞速发展加大了对大规模数据中心的需求,同时也带来能耗的巨幅上升,目前数据中心的能耗已经超过了1.3%的全球能源使用量。谷歌的数据中心以高能效著称,通过创新的市电直供、热空气隔离、水侧节能等技术和大量的运营优化,PUE达到了惊人的1.12领先水平。但是他们还不满足,谷歌数据中心副总裁Joe Kava和天才小子Jim Gao介绍了自己的公司是如何利用机器学习和人工智能来进一步改进数据中心能效到1.1以下的。

图1 数据中心可以更为节能

业界一般用 PUE(电能使用效率)来衡量数据中心的能效,PUE=数据中心总设备能耗/IT设备能耗,其基准值为2,越接近1表明能效越高。如图2一个典型的谷歌数据中心在投产初期的PUE达到了1.25左右,谷歌通过持续的运营优化将PUE降低到了1.12。但即便优秀如谷歌要想进一步降低PUE值也变得越来越难。因为到了一定程度之后,制冷和电气系统之间的相互作用和各种复杂反馈回路,使得难以准确使用传统的工程公式来推导优化数据中心的效率。比如冷通道温度的较小提升都会导致制冷系统的很多变化,如冷机、冷却塔、换热器、水泵等的功耗都将增加或减少,且非线性变化,结果可能是冷通道温度提升了但总功耗也会带来增加。

图2 谷歌数据中心的PUE进一步优化碰到瓶颈

为了解决这些问题,谷歌决定利用机器学习神经网络算法让其数据中心能效更上一层楼。神经网络通过神经元之间的相互作用来模仿认知行为,是一类机器学习算法。机器学习的这个分支常见的应用包括语音识别,图像处理,和自主软件代理等。机器学习方法利用现有的大量传感器数据来建立一个数学模型,理解操作参数之间的关系从而提升整体学习效率,如图3语音识别。

图3 机器学习在语音识别中的应用

据 Kava 介绍,该项目属于谷歌的20%业余时间创新项目。他们每30秒就计算一次 PUE,还不断跟踪 IT 设备能耗、室外气温以及制冷等机电设备的设置情况等。而谷歌数据中心团队成员Jim Gao对这些数据非常熟悉,他意识到这些数据还可以进一步利用。于是Jim回归本源,获取数据,分析数据,因为谷歌的BMS、PMS以及控制系统每天产生数以亿计的原始运行数据,虽然人类难以理解,但机器却很擅长于挖掘。通过机器学习对这些数据进行研究,并建立起模型来预测并进一步改善数据中心的能效。

结果表明,该模型的预测准确率达到了 99.6%(图4所示)。如此高的准确率意味着谷歌对数据中心下一步的能量需求情况将了如指掌,从而可以通过调整参数设置进一步提升能效。Kava 举了一个例子,几个月前,他们有几台服务器要下线几天,其结果是数据中心能效会有所降低。但利用Jim Gao的模型他们临时调整了制冷参数,通过PUE仿真与历史数据的结合,该团队选定了一套新的运营参数,从而将 PUE 再降低了0.02。

图4 谷歌某个数据中心在夏天一个月内的实际PUE值和预测值的比较

可不要小看这个0.02,考虑到谷歌有几十上百万台服务器,乘上巨大的量,就有可观的节能效果。需要注意的是该案例中PUE值大于1.14是因为不能提供足够的实际运行数据支持。如果谷歌能收集更多该数据中心运行数据的话,其PUE模型的精度值预计随时间会进一步增加。

Jim Gao 在随后发布的白皮书上解释了自己的做法。他说采用神经网络机器学习方法对复杂系统建模具有优势,因为神经网络不需要用户预设模型的交互特征,而是在数据中自行寻找模式和交互,然后自动生成最佳匹配模型。

该神经网络研究的要素包括了服务器总负载、水泵、冷却塔、冷水机组、干式冷却器、湿球温度、户外湿度、风速、风向等,如图5总计多达19个变量。谷歌利用传感器部署了几万个数据点来收集这些基础设施运行数据和电能使用信息。不过令人略为惊讶的是,谷歌只用一台服务器就能跑整个神经网络系统了。

图5 典型数据中心建模涉及到的各种变量

具有准确和健壮的PUE机器学习模型将给数据中心运营方和业主能提供很多好处。例如,对于任何给定一组条件下的数据中心实际性能与预测性能的比较数据,将可用于自动运行报警,运行效益指标设定和故障排除等。

一个强大的效率模型还使数据中心运营商方便评估数据中心变量参数带来的PUE敏感性。例如图6中,对谷歌某一个数据中心冷通道温度(CAT)和PUE之间关系模拟,可以推导出通过增加3华氏度的冷却塔出水温度(LWT),理论上有望达到0.5%的总PUE降低。这种PUE值降低的模拟分析,在实际测试优化中也得到了很好的验证。这种影响参量确定和PUE降低的幅度敏感度分析,可以带来显著的试验成本降低和碳排放减少。

Jim Gao 在白皮书中写道,谷歌数据中心的实际测试表明,机器学习是利用传感器数据对数据中心能效建模的一种有效方法,可带来显著的成本节省。不过对于目前国内较为粗放式管理的数据中心恐怕短时间内难以效仿。

图6 机器学习方法用于数据中心能效建模

由于现代数据中心的复杂性,以及多个控制系统之间会有相互作用。目前阶段下,数据中心运营方是很难预测改变配置参数将会带来的影响。机器学习方法可以利用现有的传感器数据,来开发能够理解运行参数和整体能源效率之间关系的数学模型。准确的数据中心效率模型可以让数据中心运营商无需现场调试就能够优化运行配置。这种机器学习模拟能让数据中心运营方将数据中心虚拟化仿真来得到最优模型参数,同时减少冷站参数变化带来的不确定性风险。

图7 虚拟数据中心建模可用于仿真分析减少现场试验不确定性

根据前面的分析,可以建模仿真图5各个运行变量参数对数据中心PUE的影响。我们通过让某一个输入变量线性变化,同时保持其他所有变量不变。这种灵敏度分析被用于评估某一参数变化带来的影响,并用于确定其最佳的设定值。下面的这些所有测试结果已被实际得到了验证。

图8(a)IT负载和PUE之间的关系

图8(b)运行冷机数量和PUE之间的关系

图8(a)展示PUE和服务器IT负载之间的关系,在0到70%最大负载的范围内PUE值得到快速降低。但在70%以上负载范围下PUE值却逐渐平缓。这个特点也在谷歌数据中心的历史PUE数据中得到验证,初期的PUE值随IT负载增加而迅速降低,这是由于负载增加带来PUE分母增加和冷却系统得到更有效的利用。然后在重载下PUE VS IT的曲线会逐渐趋于平缓,因为此时冷却系统已接近其最大的效率和运营能力。

图8(b)示出的PUE和工作制冷机数量之间的关系。正如预期的那样,有更多的冷水机组启动工作将带来PUE的显著增加。且PUE和运行冷机数量之间的关系为非线性,因为轻载下冷机制冷效率将以指数级降低。

图8(c)冷却塔数量和PUE之间的关系

图8(d)冷却塔出水温度和PUE之间的关系

图8(c)和8(d)示出的PUE和运行的冷却塔数目之间的关系,以及PUE和冷却塔出水平均温度(LWT)设定值之间的关系。从风扇的特性上判断,如果开启更多冷却塔,我们预计PUE将得到下降,因为风扇功耗和转速之间是三次方的关系。分散相同的冷却负荷到更多的冷却塔,将让每个冷却塔运转在较低的平均风扇转速,从而总功耗降低。同样地,在图8(d)中,如果冷却塔出水平均温度(LWT)设定值增加,也将降低整个冷站的能耗。这同样是因为风扇功耗和转速是成立方倍关系。图8(c)还表明了一个采用共享冷却水管道,将散热负荷分散到多个冷却塔的设计,要比每个冷却塔采用独立冷却水供回水管路的设计更为节能。

图8(e)冷冻泵数量和PUE之间的关系

图8(f)冷冻泵转速和PUE之间的关系

图8(e)和图8(f)展示了数据中心PUE和运行冷冻水泵(PWP)数量之间的关系,以及PUE和冷冻水泵转速之间的关系。对于一个给定的冷冻泵转速,增加运行冷冻泵的数量将增加总的冷却能耗,并且因此增大了PUE值。同样,提高冷冻泵平均转速,同时保持原有的冷冻泵数量,将会导致冷冻泵能耗成立方倍增加,最终提高了冷冻泵的能源开销。

图8(g)PUE和运行干冷器数量关系

图8(h)PUE和室外湿球温度关系

图8(g)展示了PUE和运行干冷器数量之间的关系。干冷器只是在冬季的几个月内运行,特别是在周围的环境温度可能造成冷却塔结冰的情况下使用。由于干冷器利用特殊闭式冷媒,冷冻水与室外冷空气之间通过冷媒进行热交换,但干冷器通常比传统的横流式冷却塔或逆流式冷却塔表现出更低的效率。这个特性可以反映在PUE图,更多的干冷器运行将带来冷却功耗的线性上升。

图8(h)则展示了提高湿球温度带来的PUE变化效果。该曲线的形状和谷歌的历史PUE数值匹配良好,较高的湿球温度限制了冷却塔的应用范围,需要更高的风扇转速和更多的机械制冷。而在左侧PUE略有增加,是因为在低湿球温度下开启了更多干冷器的缘故。

图9 室外空气焓值和PUE之间的关系

图9展示了PUE和外部空气的焓值关系。当空气焓值增大,冷却塔数量、工作冷机数量、及这些额外大功率设备投入带来的总功耗上升,使得数据中心能耗非线性增大。需要注意的是空气焓值比单独的湿球温度影响更大,因为前者能更为全面的衡量户外天气条件( 本站微信networkworldweixin),包括环境空气的水分含量和比热等。

综上,敏感性分析显示,室外空气焓值对数据中心PUE值的影响最大,紧随其后的是IT负载的影响,以及冷却塔出水温度LWT设定值,运行干冷器的数量也会显著影响数据中心的PUE值。

在实际应用中机器学习方法可以告诉我们两个结论:1、当前数据中心可到达的最低PUE值,2、以及如何调整优化参数来实现这一目标。在实际运行优化中,谷歌通过神经网络模型及过往数据的模拟分析,有一些如下的典型实际应用案例。

案例1:模拟过程供水温度的升高

在这项研究中,谷歌通过提高冷却塔出水温度LWT和冷却水补水泵的温度设定值,将送到服务器地板下冷冻水供水(PWS)的温度提升了3华氏度。图7展示出在同样的服务器负载和室外湿球温度条件下,连续三周下较高的冷冻水供水温度PWS(显示为红色)的PUE分布,和运行在较低冷冻水供水温度(PWS)下的PUE出现频次比较(显示为蓝色)。两个分布曲线都有清晰的双峰,左侧峰值对应于仅仅由冷却塔的节能工作模式,右侧峰值对应于冷却塔和冷机同时运行在夏季条件下。根据模拟预测,分布曲线的左侧有约0.5%的平均PUE值差异(不完全重叠在一起)。而在右侧的PUE值差异更大,因为在高水温下除非冷却塔已经达到了最大容量,否则冷机不会开机工作。

图10 对应于更高的PWS温度(红色)与低级PWS温度(蓝色)的PUE分布

案例2:输入错误的仪表倍率修正

在2011年Q2,谷歌宣布将天然气发电量作为PUE计算的一部分。这需要在每个谷歌的数据中心安装自动化天然气计量表。然而,不同燃气表类型带来混乱错误的测量倍率。例如,一些米表每1刻度对应1000立方英尺的天然气,而另外一些米表则显示是1:1或1:100的比例。数据中心运营团队在采用燃气供电时候发现PUE异常,实际计算得到的PUE值会高出机器学习的预测值达0.02到0.1。后来谷歌在原因查找时候发现测量值是仪表倍率错误导致,故得到修正。

图11 机器学习发现错误的天然气倍率读数

案例3:数据中心冷站配置优化

这个案例中,数据中心需对电力基础设施计划性升级,为安全起见需迁移走40%的IT负荷。为了能仍保持较高的数据中心运行效率,这需要改变冷机系统的设置参数以匹配减少的IT负载。通过神经网络算法模拟PUE优化方向和运营人员专业知识,运营团队选择了一组新的运行参数,相比之前的配置参数,该数据中心的PUE值从1.22降低到了1.18,降幅达0.04,如图12所示。

图12 采用神经网络模拟调整冷站参数实现PUE降低

当然,机器学习的应用效果受到输入数据的质量和数量的影响。因此,数据中心拥有大量的运行数据来实现精确的数学模型就显得非常关键。若只有较少的数据该仿真结果的精度会降低。

图13(a) 采用神经网络前后PUE值的对比

图13(b)出现概率的分布

图13(b)展示了某个数据中心过去2年在不同室外湿球温度下的2000个PUE数据,用蓝色标识,绿色则是采用机器学习之后的PUE数值,可以发现两个特点:1、PUE值随着室外湿球温度升高增加很快,因为冷却塔的散热效率随着室外湿球温度的升高降低很快;2、采用机器学习优化后在同一湿球温度下的PUE值(如绿色点所示),比优化前要低很多,而且基本集中在范围很窄的两个较小区域内,分别对应冷机开启和冷机不用开启的两种情况。图13(a)到图13(c)分别对应几个数据中心优化前后的PUE比较,最大实现了约25%的节能,最小的也降低了10%,总体实现了平均15%的节能。

图 14 B/C 数据中心采用神经网络运营优化前后 PUE 值的对比

数据中心中的规模在加速增长,使得能源效率优化显得越来越重要,但因其复杂性却又难以简单优化。利用本文所阐述的神经网络机器学习方法,谷歌可以预测数据中心的PUE精度达到0.4%到 0.5%之间,同时还可能将PUE降低到1.1以下。谷歌数据中心的实际优化测试结果表明了机器学习方法可以利用现有的传感器数据来模拟数据中心能源效率优化,并能实现10%以上到15%的节能,而且机器学习会告诉你如何优化数据中心的能效,包括模拟数据中心的参数配置评估,能效评估,并确定优化方案等,是一种非常有效的运营利器。

Copyright © 2024 有趣生活 All Rights Reserve吉ICP备19000289号-5 TXT地图HTML地图XML地图