[控场AI]
· 5 分钟阅读· 2,737 字

AI数据中心为何如此耗电?从GPU发热到核电站的能源困局

AI数据中心为何如此耗电?从GPU发热到核电站的能源困局

AI数据中心规模与能耗急剧膨胀,光子学与小模型或是破局关键,但最终仍是社会取舍问题。

自2019年以来,全球涌现出逾千座AI数据中心,依托数十万块GPU支撑大语言模型的训练与推理,单座耗水如小镇、耗电如小城市。GPU高强度并行运算产生的巨大热量是核心工程难题,液浸冷却与光纤互连是当前主要应对手段。集成光子学有望将整体功耗削减近50%,但模型规模的持续扩张很可能抵消效率收益——预测显示,到2028年仅美国数据中心用电量就可能相当于八个纽约市。破局方向包括面向特定任务的小语言模型和直接用光完成运算的光学计算,然而文章指出,这归根结底是一个社会问题:人类社会究竟愿意为更聪明的机器投入多少资源。

自2019年以来,全球范围内涌现出一千多座庞大的仓储式园区。每座综合体占地近10万平方米,耗水量相当于一个小镇,耗电量则堪比一座小城市。这些就是支撑Claude、ChatGPT等大语言模型运行与训练的AI数据中心。它们与2000年代以来服务于互联网的传统数据中心形似,却带来了一整套全新的挑战与可能性。

数据中心内部:一个提问如何被回答

AI数据中心通常被划分为多个功能区。网络运营中心(NOC)负责管理数据流量与功耗;由变压器、燃气发电机和电池备份组成的电力系统确保供电不中断;而被称为「MeetMe Room」的连接枢纽则把进入的数据导向整个设施的核心——服务器机房。

当你向一个大语言模型提问时,你的提示词会进入其中一间服务器机房。模型如何给出回答的机制相当复杂,但本质上就是在做海量的数学运算。为了处理这些计算,数据中心依赖成千上万个服务器机架,每个机架堆叠着装有内存芯片和GPU的服务器托盘。

数据中心依赖成千上万个服务器机架

这些高性能微芯片内部有数千个微小计算核心并行工作,每秒完成数万亿次数学运算。虽然大多数提问只需要几块GPU就能回答,但数据中心每秒已需处理数万条提示词,而且这个速率还在快速增长。更关键的是,训练一个大语言模型需要数十万块GPU协同工作——这正是庞大服务器阵列不可或缺的原因。

GPU(图形处理单元)最初为游戏渲染而设计,其擅长的"并行计算"恰好契合深度学习的需求。与CPU串行处理复杂逻辑不同,GPU内部集成了数千个相对简单的计算核心,可以同时对矩阵中的大量数值执行相同运算。大语言模型的推理与训练本质上都是密集的矩阵乘法,因此GPU成为AI数据中心的核心计算单元。目前主流的AI训练集群大量采用英伟达H100、H200等高端GPU,单张售价超过3万美元,而一个大型训练集群往往需要数万乃至数十万张。正是这种对GPU的极度依赖,决定了AI数据中心在规模、能耗和造价上都远超传统互联网数据中心。

散热难题:GPU的热量足以熔化电路板

这种高能耗运算带来了一个核心问题——热量。即便在恒温控制的服务器机房里,GPU产生的热量也足以熔化服务器电路板,而连接这些芯片的铜线在传输过程中不断耗散能量,既增加耗电又产生额外热量。

工程师们正在应对这一挑战。在芯片冷却方面,他们一方面沿用成熟方案,比如利用水塔吸收并蒸发热量;另一方面也引入新方法,例如在服务器板背后铺设冷水管道,甚至将整个托盘浸入不导电的冷却液中。

在服务器板背后铺设冷水管道等新型散热方案

同时,他们正用光纤替代低效的铜线。铜线通过电信号传输数据,而光纤通过光传输数据。许多机架顶部装有光学收发器,将电信号转换为光信号,这些信号在光纤中传输,比铜线具有更高的数据保真度和近乎零的功率损耗。

集成光子学:能把功耗砍掉一半?

随着光子技术进一步集成到服务器内部,它还能解决另一个重大瓶颈。GPU上用于铜连接的空间有限,这制约了芯片一次能传输的数据量。而集成光子芯片可以利用不同波长的光,在少数几条光路上同时传输多路数据流。

光子技术可让GPU与相邻托盘和机架上的内存芯片交互

这项技术甚至能让GPU与相邻托盘和机架上的内存芯片直接交互,从而分散热负荷,并让更大的模型以更低的功耗运行。部分专家认为,集成光子学有望将数据中心功耗降低近50%。然而,即便如此,这可能仍然不够。

集成光子学(Silicon Photonics)是将光学器件与传统硅基半导体工艺结合,在同一芯片上实现光的产生、传输、调制与探测的技术。其核心优势在于光子不携带电荷,在介质中传播时几乎不产生热量,且单条光路可通过波分复用(WDM)同时承载数十路不同波长的数据信号,带宽密度远超铜互连。当前AI芯片的一大瓶颈正是"内存墙"——GPU与内存之间的数据搬运速度跟不上计算速度,导致大量算力空转等待数据。集成光子互连可以大幅提升芯片间带宽并降低延迟,使GPU能更高效地访问分布在多个托盘乃至多个机架上的内存,从根本上缓解这一瓶颈。英特尔、IBM及多家初创公司已在该领域持续投入,但大规模量产仍面临光电集成良率与封装成本的挑战。

能源黑洞:到2028年或相当于八个纽约市

单块GPU的运行功率大约相当于16个灯泡。把数据中心里每一块GPU的耗电量相乘,总量足以为30万户家庭供电。

同时,各大公司正在追求越来越「聪明」的AI,而迄今为止,这往往意味着越来越「庞大」的AI。即便效率不断提升,更大的模型依然需要更大的数据中心和更多的电力。一些预测认为,到2028年,仅美国的数据中心用电量就可能相当于八个纽约市。事实上,已有AI公司提出为下一代数据中心配套建设专属核电站。

我们显然没有足够的能源支撑这种快速扩张

现实很清楚:我们并没有足够的能源来支撑这种快速扩张。要么踩下刹车,要么找到「更聪明地计算」的方法。

出路:更小的模型,还是用光来计算?

一个思路是摆脱「大而全」。当前的大语言模型被设计成能回答一切问题,但你并不需要一个懂莎士比亚的模型来帮你修洗碗机。我们完全可以设计针对特定主题的小语言模型,存储在微型数据中心里。

另一个方向是光学计算——未来的大语言模型或许会直接用光本身来完成数学运算,从而大幅削减能耗。

但这里有个更根本的悖论:如果我们对AI的需求持续膨胀,那么系统再高效也无济于事。归根结底,这不是一个技术问题,而是一个社会问题——我们究竟愿意投入多少资源,来建造更聪明的机器?

微芯片不仅驱动数据中心,也驱动着我们今天使用的每一台电子设备,从手机、汽车、家电到医疗器械。AI的能源账单,最终考验的是整个社会的取舍。

光学计算(Optical Computing)是指利用光子而非电子直接执行数学运算。在矩阵乘法场景下,光学处理器可通过干涉、衍射等物理现象以光速完成计算,理论上能耗可比电子芯片低几个数量级。Lightmatter、Luminous Computing等公司已在研发光子张量处理器原型。然而,光学计算目前面临精度不足、与现有数字系统集成困难以及制造成本高昂等问题,距离大规模商用仍有相当距离。"更聪明地计算"这一目标,需要光学计算、新型存储器架构、稀疏化算法等多条技术路线协同推进,而非单一突破就能解决。

分享:

相关推荐