跳到主内容
精选85华尔街见闻(RSS)行业动态

AI数据中心电力波动损毁设备,万亿美元投资面临考验

AI数据中心用电新难题:电力波动导致关键设备频繁损毁,万亿美元投资迎来考验

原文
推荐理由

做AI基础设施和算力投资的同学必看,电力波动导致设备损毁和可靠性下滑,直接冲击万亿美元投资回报,建议评估项目风险时纳入这一变量。

AI对电力的巨大需求早已人尽皆知,但一个更隐蔽、更棘手的问题正浮出水面:数据中心用电量的剧烈波动正在损毁关键设备,威胁设施可靠性,并向整个电网输出不稳定风险。

据彭博8月6日报道,电池、发电机、冷却装置等AI计算设施的核心系统正因承受异常电力冲击而出现故障或提前报废。在xAI位于田纳西州孟菲斯的Colossus超算设施,燃气轮机已出现裂缝;英国多处规模较小的数据中心同样出现轮机开裂问题。部分已安装的稳压电池在高强度运行下,数周乃至数月内便需更换。

这一问题的市场影响正在显现。据报道,一位参与数据中心融资的知情人士透露,部分设施的实际运行时间已降至80%左右,远低于全年不间断运行的设计预期,若问题未能解决,未来12至24个月内将对相关项目投资者造成直接冲击。与此同时,北美电力可靠性公司(NERC)今年早些时候发出罕见的三级警报,要求大型数据中心立即应对电网稳定性风险。

电力波动的根源:GPU集群的"毫秒级"冲击

AI数据中心的用电模式与传统数据中心存在本质差异。传统设施的用电量相对平稳,而AI计算——尤其是模型训练阶段——会驱动数十万块GPU同步启停,用电量在毫秒级时间内大幅跃升或骤降。

Mainspring Energy Inc.创始人兼总裁Shannon Miller将这一现象形象地描述为:一座相当于波士顿规模的1吉瓦数据中心,其中一半的用电量可能每隔数秒便闪烁开关。而德克萨斯州和美国中西部规划中的部分AI园区规模超过5吉瓦,平均用电量接近纽约市全市水平。

前特斯拉高管、Heron Power Electronics Co.创始人Drew Baglino指出,AI数据中心的瞬时用电量有时会飙升至设计容量的50%以上——"一座1吉瓦的设施可能在瞬间消耗1.5吉瓦"。其公司正为英伟达预计于2027年推出的下一代服务器开发电力波动管理设备。

Uptime Institute英国首席顾问Amber Villegas-Williamson将这种冲击比作驾车时反复猛踩油门:

"就像不断超速运转发动机,比匀速行驶磨损快得多。"

设备损毁已成现实:从裂缝到电弧闪络

据彭博采访的逾三十位美欧电力专业人士,AI数据中心对物理设备造成的压力已有目共睹。

报道称,多位知情人士表示,数据中心所用小型天然气内燃机的曲轴已出现断裂。xAI的Colossus设施中,燃气轮机出现裂缝,运营方随后安装电池以平滑电力波动、减轻轮机负荷。GeoPura Ltd.首席执行官Andrew Cunningham亦证实,英国多处规模较小的数据中心同样出现轮机开裂问题。

UL Solutions Inc.首席执行官Jennifer Scanlon指出,设备裂损或磨损可能引发电弧闪络——即电流在导体间跳跃——进而损毁AI芯片。

Uptime Institute及多位业内人士表示,为稳压而安装的电池有时在数周乃至数月内便需更换。电池、电容器、变压器、飞轮等稳压设备虽已存在,但在抢速建设AI算力的浪潮中,新建数据中心对这些技术的部署明显不足。

值得注意的是,这一问题遍及全球,从中东、非洲到欧洲和美国均有出现。

可靠性下滑直击营收:每分钟损失可达数十万美元

设备损毁带来的直接后果是设施停机,而停机的代价极为高昂。

Switch数据中心首席战略官Jason Hoffman表示,关键设备提前损毁的财务代价,"主要不是更换一个泵或断路器的成本,而是昂贵算力资产因离线而无法创造收入的损失"。据估算,停机造成的收入损失从每分钟数千美元到数十万美元不等,因设施类型和工作负载而异。

据报道,一个具体案例是:为确保微软要求的99.999%可靠性,Joulent Inc.与雪佛龙联合开发的德克萨斯州西部2.67吉瓦AI园区,不得不在工期中预留额外工程时间,供电启动时间因此从2027年推迟至2028年。Joulent首席执行官Chris James表示,这一调整正是为了应对电力波动带来的工程挑战。

报道称,据一位参与数据中心融资的知情人士透露,行业普遍假设设施上线后将全年不间断运行,但现实中部分设施的实际运行率已接近80%。若问题无法解决,未来12至24个月内将对相关项目投资者产生实质冲击。

分析指出,超大规模云厂商数千亿美元的资本开支已令投资者和贷款方神经紧绷。设备损毁加速折旧的问题,与此前市场对GPU机架折旧速度的质疑相互叠加,令外界对AI数据中心能否兑现其盈利承诺产生更深层的疑虑。

即便数分钟的停机,也会直接侵蚀数据中心开发商的营收。而若实际运行率长期低于预期,项目的财务模型将面临根本性重估。在AI基础设施投资热潮尚未退温之际,这一结构性风险正成为投资者不得不正视的新变量。

电网稳定性告急:监管机构发出罕见警报

值得注意的是,AI数据中心的电力波动不仅威胁设施自身,还向更广泛的电网输出不稳定性。

据报道,施耐德电气电能质量专家、全球产品经理Sreemant Roy警告称,这类高度动态的负荷"会导致电网不稳定,若不加以纠正,可能引发停电或断电"。他特别指出,数据中心可能引发次同步振荡,损坏电网其他节点的连接设备,"这已令全球电力公司深感忧虑"。

监管层面,NERC在过去两年内多次发出警告,将数据中心列为电网稳定性的最大风险之一。

据NERC去年9月的报告,在对美国逾33吉瓦在运数据中心的评估中,约四分之三的负荷模型"不足以反映数据中心的动态行为"。今年早些时候,NERC发出罕见的三级警报,要求大型数据中心于8月3日前提交应对方案。

面对上述挑战,产业链各环节正积极寻求解决方案。

英伟达表示,自2024年发布Blackwell GPU起,已加强与电力专家的合作。英伟达超大规模基础设施解决方案高级总监Dion Harris表示,公司正致力于在数据中心建设、设计、工程及电力输送各环节实现更平稳的部署。

在运营层面,部分数据中心用户已采用"侧边计算"技术——运行不属于训练流程的虚拟计算任务,以维持GPU稳定运行、平滑用电波动。但批评者指出,这一方法在电力需求本已高涨之际造成了额外的电力浪费。

在政策层面,美国能源部去年委托科罗拉多州丹佛附近的国家洛基山实验室(NLR)建立测试平台,专门研究如何将AI安全接入电网。

NLR项目经理Martha Symko-Davies表示,该平台配备GPU和发电设备,供开发者测试其系统能否应对AI负荷的波动性,并将用于测试电池、软件及其他稳压设备。"我们现在有机会把这件事做对,"她说。

本文来自华尔街见闻,欢迎下载APP查看更多

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近