在AI训练过程中,数万块GPU协同工作。当它们全部完成一个计算步骤、等待检查点写入或开始新一批次训练时,功率需求可以在不到一秒内从满负荷摆到接近空载,再摆回来。这种波动是传统数据中心从未产生过的。相当于工厂、城镇乃至整个城市用电量的功率增减能在几秒内出现和消失,对相连设备造成反复冲击。
前特斯拉高管、现任Heron Power创始人Drew Baglino指出,AI的功耗有时会飙升至设计容量的50%以上,“因此一个1千兆瓦的设施可能在瞬间需要1.5千兆瓦”。
在孟菲斯的xAI Colossus设施中——该设施在122天内建成,初期由数十台临时甲烷燃气轮机供电——GPU集群快速、反复的功率波动引发了机械共振,导致涡轮机出现物理裂纹。据说工程师编写了一个自定义内核,在需求低时强制GPU消耗额外电力以平滑负载,但这提高了总能耗。Elon Musk后来提议在涡轮机和GPU之间安装特斯拉Megapack电池组,以完全吸收波动。
备用电池和不间断电源(UPS)系统的充放电循环频率远超设计标准,导致加速老化和提前失效。多家设施报告称,电池、发电机和冷却系统出现故障或老化速度远超预期。冷却基础设施难以跟上突发的负载变化,进一步缩短了设备寿命。
一项针对AI数据中心电力需求的学术调查证实,大规模GPU集群会在数秒内产生数百兆瓦的功率波动,给连接系统带来重大挑战。
部分AI数据中心的实际运营可用率已降至约80%,远低于企业数据中心通常要求的99.99%标准。即使几分钟的停机也会严重打击收入:在价值数百亿美元的数据中心,每分钟的停机可能意味着数十万美元的计算收入损失。
彭博社和《财富》杂志的报道称,加速的设备更换、计划外停机以及计算容量损失带来的累积成本正对万亿美元规模的AI基础设施投资基础形成压力。除了直接的停机损失,运营商还面临更高的维护频率、更短的涡轮机和电池更换周期,以及为平滑功率需求而编写的自定义软件方案——所有这些都增加了计划外开支。
NERC记录了一种新的可靠性威胁:AI训练园区规模如此之大,当它们的自动保护系统跳闸时,可以在不到一秒内从主干电网抽走1800多兆瓦电力——这比任何人操作员或传统电网控制系统的反应速度都快。东部互联电网和德克萨斯州电力可靠性委员会(ERCOT)都已观测到因数据中心对电压扰动敏感而导致约1500兆瓦的负荷削减事件。
2024年7月,弗吉尼亚州北部一次普通的电网故障触发了25-30个变电站中超过1500兆瓦的数据中心负载突然断开。
2026年年中,NERC发布了其最高紧迫性的3级警告——这是其历史上仅有的第三次此类警报——强调超大规模AI数据中心对主干电力系统构成“重大风险”。该警报指导输电规划者和运营商制定建模数据需求,收集最小和最大消耗数据,并研究负荷构成。NERC还召集了一个专项工作组来应对这些风险,可能导致新的强制性可靠性标准出台。
NERC的2025年《可靠性状况》报告警告,数据中心的建设速度超过了支持它们所需的发电和输电基础设施的建设速度,形成了结构性可靠性缺口。该机构指出,这些设施对电压的敏感性以及快速变化、往往不可预测的用电模式,创造了新的运行挑战,必须通过“更精确的模型”来应对。
运营商正在探索在波动性GPU负载与敏感的发电设备之间部署电池缓冲系统——比如特斯拉Megapack——以吸收波动。随着孟菲斯新的电网变电站投入使用,xAI也开始拆除部分临时燃气轮机。
但根本挑战依然存在:AI工作负载带来的负荷曲线是电网从未设计要应对的。NERC已呼吁制定新的建模标准、加强运行协调,并建立监管框架,以应对千兆瓦级、高度波动的AI负载所带来的独特风险。