進行 AI 模型訓練時,數萬顆 GPU 會同時執行計算步驟。當它們完成一批運算、等待資料寫入檢查點(checkpoint)或啟動下一批任務時,用電量可以在全載與閒置之間瞬間切換 。這種波動模式前所未見:每次起伏的電力增量相當於一座工廠、一個小鎮甚至一座城市的用電量突然出現又消失,反覆衝擊著連結設備 。
前特斯拉高層、現任 Heron Power 創辦人 Drew Baglino 指出,AI 訓練時電力使用量有時會飆升到設計容量的 150%,「也就是說,一座 1 吉瓦(GW)的設施在短短一瞬間可能用到 1.5 吉瓦」。
xAI 的 Colossus 設施在 122 天內快速建成,初期依靠數十台臨時甲烷燃氣輪機供電。由於 GPU 集群反覆且急促的電力跳動,輪機內部產生機械共振,導致葉片與結構出現裂縫 。工程師為此緊急撰寫自訂 GPU 核心,在低負載時命令 GPU 多耗電,雖然達到平滑負載的效果,卻增加整體電力使用 。Elon Musk 後續提議在輪機與 GPU 之間安裝特斯拉 Megapack 電池,完全吸收波動能量 。
備用電池與不斷電系統(UPS)被超乎設計頻率地反覆充放,造成加速老化與提早失效 。多家設施回報電池、發電機與冷卻系統的故障率與磨損速度遠超過預期 。冷卻基礎設施難以跟上負載的急遽變化,進一步縮短設備使用壽命 。
一份學術調查指出,大型 GPU 集群可在數秒內造成數百百萬瓦的功率波動,對連結系統形成嚴峻考驗 。
部分 AI 數據中心實際運作時間(uptime)已降至約 80%,遠低於企業數據中心標準的 99.99% 。即使只停機數分鐘,對價值數百億美元的設施而言,每分鐘即代表數十萬美元的算力收入損失 。
《彭博商業周刊》與《財星》雜誌報導指出,加速設備更換、非計畫性停機以及算力損失的累積成本,已對總值兆美元的 AI 基礎建設投資形成壓力 。除了直接停機損失,運營商還需面對更高的維護頻率、更短的輪機與電池更換週期,以及為了平滑負載而編寫特殊軟體所衍生的額外成本 。
北美電力可靠度公司(NERC)記錄到一個新型態的可靠度威脅:當大型 AI 訓練園區的自動保護系統跳脫時,可以在不到一秒內從輸電網絡中卸載 1,800 MW 以上的負載——快過任何人為操作或傳統電網控制系統的反應時間 。美國東部互聯電網與德州電力可靠性委員會(ERCOT)都已經觀測到因數據中心對電壓干擾過於敏感而導致約 1,500 MW 的卸載事件 。
2024 年 7 月,維吉尼亞州北部發生一起正常的電網故障,竟觸發 25–30 個變電站內超過 1,500 MW 的數據中心負載同時脫離系統 。
2026 年中期,NERC 發出最高緊急程度的 Level 3 警報——這是該機構史上第三次發出此等級的警告——明確指出超大規模 AI 數據中心對輸電系統構成「重大風險」。該警報要求輸電規劃者與營運商建立模型化資料要求、收集最小與最大耗電數據,並研究負載組成 。NERC 已成立專案小組處理此風險,未來可能制定新的強制性可靠度標準 。
NERC《2025年可靠度狀況報告》警告,數據中心的開發速度遠快於配套的發電與輸電基礎建設,形成結構性的可靠度缺口 。報告指出,這些設施對電壓波動敏感、耗電模式快速變化且難以預測,已為營運帶來新的挑戰,「需要更精確的模型」予以因應 。
營運商正嘗試在 GPU 這類波動劇烈的負載與敏感的發電設備之間加裝電池緩衝層——例如特斯拉 Megapack——以吸收波動 。xAI 也已開始在曼菲斯的新變電站陸續商轉後,拆除部分臨時燃氣輪機 。
但根本挑戰仍在:AI 工作負載所加諸的用電曲線,是現有電網從未設計來處理的。NERC 已呼籲建立新的建模標準、營運協調機制與法規架構,以因應千兆瓦級且高度不穩定的 AI 負載所帶來的獨特風險 。
(資料來源:Fortune、Bloomberg、arXiv、NERC 官方報告、Reddit、TechTimes、Utility Dive、GridLab 等)