呢個問題唔係個別事件:後備電池、發電機同冷卻系統嘅損耗速度遠超預期,有設施嘅實際運作時間(uptime)得返80%,而北美電網監管機構——北美電力可靠性公司(NERC)——更發出歷史上第三次嘅最高級別Level 3警告,指出呢啲千兆瓦級嘅負載波動足以令整個輸電系統陷入不穩。
AI訓練嗰陣,成千上萬粒GPU會同步運算。當佢哋完成一個運算步驟、等緊checkpointing或者開始新一批訓練,電力需求可以喺唔夠一秒之內由滿載跌到接近空載,然後又再爆升返上去。呢種波動係傳統數據中心從來未見過嘅——用電量嘅增減幅度成個工廠、小鎮甚至城市咁大,而且喺幾秒內出現同消失,形成不斷衝擊,搞到連接嘅設備好難頂得住。
前Tesla高層、現任Heron Power創辦人Drew Baglino指出,AI用電量有時會比設計容量高出50%,「即係一個1千兆瓦嘅設施,喺一瞬間可能要用1.5千兆瓦」。
喺xAI位於孟菲斯嘅Colossus基地——由動工到投產只係用咗122日,初期靠幾十部臨時甲烷燃氣渦輪機供電——GPU集群嘅快速反覆電力波動,令渦輪機出現機械共振,甚至產生物理裂痕。工程師要寫自訂GPU核心程式碼,強迫GPU喺低負載時做啲額外運算嚟「食電」,等條用電曲線平滑啲,但總用電量反而增加咗。Elon Musk其後提出加裝Tesla Megapack電池,放喺渦輪機同GPU之間,由電池負責吸晒啲波動。
後備電池同不間斷電源系統(UPS)嘅充放電次數遠超設計規格,導致加速老化同提早損壞。多個設施報告話電池、發電機同冷卻系統嘅故障率同損耗速度都遠超預期。冷卻基礎設施亦跟唔上突如其來嘅負載變化,進一步縮短設備壽命。
一份學術研究確認,大型GPU集群會喺幾秒內產生數百兆瓦嘅電力波動,對連接系統構成重大挑戰。
部分AI數據中心嘅實際運作時間已經跌到大約80%,遠低於企業級數據中心普遍嘅99.99%標準。就算只係停機幾分鐘,對收入嘅打擊都好大:呢啲設施價值幾百億甚至過千億美金,停機每分鐘代表緊幾十萬美金嘅算力收入損失。
《彭博》同《Fortune》嘅報道指出,設備加速更換、計劃外停機同算力損失嘅累積成本,正對成個總值萬億美元嘅AI基建投資基礎構成壓力。除咗直接嘅停機損失,營運商仲要面對更頻密嘅維修、更短嘅渦輪機同電池更換週期,以及要寫自訂軟件嚟平滑電力需求——呢啲全部都係冇預算過嘅額外開支。
NERC記錄咗一種全新嘅可靠性威脅:當大型AI訓練基地嘅自動保護系統觸發跳脫時,可以喺唔夠一秒內從輸電系統抽走超過1,800兆瓦電力——任何人類操作員或者傳統電網控制系統都根本反應唔切。美國東部互聯電網同德州嘅ERCOT電網都已經觀察到大約1,500兆瓦嘅負載驟降事件,原因係數據中心對電壓波動極度敏感。
2024年7月,維珍尼亞北部一次普通嘅電網故障,就觸發咗25至30個變電站入面超過1,500兆瓦嘅數據中心負載同時跳脫。
2026年中,NERC發出咗最高級別嘅Level 3警告——呢個機構成立以嚟只係出過三次呢個級別嘅警報——指出超大型AI數據中心對輸電系統構成「重大風險」。警報要求輸電規劃者同營運商制定建模數據需求、收集最低同最高用電量數據,以及研究負載組成。NERC亦成立咗專責小組處理呢啲風險,未來可能會引入新嘅強制性可靠性標準。
NERC嘅《2025年可靠性狀況報告》警告,數據中心嘅發展速度遠快過支援佢哋所需嘅發電同輸電基建,形成結構性嘅可靠性缺口。報告指出,呢啲設施對電壓嘅敏感度、快速變化而且往往難以預測嘅用電模式,帶嚟前所未有嘅運行挑戰,需要「更準確嘅模型」嚟應對。
營運商正探索用電池做緩衝——例如Tesla Megapack——放喺波動嘅GPU負載同敏感嘅發電設備之間,由電池吸收晒啲波動。xAI亦開始逐步拆除部分臨時燃氣渦輪機,因為孟菲斯有新嘅變電站投入服務。
但根本問題係:AI工作嘅負載模式,電網由設計嗰日開始就未諗過要應付。NERC已經呼籲制定新嘅建模標準、營運協調機制同監管框架,先可以應對千兆瓦級別、極高波動性嘅AI負載所帶嚟嘅獨特風險。