以下係呢項研究嘅詳細分析,以及點解電網監管機構已經將佢視為一個嚴峻嘅新威脅。
GPU嘅用電量直接跟隨住佢嘅計算負載:做大量計算嘅時候用電多,空閒嘅時候用電少。一個惡意嘅雲端租戶,只需用正常嘅GPU工作負載,喺呢兩個狀態之間快速切換,就可以喺牆身插座嗰度製造出可以控制嘅電力震盪,呢啲震盪會透過數據中心嘅電力設施,傳播到地區電網度 。
呢種攻擊唔需要用到惡意軟件、唔需要提升系統權限、更加唔需要入侵電網嘅控制系統——因為個租戶本身就已經有權去運行GPU工作 。
| 技術 | 方法 | 最高調製頻率 |
|---|---|---|
| SWMA(合成工作負載調製攻擊) | 特製嘅CUDA核心程式,可以令GPU喺高負載同空閒狀態之間快速切換 | 喺Nvidia GPU上可達 6,000 Hz |
| LTMA(LLM訓練調製攻擊) | 操縱一個合法大型語言模型嘅訓練循環,製造周期性電力波動 | 頻率較低,但更難同正常嘅AI訓練區分 |
SWMA可以產生最快嘅震盪(超過6,000 Hz),而LTMA就可以喺合法嘅LLM訓練模式範圍內做到調製 。兩種技術都顯示,雲端租戶可以產生嘅電力波動,遠比普通家庭電器好似冷氣機嗰啲慢速擺動要快得多 。
研究人員模擬咗兩個規模嘅影響:
喺一個1兆瓦嘅本地系統上使用1,000張同步GPU:電力震盪令電流總諧波失真超過 10%,喺5個IEEE基準配電饋線入面有3個出現唔穩定電壓,並觸發咗保護繼電器跳閘 。呢種攻擊有 超過80%嘅機率 會引發連鎖故障同停電 。
擴展到歐洲輸電網絡模型:喺諧振頻率下同步嘅電力震盪,可以作為區域間震盪喺廣域嘅輸電走廊傳播,威脅到成個洲嘅電網穩定 。
Bit2Watt攻擊嘅出現,正值電網監管機構對AI數據中心嘅可靠性風險發出越來越緊急嘅警告。
北美電力可靠度公司(NERC)已經指出,當保護系統跳閘時,千兆瓦級別嘅AI訓練園區可以喺唔夠一秒之內跌落 1,000兆瓦以上 嘅負載,速度遠快過傳統電網嘅安全措施可以反應 。喺 2026年5月,NERC發出咗罕見嘅 三級「必要行動」警報——即係佢哋最高嘅緊急級別——因為發生咗多宗數據中心負載突然中斷超過1吉瓦嘅事件,引起咗頻率過衝同電壓尖峰 。NERC記錄咗兩宗具體事件:一宗喺2025年2月,大約跌咗 1,800兆瓦;另一宗喺2025年6月,大約跌咗 1,300兆瓦 。
NERC嘅2026年可靠性狀況報告,明白將數據中心嘅 脈衝式同非線性負載特性 列為新興嘅可靠性威脅 。美國聯邦能源監管委員會(FERC)已經指示NERC,要喺2026年12月31日之前,為計算負載(包括AI設施)制定強制性嘅可靠性標準 。
呢啲警告唔係得個講字。喺 2025年初,美國維珍尼亞州勞登縣(即係華盛頓特區附近出名嘅「數據中心走廊」)有大約 40個數據中心,因為輸電干擾而同時同電網斷開。有啲報告話 60個中心 同時跌咗落嚟。呢次合計大約 1,500兆瓦 嘅負載損失差啲搞到系統故障,迫使電網營運商要急急腳去搵返個平衡 。
2025年1月8日,NERC發表咗對呢次事件嘅檢討報告,指出事件引起咗電壓尖峰同頻率失衡,暴露咗主要嘅大容量電力系統弱點 。華爾街日報報道,呢啲耗電量足以供應超過100萬個家庭嘅數據中心,同一時間轉用後備發電,差啲就引發連鎖大停電 。
研究人員描述咗一個自我強化嘅阻斷服務(DoS)機制:由電力震盪引起嘅電網電壓唔穩定,會觸發數據中心內部嘅保護系統,繼而限制或中斷伺服器嘅運作。呢個動作反過來會 放大 傳返去電網嘅電力幹擾。即係計算基礎設施本身嘅安全系統,反而令到電網故障惡化,然後電網故障又再進一步影響到計算——形成一個封閉嘅、雙向嘅不穩定循環 。
個租戶做嘅每一個操作,都係合法嘅雲端使用行為——開GPU核心、訓練模型、用分配好嘅計算資源。冇惡意載荷、冇被利用嘅漏洞、亦都冇未經授權嘅存取。現有嘅入侵檢測系統、防毒軟件同雲端安全監控,都係去睇軟件層面嘅異常,而唔係用電模式。因為呢種攻擊唔會產生可疑嘅網絡流量、檔案寫入或者程式行為,所以傳統嘅防禦手段根本睇佢唔到 。
論文同相關報道提出咗幾個層面嘅防禦方法:
作者指出,Bit2Watt攻擊處於 三個完全唔同領域嘅交叉點——雲端運算、GPU硬件設計同電力系統——而每個領域而家都係用獨立嘅安全模型運作,彼此之間冇跨域嘅威脅能見度。冇任何單一方可以完全減輕呢個問題 :
呢類攻擊可能會喺幾個行業仲未協調好防禦之前,就已經被人實際使用。作者呼籲要 預先制定聯合標準同即時嘅情報共享機制,唔好等到有對手喺現實世界中將呢種技術武器化先至嚟後悔 。