其原理在于,GPU的功耗严格遵循其计算负载:高负载时电流飙升,空闲时电流骤降。恶意租户通过快速切换GPU的工作状态,在电源插座处产生可控的功率振荡,这些振荡会通过数据中心的基础设施传播至局部电网。
| 技术 | 方法 | 最大调制频率 |
|---|---|---|
| SWMA(合成工作负载调制攻击) | 编写自定义CUDA内核,在计算密集型与空闲状态间快速切换 | 英伟达GPU上高达 6,000 Hz |
| LTMA(大语言模型训练调制攻击) | 在合法的大模型训练循环中插入调制逻辑,产生周期性功耗波动 | 频率较低,但更难与正常AI训练区分 |
SWMA实现了最快振荡(6,000+ Hz),而LTMA则将恶意功耗模式伪装成合法AI训练噪声。两种技术都表明,云租户可以产生比家用空调等普通电器快得多的功率波动。
研究人员在两种规模下进行了模拟:
1,000张同步GPU + 1 MW局部电网:功率振荡导致总谐波失真超过 10%,在5个IEEE基准配电馈线中有3个出现电压不稳定,触发保护继电器跳闸。攻击导致 >80%概率 的级联故障和局部停电。
扩展至欧洲输电网络模型:在共振频率下的同步功率振荡可沿广域输电走廊传播为区间振荡,威胁欧洲大陆级的电网稳定。
Bit2Watt攻击的披露正值北美电力可靠性公司(NERC)持续发出严厉警告之际。
NERC记录显示,AI训练园区达到吉瓦级规模后,一旦保护系统跳闸,可在1秒内丢失 1,000+ 兆瓦 的负荷,速度远超传统电网安全措施的响应能力。2026年5月,NERC发布了罕见的 3级“关键行动”警报,原因是在多起事件中,超1 GW的数据中心负荷突然断开,导致频率过冲和电压尖峰。NERC记录了两起具体事件:2025年2月一次事件丢失约 1,800 MW,2025年6月另一次丢失约 1,300 MW。
NERC的2026年《可靠性状况报告》明确将数据中心的 脉冲性和非线性负载特性 列为新兴可靠性威胁。美国联邦能源监管委员会(FERC)已要求NERC在2026年12月31日前为计算负荷(包括AI设施)制定强制性可靠性标准。
这些警告并非纸上谈兵。2025年初,弗吉尼亚州劳登县——号称“数据中心走廊”——大约 40座数据中心(部分报道称 60座)在输电线路扰动后同时从电网断开。总负荷损失约 1,500 MW,险些导致系统崩溃,电网运营商被迫紧急调配电力平衡。
2025年1月8日,NERC发布了该事故的审查报告,指出电压尖峰和频率失衡暴露了Bulk Electric System的重大脆弱性。《华尔街日报》报道称,这些数据中心的耗电量足以供应超过100万户家庭,它们同时切换到备用电源,几乎引发连锁停电。
研究人员描述了一种自增强的DoS机制:由功率振荡引起的电网电压不稳定会触发数据中心内部的保护系统,后者限制或断开服务器进出电网。这反过来 加剧了功率扰动 对电网的影响。计算基础设施自身的保护系统放大了电网故障,而电网故障又进一步破坏计算——形成一个闭环的双向失稳过程。
攻击者执行的每一项操作都是合法的云端使用——启动GPU内核、训练模型、消耗分配的计算资源。没有恶意负载,没有利用的漏洞,没有未经授权的访问。现有的入侵检测系统、杀毒软件和云安全监控工具只关注软件层面的异常行为,而非功耗模式。由于攻击不产生可疑的网络流量、文件写入或进程行为,传统防御手段对其完全无效。
论文及相关报道提出了多个层面的防御方案:
论文作者强调,Bit2Watt攻击恰好位于 三个完全不同领域 的交汇点——云计算、GPU硬件设计和电力系统。每个领域目前都运行着独立的安全模型,缺乏跨域威胁可见性。没有任何单一实体能够独立完全防御它:
如果各方不协同行动,这类攻击可能在行业间协调出防御方案之前数年就已实战化。论文呼吁 建立预防性的联合标准和实时信息共享机制,以防攻击者在野外将这一技术武器化。