AI 학습 중에는 수만 대의 GPU가 작업을 동기화합니다. 모든 GPU가 계산 단계를 마치고 체크포인트를 기다리거나 새 배치를 시작할 때, 전력 수요는 1초도 안 되는 사이에 최대 부하에서 거의 유휴 상태로, 혹은 그 반대로 요동칠 수 있습니다 . 이러한 변동은 기존 데이터센터가 만들어내는 패턴과 완전히 다릅니다. 공장, 마을, 심지어 도시 전체의 소비량에 맞먹는 전력 증분이 몇 초 만에 나타났다 사라지면서, 연결된 장비가 흡수하기 어려운 반복적인 충격을 만들어냅니다 .
전기차 업체 테슬라의 전 임원이자 허론 파워(Heron Power)를 설립한 드류 바글리노(Drew Baglino)는 "AI는 때때로 설계 용량보다 50% 높은 전력 사용량을 기록한다"며 "따라서 1GW 시설이 찰나의 순간에 1.5GW를 사용할 수도 있다"고 지적했습니다 .
122일 만에 완공되고 초기에는 수십 대의 메탄가스 터빈으로 가동된 xAI 멤피스 콜로서스 시설에서는 GPU 클러스터의 빠르고 반복적인 전력 변동이 터빈에 기계적 공진을 일으켜 물리적 균열을 유발했습니다 . 엔지니어들은 GPU가 전력 수요가 낮을 때 여분의 전력을 소비하도록 강제하는 맞춤형 커널을 작성하여 부하를 완화했지만, 이는 총 에너지 사용량을 증가시켰습니다 . 일론 머스크는 이후 터빈과 GPU 사이에 테슬라 메가팩 배터리를 설치해 변동을 완전히 흡수하는 방안을 제안한 것으로 알려졌습니다 .
예비 배터리와 무정전 전원 공급 장치(UPS) 시스템은 설계된 것보다 훨씬 더 자주 충방전되면서 가속 노후화와 조기 고장으로 이어지고 있습니다 . 여러 시설에서 배터리, 발전기, 냉각 시스템이 예상보다 훨씬 빨리 오작동하거나 마모되고 있다고 보고했습니다 . 냉각 인프라는 갑작스러운 부하 변화를 따라잡는 데 어려움을 겪어 장비 수명이 더욱 단축되고 있습니다 .
AI 데이터센터 전력 수요에 대한 학술 조사에 따르면, 대규모 GPU 클러스터는 수백 메가와트에 달하는 전력 변동을 수초 내에 발생시켜 연결된 시스템에 심각한 문제를 초래한다고 확인되었습니다 .
일부 AI 데이터센터는 이미 실제 운영 가동률이 약 80%까지 떨어졌으며, 이는 엔터프라이즈 데이터센터에서 기대하는 일반적인 99.99% 표준에 훨씬 못 미치는 수준입니다 . 단 몇 분의 가동 중단도 매출에 심각한 타격을 줄 수 있습니다. 수백억 달러 규모의 시설에서 1분의 다운타임은 수십만 달러의 컴퓨팅 수익 손실을 의미합니다 .
블룸버그(Bloomberg)와 포춘(Fortune)의 보도에 따르면, 가속화된 장비 교체, 계획되지 않은 정전, 손실된 컴퓨팅 용량으로 인한 누적 비용이 수조 달러 규모의 AI 인프라 투자 기반을 압박하고 있습니다 . 직접적인 가동 중단 외에도 운영자들은 더 높은 유지보수 빈도, 터빈 및 배터리의 교체 주기 단축, 전력 수요 완화를 위한 맞춤형 소프트웨어 해결 방안의 필요성 등 계획되지 않은 모든 추가 비용에 직면해 있습니다 .
NERC는 새로운 유형의 신뢰성 위협을 문서화했습니다. AI 학습 캠퍼스가 대규모화되면서 자동 보호 시스템이 작동할 경우, 1초도 안 되는 시간에 1,800MW 이상을 대규모 전력 시스템에서 차단할 수 있다는 것입니다. 이는 인간 운영자나 기존의 계통 제어 방식이 대응할 수 있는 속도를 훨씬 넘어섭니다 . 동부 인터커넥션(Eastern Interconnection)과 텍사스 전력 신뢰성 위원회(ERCOT) 모두 데이터센터의 전압 변동 민감성으로 인해 약 1,500MW 규모의 부하 감소 사건을 이미 관찰했습니다 .
2024년 7월, 버지니아 북부의 일반적인 계통 고장으로 인해 25~30개 변전소에 걸쳐 1,500MW 이상의 데이터센터 부하가 갑자기 차단되는 사건이 발생했습니다 .
2026년 중반, NERC는 사상 세 번째인 최고 수준의 레벨 3 경보를 발령했습니다. 이 경보는 초대규모 AI 데이터센터가 대규모 전력 시스템에 "심각한 위험"을 초래한다고 강조했습니다 . 이 경보는 송전 계획 담당자와 운영자에게 모델링 데이터 요구 사항을 개발하고, 최소 및 최대 소비량에 대한 데이터를 수집하며, 부하 구성을 연구하도록 지시합니다 . NERC는 또한 이러한 위험을 해결하기 위한 태스크포스를 소집했으며, 이는 잠재적으로 새로운 의무적 신뢰성 표준으로 이어질 수 있습니다 .
NERC의 2025년 신뢰성 현황 보고서(State of Reliability)는 데이터센터가 이를 지원하는 데 필요한 발전 및 송전 인프라보다 더 빠르게 개발되면서 구조적 신뢰성 격차를 만들고 있다고 경고합니다 . 해당 기관은 이러한 시설의 전압 민감성과 빠르게 변화하며 종종 예측할 수 없는 전력 사용 방식이 "더 정확한 모델"로 해결해야 할 새로운 운영 과제를 창출한다고 지적합니다 .
운영자들은 변동성이 큰 GPU 부하와 민감한 발전 장비 사이에 테슬라 메가팩과 같은 배터리 버퍼를 배치하여 변동을 흡수하는 방안을 모색하고 있습니다 . xAI는 또한 멤피스에 새로운 계통 변전소가 가동됨에 따라 일부 임시 가스터빈을 제거하기 시작했습니다 .
그러나 근본적인 과제는 여전히 남아 있습니다. AI 워크로드는 기존 전력망이 처리하도록 설계된 적이 없는 부하 프로필을 부과한다는 점입니다. NERC는 기가와트 규모의 변동성이 큰 AI 부하의 독특한 위험을 해결하기 위해 새로운 모델링 표준, 운영 조정, 규제 프레임워크를 촉구하고 있습니다 .