Durante l'addestramento dell'IA, decine di migliaia di GPU sincronizzano il loro lavoro. Quando tutte completano un passaggio di calcolo, aspettano il checkpoint o avviano un nuovo batch, la domanda di potenza può passare dal carico massimo a quasi zero e tornare indietro in meno di un secondo . Queste oscillazioni sono diverse da qualsiasi cosa i data center tradizionali producano. Incrementi di potenza equivalenti al consumo di fabbriche, città o addirittura interi centri urbani possono apparire e scomparire in pochi secondi, creando shock ripetuti che le apparecchiature connesse faticano ad assorbire .
Drew Baglino, ex dirigente Tesla che ha fondato Heron Power, ha sottolineato che l'IA a volte vede il consumo di energia superare del 50% la capacità di progetto, "quindi un impianto da 1 gigawatt può usare 1,5 gigawatt per una frazione di secondo" .
Presso l'impianto Colossus di xAI a Memphis — costruito in 122 giorni e alimentato inizialmente da decine di turbine temporanee a metano — i rapidi e ripetuti sbalzi di potenza dei cluster GPU hanno causato risonanza meccanica e crepe fisiche nelle turbine . Gli ingegneri avrebbero scritto un kernel personalizzato che costringeva le GPU a consumare potenza extra quando la domanda era bassa, appianando il carico ma aumentando il consumo energetico totale . Elon Musk ha poi proposto di installare batterie Tesla Megapack tra le turbine e le GPU per assorbire completamente le fluttuazioni .
Batterie di backup e sistemi UPS vengono ciclati molto più frequentemente del previsto, portando a un degrado accelerato e a guasti prematuri . Molte strutture segnalano che batterie, generatori e sistemi di raffreddamento funzionano male o si usurano molto prima del previsto . Le infrastrutture di raffreddamento faticano a tenere il passo con i cambiamenti improvvisi del carico, riducendo ulteriormente la durata delle apparecchiature .
Uno studio accademico sulla domanda di elettricità dei data center AI conferma che i cluster di GPU su larga scala producono fluttuazioni di potenza di centinaia di megawatt in pochi secondi, creando sfide significative per i sistemi connessi .
Alcuni data center AI hanno già visto la loro operatività effettiva scendere intorno all'80%, ben al di sotto dello standard del 99,99% atteso dai data center aziendali . Anche pochi minuti di fermo possono colpire duramente i ricavi: in impianti dal valore di decine di miliardi di dollari, ogni minuto di inattività rappresenta centinaia di migliaia di dollari di mancati ricavi di calcolo .
I report di Bloomberg e Fortune descrivono il costo cumulativo della sostituzione accelerata delle apparecchiature, dei fermi non programmati e della capacità di calcolo persa come una pressione sulla base di investimenti delle infrastrutture AI da trilioni di dollari . Oltre ai fermi macchina diretti, gli operatori devono far fronte a una maggiore frequenza di manutenzione, cicli di sostituzione più brevi per turbine e batterie e alla necessità di soluzioni software personalizzate per appianare la domanda di potenza — tutte spese non pianificate .
La NERC ha documentato una nuova classe di minaccia per l'affidabilità: campus di addestramento AI così grandi che, quando i loro sistemi di protezione automatica scattano, possono sottrarre oltre 1.800 megawatt dal sistema elettrico in meno di un secondo — più velocemente di qualsiasi operatore umano o controllo di rete convenzionale possa reagire . Sia l'Eastern Interconnection che l'ERCOT hanno già osservato eventi di riduzione del carico di circa 1.500 MW causati dalla sensibilità dei data center alle perturbazioni di tensione .
Nel luglio 2024, un normale guasto di rete nella Virginia del Nord ha innescato la disconnessione improvvisa di oltre 1.500 MW di carico dei data center in 25-30 sottostazioni .
A metà 2026, la NERC ha emesso il suo avviso di massima urgenza di livello 3 — solo la terza volta nella sua storia — evidenziando "rischi significativi" per il sistema elettrico nazionale a causa dei data center AI hyperscale . L'allerta impone ai pianificatori e agli operatori di trasmissione di sviluppare requisiti di modellazione dei dati, raccogliere dati sul consumo minimo e massimo e studiare la composizione del carico . La NERC ha anche convocato una task force per affrontare questi rischi, che potrebbe portare a nuovi standard di affidabilità obbligatori .
Il rapporto 2025 State of Reliability della NERC avverte che i data center vengono sviluppati più velocemente delle infrastrutture di generazione e trasmissione necessarie per supportarli, creando un divario strutturale nell'affidabilità . L'agenzia sottolinea che la sensibilità alla tensione e l'uso di energia rapidamente mutevole e spesso imprevedibile di questi impianti crea nuove sfide operative che "modelli più accurati" devono affrontare .
Gli operatori stanno esplorando l'uso di buffer a batteria — come i Tesla Megapack — posizionati tra i carichi GPU volatili e le apparecchiature di generazione sensibili per assorbire le fluttuazioni . xAI ha anche iniziato a rimuovere alcune delle sue turbine a gas temporanee mentre nuove sottostazioni di rete entrano in funzione a Memphis .
Ma la sfida fondamentale rimane: i carichi di lavoro AI impongono un profilo di carico che la rete non è mai stata progettata per gestire. La NERC ha chiesto nuovi standard di modellazione, coordinamento operativo e quadri normativi per affrontare i rischi unici dei carichi AI altamente volatili su scala gigawatt .