AI प्रशिक्षण के दौरान, हज़ारों GPU अपने काम को सिंक्रोनाइज़ करते हैं। जब वे सभी एक कम्प्यूटेशन चरण पूरा करते हैं, चेकपॉइंटिंग की प्रतीक्षा करते हैं, या एक नया बैच शुरू करते हैं, तो बिजली की मांग एक सेकंड से भी कम समय में पूर्ण लोड से लगभग निष्क्रिय और वापस आ सकती है । ये उतार-चढ़ाव पारंपरिक डेटा सेंटरों द्वारा उत्पन्न किसी भी चीज़ से भिन्न हैं। कारखानों, कस्बों या पूरे शहरों की खपत के बराबर बिजली की वृद्धि सेकंडों में प्रकट और गायब हो सकती है, जिससे जुड़े उपकरणों को बार-बार झटके लगते हैं, जिन्हें सोखना उनके लिए मुश्किल होता है ।
ड्रू बैगलिनो (Drew Baglino), टेस्ला के पूर्व कार्यकारी और हेरॉन पावर के संस्थापक, ने कहा कि AI कभी-कभी अपनी डिज़ाइन क्षमता से 50% अधिक बिजली का उपयोग करता है, "इसलिए एक 1 गीगावॉट सुविधा एक सेकंड के लिए 1.5 गीगावॉट का उपयोग कर सकती है" ।
xAI की मेम्फिस स्थित कोलोसस सुविधा में - जिसे 122 दिनों में बनाया गया था और शुरू में दर्जनों अस्थायी मीथेन-गैस टर्बाइनों द्वारा संचालित किया गया था - GPU क्लस्टरों से तेज़, बार-बार होने वाले बिजली के उतार-चढ़ाव ने यांत्रिक अनुनाद और टर्बाइनों में भौतिक दरार पैदा कर दी । इंजीनियरों ने कथित तौर पर एक कस्टम कर्नेल लिखा, जो GPU को कम मांग होने पर अतिरिक्त बिजली की खपत करने के लिए मजबूर करता था, जिससे लोड स्मूथ होता था लेकिन कुल ऊर्जा उपयोग बढ़ जाता था । एलन मस्क ने बाद में टर्बाइनों और GPU के बीच टेस्ला मेगापैक बैटरी स्थापित करने का प्रस्ताव रखा ताकि उतार-चढ़ाव को पूरी तरह से अवशोषित किया जा सके ।
बैकअप बैटरी और यूपीएस सिस्टम को डिज़ाइन की गई तुलना में अधिक बार चक्रित किया जा रहा है, जिससे त्वरित क्षरण और समय से पहले विफलता हो रही है । कई सुविधाओं की रिपोर्ट है कि बैटरियां, जनरेटर और कूलिंग सिस्टम उम्मीद से बहुत पहले खराब हो रहे हैं या खराब हो रहे हैं । लोड में अचानक बदलाव के साथ तालमेल बिठाने के लिए कूलिंग इंफ्रास्ट्रक्चर संघर्ष करता है, जिससे उपकरणों का जीवनकाल और कम हो जाता है ।
AI डेटा सेंटर बिजली की मांग के एक शैक्षणिक सर्वेक्षण की पुष्टि करता है कि बड़े पैमाने पर GPU क्लस्टर सेकंड के भीतर सैकड़ों मेगावॉट के बिजली के उतार-चढ़ाव पैदा करते हैं, जो जुड़े सिस्टम के लिए महत्वपूर्ण चुनौतियां पैदा करते हैं ।
कुछ AI डेटा सेंटरों का वास्तविक परिचालन अपटाइम (operational uptime) पहले ही गिरकर लगभग 80% पर आ चुका है, जो एंटरप्राइज डेटा सेंटरों से अपेक्षित सामान्य 99.99% मानक से काफी नीचे है । अपटाइम के कुछ मिनट भी राजस्व को गंभीर रूप से प्रभावित कर सकते हैं: दसियों अरब डॉलर की सुविधाओं में, डाउनटाइम का हर मिनट खोई हुई कम्प्यूट क्षमता में सैकड़ों हज़ारों डॉलर के नुकसान का प्रतिनिधित्व करता है ।
ब्लूमबर्ग और फॉर्च्यून की रिपोर्टों में त्वरित उपकरण प्रतिस्थापन, अनियोजित आउटेज और खोई हुई कम्प्यूट क्षमता की संचयी लागत को ट्रिलियन-डॉलर के AI बुनियादी ढांचे के निवेश आधार पर दबाव डालने वाला बताया गया है । प्रत्यक्ष डाउनटाइम के अलावा, ऑपरेटरों को उच्च रखरखाव आवृत्ति, टर्बाइन और बैटरियों के लिए छोटे प्रतिस्थापन चक्र, और बिजली की मांग को सुचारू करने के लिए कस्टम सॉफ्टवेयर वर्कअराउंड की आवश्यकता का सामना करना पड़ता है - ये सभी अनियोजित व्यय जोड़ते हैं ।
NERC ने एक नए प्रकार के विश्वसनीयता खतरे का दस्तावेजीकरण किया: AI ट्रेनिंग कैंपस इतने बड़े हैं कि जब उनके स्वचालित सुरक्षा सिस्टम ट्रिप होते हैं, तो वे एक सेकंड से भी कम समय में 1,800+ मेगावॉट को बल्क पावर सिस्टम से हटा सकते हैं - जो किसी भी मानव ऑपरेटर या पारंपरिक ग्रिड नियंत्रण की प्रतिक्रिया से तेज है । ईस्टर्न इंटरकनेक्शन और टेक्सास की इलेक्ट्रिक रिलायबिलिटी काउंसिल (ERCOT) दोनों ने पहले ही डेटा सेंटरों के वोल्टेज गड़बड़ी के प्रति संवेदनशीलता के कारण लगभग 1,500 मेगावॉट के लोड-रिडक्शन घटनाओं को देखा है ।
जुलाई 2024 में, उत्तरी वर्जीनिया में एक सामान्य ग्रिड फॉल्ट ने 25-30 सबस्टेशनों में 1,500 मेगावॉट से अधिक डेटा सेंटर लोड के अचानक डिस्कनेक्शन को ट्रिगर किया ।
2026 के मध्य में, NERC ने अपनी उच्चतम-प्राथमिकता वाली लेवल 3 चेतावनी जारी की - जो इसके इतिहास में केवल तीसरा ऐसा अलर्ट है - जो हाइपरस्केल AI डेटा सेंटरों से बल्क पावर सिस्टम के लिए "महत्वपूर्ण जोखिमों" पर प्रकाश डालता है । अलर्ट ट्रांसमिशन प्लानर्स और ऑपरेटरों को मॉडलिंग डेटा आवश्यकताओं को विकसित करने, न्यूनतम और अधिकतम खपत पर डेटा एकत्र करने और लोड संरचना का अध्ययन करने का निर्देश देता है । NERC ने इन जोखिमों से निपटने के लिए एक टास्क फोर्स का गठन किया है, जिसके परिणामस्वरूप संभावित रूप से नए अनिवार्य विश्वसनीयता मानकों का निर्माण हो सकता है ।
NERC की 2025 स्टेट ऑफ़ रिलायबिलिटी रिपोर्ट चेतावनी देती है कि डेटा सेंटर उनके समर्थन के लिए आवश्यक जनरेशन और ट्रांसमिशन इंफ्रास्ट्रक्चर की तुलना में तेज़ी से विकसित हो रहे हैं, जिससे एक संरचनात्मक विश्वसनीयता अंतर पैदा हो रहा है । एजेंसी नोट करती है कि इन सुविधाओं की वोल्टेज संवेदनशीलता और तेज़ी से बदलती, अक्सर अप्रत्याशित बिजली खपत नई परिचालन चुनौतियां पैदा करती हैं, जिन्हें "अधिक सटीक मॉडलों" द्वारा संबोधित किया जाना चाहिए ।
ऑपरेटर बैटरी बफ़र्स - जैसे कि टेस्ला मेगापैक - की खोज कर रहे हैं, जो अस्थिर GPU लोड और संवेदनशील जनरेशन उपकरणों के बीच उतार-चढ़ाव को अवशोषित करने के लिए रखे जाते हैं । xAI ने मेम्फिस में नए ग्रिड सबस्टेशनों के चालू होने के साथ अपने कुछ अस्थायी गैस टर्बाइनों को हटाना भी शुरू कर दिया है ।
लेकिन मूलभूत चुनौती बनी हुई है: AI वर्कलोड एक ऐसा लोड प्रोफ़ाइल थोपते हैं जिसे संभालने के लिए ग्रिड को कभी डिज़ाइन नहीं किया गया था। NERC ने गीगावॉट-स्केल, अत्यधिक अस्थिर AI लोड के अद्वितीय जोखिमों को संबोधित करने के लिए नए मॉडलिंग मानकों, परिचालन समन्वय और नियामक ढांचे का आह्वान किया है ।