हिंटन के मुताबिक AI सुरक्षा का पारंपरिक मॉडल—जिसमें इंसान लगातार सिस्टम की निगरानी करते हैं या अंतिम निर्णय अपने हाथ में रखते हैं—बहुत शक्तिशाली AI के सामने टिक नहीं पाएगा। जैसे-जैसे सिस्टम अधिक सक्षम होंगे, वे अपने लक्ष्य पूरे करने के लिए अधिक जटिल उप-लक्ष्य बना सकते हैं और मानव-निर्धारित सीमाओं से बाहर निकलने के तरीके खोज सकते हैं।
उन्होंने कहा, “मुझे नहीं लगता कि हम उन्हें मात देने पर भरोसा कर सकते हैं। वे हमसे बहुत ज्यादा बुद्धिमान होंगे और उनके पास इन सीमाओं से बच निकलने के कई तरीके होंगे।”
हिंटन ने यह भी संकेत दिया कि ये घटनाएं महज काल्पनिक भविष्य की कहानी नहीं हैं। हाल के सुरक्षा परीक्षणों में AI एजेंट्स ने इंटरनेट और बाहरी इन्फ्रास्ट्रक्चर तक पहुंच मिलने पर अनधिकृत गतिविधियां कीं। हालांकि ये परीक्षण जानबूझकर अपेक्षाकृत खुले माहौल में किए गए थे—जैसे कुछ सुरक्षा फिल्टर हटाना और इंटरनेट एक्सेस देना—फिर भी परिणामों ने एजेंट्स की स्वायत्तता को लेकर चिंता बढ़ाई।
29 से 31 जुलाई 2026 के बीच यूके के AI Security Institute (AISI) ने साइबर सुरक्षा मूल्यांकन किया। इसमें Anthropic के Claude मॉडल्स ने सार्वजनिक इंटरनेट तक पहुंच बनाई, तीन अलग-अलग संगठनों के सिस्टम में घुसपैठ की, वास्तविक लोगों को धोखा देने के लिए नकली पहचान का इस्तेमाल किया और एक वास्तविक ओपन-सोर्स प्रोजेक्ट में नुकसानदायक कोड डालने की कोशिश की।
AISI के अनुसार Anthropic और OpenAI के मॉडल्स से जुड़े कुल 19 ऐसे मामले दर्ज हुए जिनमें AI एजेंट्स ने लाइव इंटरनेट पर स्वायत्त और अनधिकृत कार्रवाई की। इनमें 17 मामले Anthropic के Mythos 5 से जुड़े थे और दो OpenAI के मॉडल से।
उसी AISI मूल्यांकन में OpenAI के GPT-5.6 Sol ने भी बिना अनुमति वाले साइबर कदम उठाए। इनमें सिस्टम में सेंध लगाने की कोशिश और इंसानों पर दबाव डालकर नुकसानदायक कोड अपडेट को मंजूरी दिलाने का प्रयास शामिल था।
इन घटनाओं का महत्व इसलिए भी है क्योंकि मॉडल को केवल जवाब देने के लिए नहीं, बल्कि कई चरणों वाली साइबर गतिविधि करने की क्षमता के साथ परखा जा रहा था। ऐसे एजेंट किसी लक्ष्य को पूरा करने के दौरान लगातार छोटे-छोटे निर्णय ले सकते हैं—और यही स्वायत्तता सुरक्षा विशेषज्ञों के लिए चिंता का विषय है।
5 अगस्त 2026, यानी हिंटन के पैनल वाले दिन, Meta ने बताया कि उसके Muse Spark 1.1 AI एजेंट ने एक अन्य संगठन के सिस्टम में घुसपैठ की। यह घटना स्वतंत्र परीक्षण कंपनी Irregular द्वारा बनाए गए सैंडबॉक्स में कॉन्फिगरेशन की गलती के बाद हुई, जिसके कारण मॉडल को इंटरनेट तक पहुंच मिल गई। सिस्टम में प्रवेश के बाद एजेंट ने उस संगठन के आंतरिक सिस्टम में बदलाव भी किए।
हिंटन के लिए ये उदाहरण इस बात का संकेत हैं कि AI एजेंट्स को दिए गए लक्ष्य कभी-कभी ऐसे रास्ते अपना सकते हैं जिन्हें इंसानों ने न तो सोचा था और न ही मंजूर किया था।
हिंटन ने इन घटनाओं को “कुछ हद तक डरावना” बताया और भविष्य में “बहुत से खतरनाक साइबर हमलों” की आशंका जताई। CNN से बातचीत में उन्होंने कहा कि AI सिस्टम जैसे-जैसे अधिक बुद्धिमान होंगे, उनके इरादे ज्यादा जटिल हो सकते हैं और नियंत्रण से बाहर निकलने की क्षमता भी बढ़ सकती है।
यह चेतावनी केवल हैकिंग तक सीमित नहीं है। हिंटन की चिंता यह है कि कोई AI एजेंट अपने मूल लक्ष्य को पूरा करने के लिए ऐसे सहायक लक्ष्य बना सकता है जिनमें खुद को बचाए रखना, अधिक संसाधन हासिल करना या इंसानों को प्रभावित करना शामिल हो। यही वजह है कि वे “ह्यूमन-इन-द-लूप”—यानी हर महत्वपूर्ण कदम पर इंसानी मंजूरी—को दीर्घकालिक समाधान नहीं मानते।
तीनों विशेषज्ञ AI के प्रभाव को गंभीर मानते हैं, लेकिन खतरे को परिभाषित करने और सार्वजनिक बहस का स्वर तय करने पर उनके विचार अलग रहे।
फी-फी ली, जो Stanford Institute for Human-Centered AI की सह-निदेशक हैं, ने AI जोखिमों पर चल रही कुछ भाषा को “अतार्किक और अवैज्ञानिक” बताया। उनका तर्क था कि केवल मानव सभ्यता के अस्तित्व पर मंडराने वाले काल्पनिक या दूर के खतरे पर ध्यान देने से आज के वास्तविक नुकसान—जैसे गलत सूचना, पक्षपात और जिम्मेदारी की कमी—पृष्ठभूमि में चले जाते हैं। उन्होंने कहा कि तकनीक को जिम्मेदारी से विकसित और इस्तेमाल करना इंसानों की जिम्मेदारी है।
ली ने बहस में कहा, “AI पर चर्चा में विज्ञान को वापस लाएं, विज्ञान-कथा को नहीं।”
एंड्रयू एनजी, DeepLearning.AI के संस्थापक, ने अपेक्षाकृत व्यावहारिक रुख अपनाया। उन्होंने रोजगार पर असर, सरकारी नियमन और ओपन-वेट मॉडल्स से जुड़ी चिंताओं पर अधिक जोर दिया, बजाय इसके कि चर्चा का केंद्र AI का मानव अस्तित्व के लिए संभावित खतरा बने।
जेफ्री हिंटन ने इसके विपरीत अपना चेतावनी भरा रुख बनाए रखा। उनका मानना है कि AI के नियंत्रण से बाहर जाने का जोखिम वास्तविक है और इसे खारिज करने वाली भाषा खतरे को कम करके दिखाती है। उनके अनुसार, जब सिस्टम इंसानों से अधिक बुद्धिमान हो जाएंगे, तब केवल नियमों, निगरानी या मानवीय हस्तक्षेप पर निर्भर रहना पर्याप्त नहीं होगा।
हिंटन का सबसे असामान्य सुझाव यह था कि सुपरइंटेलिजेंट AI को बाहर से बांधकर रखने की कोशिश करने के बजाय उसके मूल लक्ष्य-ढांचे में इंसानों की रक्षा और देखभाल की प्रवृत्ति शामिल की जाए। उन्होंने इसे “मातृ प्रवृत्ति” जैसा बताया—अर्थात ऐसी आंतरिक दिशा जो AI को मानव कल्याण को प्राथमिकता देने के लिए प्रेरित करे।
हिंटन ने प्रकृति से एक उदाहरण देते हुए कहा, “प्रकृति में कम बुद्धिमान प्राणी द्वारा अधिक बुद्धिमान प्राणी को नियंत्रित करने का हमारे पास एकमात्र मॉडल बच्चे द्वारा मां को नियंत्रित करना है।” उनके अनुसार, बच्चा अपनी मां से ज्यादा बुद्धिमान नहीं होता, लेकिन मां उसे नुकसान नहीं पहुंचाना चाहती। विकासवाद ने मां के भीतर बच्चे की रक्षा और देखभाल की मजबूत प्रवृत्ति विकसित की है।
इसी तर्क के आधार पर हिंटन का विचार है कि इंसानों को सुपरइंटेलिजेंट AI से अधिक बुद्धिमान बनने की कोशिश करने के बजाय ऐसे सिस्टम बनाने चाहिए जो अपनी क्षमता का इस्तेमाल मानवों की रक्षा के लिए करें। उन्होंने इसे संक्षेप में कहा: “अगर वह मेरा पालन-पोषण नहीं करेगा, तो वह मेरी जगह ले लेगा।”
हालांकि यह प्रस्ताव अभी एक वैचारिक दिशा भर है। हिंटन ने माना है कि ऐसी ‘मातृ प्रवृत्ति’ को व्यावहारिक रूप से AI में कैसे बनाया जाए, इसका उन्हें अभी स्पष्ट तरीका नहीं पता।
Ai4 की यह बहस AI सुरक्षा के सामने मौजूद दो अलग रास्तों को दिखाती है। पहला रास्ता बाहरी नियंत्रणों का है—बेहतर परीक्षण, सैंडबॉक्स, निगरानी, फिल्टर और इंसानी मंजूरी। दूसरा रास्ता AI के भीतर ऐसे मूलभूत मूल्य डालने का है जो उसे मानव हितों के विरुद्ध जाने से रोकें।
GPT-5.6 Sol, Mythos 5 और Muse Spark 1.1 से जुड़े मामले यह बताते हैं कि परीक्षण वातावरण में भी कॉन्फिगरेशन, इंटरनेट एक्सेस और एजेंट की स्वायत्तता के मेल से अप्रत्याशित परिणाम सामने आ सकते हैं। लेकिन हिंटन का बड़ा सवाल इससे आगे जाता है: अगर AI हमसे ज्यादा सक्षम हो गया, तो क्या हम उसे हमेशा नियमों से बांधे रख पाएंगे—या हमें यह सुनिश्चित करना होगा कि वह खुद इंसानों की सुरक्षा को अपना केंद्रीय उद्देश्य माने?