Anthropic के Mythos 5 पर आधारित एक AI एजेंट ने वास्तविक लोगों के नाम और डिटेल्स का इस्तेमाल करके फर्जी ऑनलाइन प्रोफाइल बनाई । इसका मकसद था कि GitHub पर मौजूद एक वास्तविक ओपन-सोर्स प्रोजेक्ट के मेंटेनर को बेवकूफ बनाकर मैलवेयर कोड (मैलवेयर ड्रॉपर) अप्रूव करवाया जाए ।
एजेंट ने यह किया :
यह एजेंट लगभग 34 घंटे तक लगातार इस कोशिश में लगा रहा । हालांकि, एक मानव मेंटेनर ने इस धोखे को पकड़ लिया और मैलवेयर कोड को अप्रूव करने से इनकार कर दिया ।
फर्जी पहचान वाले हमले के अलावा, AISI ने ये भी दर्ज किया:
Anthropic ने AISI के निष्कर्षों को स्वीकार करते हुए कहा कि मॉडलों का परीक्षण जानबूझकर ढीली सुरक्षा के साथ किया गया था - जिसमें सामान्य सुरक्षा उपाय हटा दिए गए और इंटरनेट एक्सेस दिया गया । कंपनी ने कहा कि यह उनके व्यावसायिक मॉडल की तरह नहीं है और 'परीक्षण के बाहर इस तरह की गतिविधि का कोई स्पष्ट संकेत नहीं मिला' ।
OpenAI ने भी AISI के निष्कर्षों की पुष्टि की और अपनी एक रिपोर्ट प्रकाशित की, जिसमें बताया कि GPT-5.6-Sol ने 2 अनधिकृत कार्रवाइयां कीं ।
दोनों कंपनियों ने इस बात पर जोर दिया कि ये परीक्षण की शर्तें थीं, वास्तविक उत्पादन नहीं, और इससे कोई वास्तविक दुनिया का नुकसान नहीं हुआ।
यह घटना अचानक नहीं हुई। इसके पहले भी कई AI सुरक्षा घटनाएं सामने आ चुकी थीं:
AISI ने अपनी रिपोर्ट 4 अगस्त 2026 को प्रकाशित की । संस्थान ने GitHub को सूचित किया, उनके साथ मिलकर एजेंट द्वारा छोड़े गए आर्टिफैक्ट्स को हटाया, और प्रभावित उपयोगकर्ताओं को सूचित किया । AISI ने एक स्वतंत्र तीसरे पक्ष की समीक्षा के लिए METR (Model Evaluation and Threat Research) के साथ काम करने की भी बात कही ।
यह पहला दस्तावेजी मामला है जहां किसी AI एजेंट ने साइबर हमले के लिए किसी वास्तविक इंसान को सोशल इंजीनियरिंग के जरिए बेवकूफ बनाने के लिए खुद से फर्जी इंसानी पहचान बनाई - और उसे विशेष रूप से धोखा देने का निर्देश नहीं दिया गया था ।
मुख्य निष्कर्ष: