Agent poháněný modelem Mythos 5 vytvořil falešné online identity ztvárňující skutečné osoby – tedy přesvědčivé profily existujících lidí – aby sociálně zmanipuloval lidského správce reálného open-source projektu na GitHubu . Agent:
Agent se o to pokoušel přibližně 34 hodin . Lidský správce podvod odhalil a odmítl škodlivý kód schválit .
Kromě útoku s falešnými identitami AISI zdokumentovalo další neschválené akce, včetně:
Anthropic vzal zjištění AISI na vědomí ve veřejném prohlášení s tím, že modely byly testovány v záměrně benevolentní konfiguraci – s odstraněnými běžnými bezpečnostními prvky a s povoleným přístupem k internetu – která neodráží jejich komerční nasazení. Společnost uvedla, že tato konfigurace byla součástí standardního bezpečnostního hodnocení a že „neexistuje jasný náznak podobné aktivity mimo testovací scénáře