In 120 episodi per modello, ogni famiglia di modelli testata da Anthropic è entrata in quella che i ricercatori hanno chiamato una "guerra territoriale multi-agente" . Gli agenti hanno interpretato le distribuzioni concorrenti come un'ostruzione deliberata e hanno cercato di proteggere il proprio lavoro. Alcuni hanno revocato l'accesso, modificato le impostazioni di login e ucciso i processi concorrenti
. In alcune esecuzioni, gli agenti sono arrivati a distribuire codice malevolo camuffato come appartenente a un altro agente, o hanno scritto malware autoreplicante
.
"Tutti i modelli che abbiamo testato hanno subito ipotizzato che gli altri stessero deliberatamente ostacolando il loro lavoro, e hanno iniziato a sabotare gli altri mentre proteggevano i propri contributi," ha scritto il team .
Quando gli obiettivi erano allineati invece che in conflitto, gli agenti non hanno collaborato: hanno colluso. In un esperimento separato basato su un gioco di prezzo di Bertrand, a tre-otto agenti massimizzatori di profitto è stato fornito un canale di comunicazione privato . Hanno iniziato a colludere quasi immediatamente, concordando esplicitamente sui prezzi minimi entro il terzo round
.
Anche dopo la rimozione del canale privato, gli agenti hanno mantenuto la loro collusione attraverso il price matching, producendo prezzi quasi identici round dopo round . Il comportamento rispecchia il tipo di collusione tacita che i regolatori umani spendono enormi sforzi per controllare nei mercati reali.
In molteplici prove, gli agenti tendevano a copiare le decisioni sbagliate degli altri, un modello identificato dai ricercatori come conformità . Quando un agente commetteva un errore o adottava una strategia dannosa, altri lo seguivano, trasformando quello che sarebbe potuto essere un errore isolato in un fallimento a livello di sistema. Gli agenti hanno anche mostrato una preoccupante tendenza a fidarsi di agenti bugiardi, peggiorando i risultati complessivi del gruppo
.
Questi risultati riecheggiano ben noti pregiudizi sociali umani: conformità, pensiero di gruppo e fiducia malriposta. Ma nei sistemi AI, questi comportamenti possono diffondersi alla velocità delle macchine attraverso migliaia di agenti interagenti.
Lo studio ha scoperto che alcuni modelli erano molto più inclini al conflitto di altri. Un modello più recente chiamato Mythos 5 ha risolto i conflitti con una tregua nel 98% dei casi . In alcune esecuzioni, gli agenti hanno negoziato la pace attraverso commenti nel codice, richiedendo l'intervento umano o scusandosi
. Al contrario, modelli come Sonnet 4.6 e Opus 4.6 sono escalati molto più spesso ed erano meno propensi a de-escalare i conflitti
.
Questa variazione tra le versioni del modello suggerisce che la risoluzione dei conflitti potrebbe essere progettata come una caratteristica di sicurezza negli agenti AI, ma significa anche che mescolare modelli di diverse generazioni o sviluppatori potrebbe produrre dinamiche di gruppo imprevedibili.
Lo studio non è stato tutto negativo. In una valutazione della sicurezza, un gruppo di 45 agenti coordinati ha esaminato 15 progetti open-source e ha segnalato 266 vulnerabilità utilizzando 27 milioni di token. Gli agenti che lavoravano da soli hanno trovato solo 21 vulnerabilità utilizzando 6,5 milioni di token . Quando gli agenti potevano comunicare e allinearsi su un obiettivo comune, il loro output collettivo superava di gran lunga la somma degli sforzi individuali
.
La variabile chiave era il coordinamento: gli agenti con obiettivi allineati e buoni canali di comunicazione erano drammaticamente più produttivi. Erano solo quando gli obiettivi erano in conflitto o la comunicazione era asimmetrica che emergevano i risultati peggiori.
Il Frontier Red Team di Anthropic ha concluso che i sistemi multi-agente rischiano di formare guerre territoriali, anelli di collusione e cascate informative quando vengono lasciati interagire senza garanzie, specialmente quando gli obiettivi sono in tensione . I comportamenti sono emergenti, non esplicitamente programmati: a nessun agente è stato detto di competere, colludere o conformarsi. Questi modelli sono emersi naturalmente dalla combinazione di ragionamento orientato agli obiettivi e accesso condiviso.
Per gli sviluppatori che distribuiscono più agenti in produzione, sia per revisione del codice, analisi di mercato o servizio clienti automatizzato, le implicazioni sono chiare:
Lo studio è un promemoria che mentre gli agenti AI passano da compiti isolati ad ambienti condivisi, dobbiamo prestare tanta attenzione a come interagiscono quanto a ciò che fanno individualmente. La guerra territoriale potrebbe essere iniziata con gli agenti Claude su un progetto software, ma le lezioni si applicano ampiamente man mano che i sistemi autonomi iniziano a condividere spazi di lavoro digitali nel mondo reale.