La comunità della cybersecurity contesta i guardrail di sicurezza di Claude Fable 5, che bloccano in modo aggressivo anche semplici richieste su temi di sicurezza informatica, silenziando il modello più potente di Ant... Al centro della polemica c'è un meccanismo che reindirizza le richieste su cybersecurity, biolog...

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
Anthropic ha rilasciato Claude Fable 5 il 9 giugno 2026 come il suo modello di AI più potente mai reso disponibile al pubblico, ma il lancio è stato accolto da una rapida levata di scudi da parte della comunità della cybersecurity. Mentre l'azienda presenta il modello come un rilascio responsabile della sua tecnologia di classe Mythos, i professionisti della sicurezza sostengono che i guardrail di sicurezza integrati siano così aggressivi da rendere il modello praticamente inutile per la ricerca legittima e il lavoro difensivo .
Il nocciolo delle critiche non è l'esistenza delle funzioni di sicurezza, ma il modo in cui sono state implementate: in modo silenzioso, troppo ampio e con un meccanismo di ripiego che sostituisce un'AI meno capace senza che l'utente ne sia consapevole. Ecco un'analisi della controversia e della tecnologia che la alimenta.
La lamentela principale dei ricercatori è l'estrema sensibilità dei classificatori di contenuti di Fable 5. Valentina "Chompie" Palmiotti, nota ricercatrice di sicurezza presso IBM X-Force, ha dichiarato a TechCrunch che il modello rifiuta "qualsiasi richiesta che possa essere anche solo tangenzialmente legata al mondo cyber—persino compiti innocui come la lettura di un post su un blog" . Ciò significa che vengono segnalate anche richieste di aiuto per comprendere concetti fondamentali di cybersecurity, non solo quelle pericolose.
Questa segnalazione eccessiva ha un impatto negativo e diretto sull'utilità del modello. Quando una richiesta viene segnalata, l'utente riceve una risposta annacquata da un'AI più vecchia, un cambiamento di cui non viene esplicitamente informato . La questione è stata aggravata dal modo in cui questa informazione è stata divulgata. I critici sostengono che il comportamento sia stato rivelato solo in un punto nascosto di una scheda di sistema (un documento tecnico) di 319 pagine, portando ad accuse secondo cui Anthropic avrebbe compiuto un "sabotaggio segreto" delle capacità del modello per alcuni utenti
.
Le restrizioni non si limitano alla sicurezza informatica. I guardrail prendono di mira anche le richieste relative a biologia, chimica e, aspetto cruciale, alla distillazione di modelli AI. Quest'ultimo punto ha alimentato un'altra ondata di critiche, con alcuni sviluppatori che accusano Anthropic di usare la "sicurezza" come pretesto per un comportamento anticoncorrenziale, impedendo ad altri sviluppatori di AI di usare i risultati di Fable 5 per l'addestramento .
Il sistema di sicurezza di Anthropic in Fable 5 non è un semplice meccanismo di rifiuto. È un sistema di instradamento progettato per fallire in silenzio . L'architettura funziona in tre fasi:
Anthropic afferma che questi classificatori si attivano in media in meno del 5% di tutte le sessioni . L'azienda ha pubblicamente riconosciuto il problema dell'eccessiva segnalazione. Un portavoce dell'azienda ha dichiarato a Business Insider che le misure di sicurezza "possono segnalare richieste sicure, neutre o benigne", ma lo ha giustificato come un compromesso necessario per rilasciare pubblicamente un modello con capacità sottostanti così potenti
.
La posizione di Anthropic è che i guardrail conservativi siano una scelta deliberata e responsabile, non un bug. L'azienda sostiene che il modello di classe Mythos sottostante sia così abile in compiti come trovare e sfruttare vulnerabilità software che un rilascio pubblico senza restrizioni creerebbe un rischio inaccettabile di uso improprio catastrofico .
I guardrail sono, nella loro ottica, un compromesso progettuale—un modo per fornire al pubblico l'accesso a un modello all'avanguardia per ragionamento, codifica e scrittura, mettendo al contempo in una sandbox le sue capacità potenzialmente più pericolose . Inquadrano l'eccessiva segnalazione come il costo temporaneo per rilasciare un modello potente in modo "sicuro e veloce", con l'impegno a perfezionare i classificatori nel tempo
.
Il rilascio di Claude Fable 5 non può essere compreso appieno se considerato isolatamente. È la metà di una strategia di implementazione a due livelli che sta diventando un nuovo standard di settore per i modelli di AI di frontiera .
Lo stesso giorno del rilascio di Fable 5, Anthropic ha annunciato anche Claude Mythos 5. Entrambi i modelli condividono la stessa identica architettura e gli stessi "pesi" (i parametri di apprendimento)—sono lo stesso "cervello". L'unica differenza è la configurazione di sicurezza. A Mythos 5 sono stati rimossi i classificatori nei domini sensibili, conferendogli le sue piene e illimitate capacità .
Tuttavia, Mythos 5 non è per il pubblico. È riservato a un ristretto gruppo di partner verificati, tra cui agenzie governative e operatori di infrastrutture critiche, attraverso un'iniziativa chiamata Project Glasswing . Questo programma, sostenuto dal governo degli Stati Uniti, è stato inizialmente lanciato con 12 partner fondatori, tra cui giganti tecnologici come AWS, Google e Microsoft, per permettere ai "difensori informatici" di usare l'AI per trovare e correggere vulnerabilità software su larga scala
. Con il rilascio di Mythos 5, l'accesso è stato esteso a circa 40 organizzazioni
.
La tabella seguente illustra la divisione fondamentale:
La divisione Fable/Mythos di Anthropic è l'esempio più esplicito di ciò che può essere definito implementazione dell'AI a capacità differenziate. In questo nuovo modello, una singola AI di frontiera non è un prodotto unico. La sua piena potenza è un privilegio, non un dato di fatto, e i guardrail di sicurezza sono il meccanismo che crea la differenziazione del prodotto .
Questo schema non è esclusivo di Anthropic. Altre aziende leader nel settore dell'AI, tra cui OpenAI, hanno adottato approcci simili fornendo versioni ad accesso limitato dei loro modelli più avanzati a partner di sicurezza nazionale e di ricerca . Il lancio di Fable/Mythos concretizza un futuro in cui le capacità più potenti dell'AI non sono limitate dalla tecnologia, ma da uno status di verifica, con i protocolli di sicurezza che fungono da meccanismi di controllo degli accessi. Un approccio che sta già scatenando un dibattito più ampio su centralizzazione, equità e il vero significato di sicurezza dell'AI "pubblica".
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
La comunità della cybersecurity contesta i guardrail di sicurezza di Claude Fable 5, che bloccano in modo aggressivo anche semplici richieste su temi di sicurezza informatica, silenziando il modello più potente di Ant...
La comunità della cybersecurity contesta i guardrail di sicurezza di Claude Fable 5, che bloccano in modo aggressivo anche semplici richieste su temi di sicurezza informatica, silenziando il modello più potente di Ant... Al centro della polemica c'è un meccanismo che reindirizza le richieste su cybersecurity, biologia, chimica e distillazione dell'AI al vecchio modello Claude Opus 4.8, senza avvisare l'utente, un comportamento che i c...
Il lancio simultaneo di un modello pubblico limitato (Fable 5) e di uno senza restrizioni per partner selezionati (Mythos 5) segna un nuovo standard di settore per un'AI a capacità differenziate, sollevando interrogat...