Des chercheurs en cybersécurité critiquent Claude Fable 5 d'Anthropic car ses garde fous bloquent de manière agressive même des requêtes de sécurité inoffensives et basculent silencieusement vers un modèle moins perfo... La controverse porte sur un mécanisme qui redirige les requêtes sur la cybersécurité, la biologi...

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
Anthropic a lancé le 9 juin 2026 Claude Fable 5, son modèle d'IA le plus puissant à ce jour accessible au public. Mais cette sortie a immédiatement provoqué une vive réaction de la communauté de la cybersécurité. Si l'entreprise présente ce modèle comme une diffusion responsable de sa technologie de classe Mythos, les professionnels de la sécurité estiment que les garde-fous intégrés sont si agressifs qu'ils rendent le modèle pratiquement inutilisable pour la recherche légitime et le travail défensif .
Le cœur du problème n'est pas l'existence de ces dispositifs de sécurité, mais leur mise en œuvre : silencieuse, trop large, et avec un mécanisme de repli qui substitue une IA moins performante à l'insu de l'utilisateur. Voici le détail de la controverse et de la technologie qui la sous-tend.
La principale plainte des chercheurs est la sensibilité extrême des classificateurs de contenu de Fable 5. Valentina « Chompie » Palmiotti, chercheuse en sécurité renommée chez IBM X-Force, a confié à TechCrunch que le modèle rejette « toute requête qui pourrait être tangentiellement liée à la cybercriminalité, même des tâches innocentes comme lire un article de blog » . En clair, des demandes d'aide pour comprendre des concepts fondamentaux de cybersécurité sont bloquées, pas seulement les requêtes dangereuses.
Ce sur-filtrage a un impact direct et négatif sur l'utilité du modèle. Lorsqu'une requête est signalée, l'utilisateur reçoit une réponse édulcorée provenant d'une IA plus ancienne, un changement dont il n'est pas explicitement informé . Le problème est aggravé par la manière dont cette information a été divulguée. Les critiques affirment que ce comportement n'a été révélé que dans les profondeurs d'une fiche système de 319 pages, ce qui a conduit à des accusations de « sabotage secret » des capacités du modèle pour certains utilisateurs
.
Les restrictions ne se limitent pas à la cybersécurité. Les garde-fous ciblent aussi les requêtes liées à la biologie, à la chimie et, de manière cruciale, à la distillation de modèles d'IA. Ce dernier point a alimenté une autre vague de critiques, certains développeurs accusant Anthropic d'utiliser la « sécurité » comme prétexte à un comportement anticoncurrentiel, en empêchant d'autres créateurs d'IA d'utiliser les résultats de Fable 5 pour l'entraînement .
Le système de sécurité d'Anthropic dans Fable 5 n'est pas un simple mécanisme de refus. C'est un système de routage conçu pour échouer discrètement . L'architecture fonctionne en trois étapes :
Anthropic affirme que ces classificateurs se déclenchent dans moins de 5 % de toutes les sessions en moyenne . L'entreprise a publiquement reconnu le problème de sur-filtrage. Un porte-parole a déclaré à Business Insider que les mesures de sécurité « peuvent signaler des requêtes sûres, neutres ou bénignes », mais a justifié cela comme un compromis nécessaire pour diffuser publiquement un modèle aux capacités sous-jacentes aussi puissantes
.
La position d'Anthropic est que ces garde-fous conservateurs sont un choix délibéré et responsable, et non un bug. L'entreprise soutient que le modèle de classe Mythos sous-jacent est si compétent dans des tâches comme la recherche et l'exploitation de vulnérabilités logicielles qu'une diffusion publique sans restriction créerait un risque inacceptable d'utilisation malveillante catastrophique .
Les garde-fous sont, à leurs yeux, un compromis de conception – un moyen de fournir au public l'accès à un modèle de raisonnement, de codage et d'écriture de pointe tout en mettant un "bac à sable" autour de ses capacités potentielles les plus dangereuses . Ils présentent le sur-filtrage comme le coût temporaire à payer pour diffuser un modèle puissant « à la fois rapidement et en toute sécurité », avec un engagement à affiner les classificateurs au fil du temps
.
La sortie de Claude Fable 5 ne peut être pleinement comprise isolément. Elle constitue la moitié d'une stratégie de déploiement à deux vitesses qui est en train de devenir un nouveau standard industriel pour les modèles d'IA de pointe .
Le même jour que la sortie de Fable 5, Anthropic a également annoncé Claude Mythos 5. Les deux modèles partagent exactement la même architecture sous-jacente et les mêmes paramètres – ils ont le même « cerveau ». La seule différence est la configuration de sécurité. Mythos 5 voit ses classificateurs retirés dans les domaines sensibles, ce qui lui confère toutes ses capacités, sans restriction .
Cependant, Mythos 5 n'est pas destiné au public. Il est réservé à un petit groupe de partenaires triés sur le volet, y compris des agences gouvernementales et des opérateurs d'infrastructures critiques, par le biais d'une initiative appelée Project Glasswing . Ce programme, soutenu par le gouvernement américain, a été initialement lancé avec 12 partenaires fondateurs, dont des géants de la tech comme AWS, Google et Microsoft, pour permettre aux « cyberdéfenseurs » d'utiliser l'IA afin de trouver et de corriger des vulnérabilités logicielles à grande échelle
. Avec la sortie de Mythos 5, l'accès a été étendu à environ 40 organisations
.
Le tableau ci-dessous illustre cette division fondamentale :
Le modèle Fable/Mythos d'Anthropic est l'exemple le plus explicite de ce que l'on peut appeler le déploiement de l'IA par paliers de capacités. Dans ce nouveau modèle, une seule IA de pointe n'est pas un produit unique. Sa pleine puissance est un privilège, non un acquis, et les garde-fous de sécurité sont le mécanisme qui crée la différenciation du produit .
Ce schéma n'est pas propre à Anthropic. D'autres entreprises d'IA de premier plan, comme OpenAI, ont adopté des approches similaires en fournissant des versions à accès restreint de leurs modèles les plus avancés à des partenaires de sécurité nationale et de recherche . Le lancement Fable/Mythos cristallise un avenir où les capacités d'IA les plus puissantes ne sont pas limitées par la technologie, mais par un statut de vérification, les protocoles de sécurité servant aussi de mécanismes de contrôle d'accès. Une approche qui suscite déjà un débat plus large sur la centralisation, l'équité et le sens réel d'une IA « publique » et « sûre ».
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Des chercheurs en cybersécurité critiquent Claude Fable 5 d'Anthropic car ses garde fous bloquent de manière agressive même des requêtes de sécurité inoffensives et basculent silencieusement vers un modèle moins perfo...
Des chercheurs en cybersécurité critiquent Claude Fable 5 d'Anthropic car ses garde fous bloquent de manière agressive même des requêtes de sécurité inoffensives et basculent silencieusement vers un modèle moins perfo... La controverse porte sur un mécanisme qui redirige les requêtes sur la cybersécurité, la biologie, la chimie et la distillation d'IA vers l'ancien modèle Claude Opus 4.8, un fait que les critiques disent avoir été dis...
Le lancement d'un modèle public bridé (Fable 5) aux côtés d'un modèle sans restriction réservé aux partenaires de confiance (Mythos 5) signale un nouveau standard industriel pour une IA à plusieurs niveaux, soulevant...