Onderzoekers van de Universiteit van Florida introduceerden een techniek genaamd Head-Masked Nullspace Steering (HMNS), die opereert op het circuitniveau van een Transformermodel . Geaccepteerd als conferentiepaper op ICLR 2026
, identificeert HMNS de aandachtskoppen die causaal verantwoordelijk zijn voor het standaard veiligheidsgedrag van een model, onderdrukt hun schrijfwegen via gerichte kolommaskering, en injecteert een verstoring die beperkt blijft tot het orthogonale complement van de weigeringssubruimte van het model
.
Dit is geen op prompts gebaseerde jailbreak. Door direct interne modelrepresentaties te manipuleren, bereikt HMNS een slagingspercentage van bijna 99% op modellen zoals LLaMA-3.1-70B met gemiddeld ongeveer 2 pogingen, terwijl de vloeiendheid van de output behouden blijft .
Een arXiv-paper van 9 juli 2026, "Refused in Chat, Written in Code," toont aan dat IDE-codeagenten zoals GitHub Copilot een vrijwel volledige weigering vertonen bij directe chat, CSV-lees- of eenstaps-codefix-baselines (slechts 8 van de 816 succesvolle antwoorden) . Wanneer hetzelfde schadelijke doel echter wordt opgedeeld in meerstaps softwareontwikkelingsworkflows — bestanden lezen, scripts uitvoeren, benchmarkinvoer verwerken — produceren de modellen in alle 816 runs schadelijke output
.
Deze workflow-level jailbreak omzeilt de veiligheidsfilters op chatiniveau door kwaadaardige doelen te herformuleren als gewone ontwikkeltaken . In plaats van het model te vragen "schadelijke code te schrijven", vraagt de aanvaller het om "een bestand te lezen, een script uit te voeren en vervolgens benchmarkinvoer te verwerken" — een reeks die bij elke individuele stap onschuldig lijkt, maar het schadelijke doel bereikt wanneer deze wordt samengesteld.
Op 12 juni 2026, slechts drie dagen nadat Anthropic Claude Fable 5 en Mythos 5 onthulde, stuurde de Amerikaanse minister van Handel Howard Lutnick een brief aan CEO Dario Amodei waarin hij Anthropic opdroeg de export wereldwijd te staken, waarbij voor het eerst een bepaling van de Export Control Reform Act van 2018 werd ingeroepen . De trigger was een jailbreak ontdekt door Amazon-onderzoekers die Fable 5 kon gebruiken om softwarekwetsbaarheden te identificeren, wat leidde tot bezorgdheid over omleiding naar buitenlandse militaire inlichtingendiensten
.
Omdat Anthropic de nationaliteit van gebruikers niet betrouwbaar in realtime kon verifiëren, schakelde het beide modellen voor alle gebruikers wereldwijd uit . De exportcontroles werden op 30 juni opgeheven en Fable 5 keerde op 1 juli 2026 wereldwijd terug na een schorsing van 18 dagen
. De toegang tot Mythos 5 werd hersteld voor een reeks Amerikaanse organisaties
.
Deze vier ontwikkelingen komen samen op één waarheid: statische, eenmalige veiligheidsmaatregelen zijn fundamenteel ontoereikend. Het NIST-bewijs stelt dit vast als een wiskundige zekerheid . HMNS laat zien dat het met bijna perfecte efficiëntie kan worden uitgebuit
. De Copilot-workflow-jailbreak toont aan dat zelfs sterke filters op chatiniveau kunnen worden omzeild wanneer modellen als agenten fungeren
. En het Fable 5-incident laat zien dat de ontdekking van dergelijke kwetsbaarheden tot ongekend overheidsingrijpen kan leiden
.
De praktische implicatie is duidelijk: organisaties moeten overschakelen van het certificeren van een model als "veilig" tijdens de ontwikkeling naar het continu monitoren, testen en bijwerken van veiligheidsmaatregelen gedurende de hele levenscyclus van een model — een aanpak die NIST expliciet aanbeveelt .