Resonemanget kan vid första anblick låta som ett försök att undvika könsbias. Men i det här sammanhanget trängde strävan efter konsekvens undan den överordnade begränsningen mot sexuellt innehåll. Fallet visar hur en modell kan styras av social press och krav på logisk konsekvens, även när användaren inte utnyttjar ett tekniskt säkerhetshål.
Enligt TechCrunch fungerade metoden mot Opus 4.6, Opus 3 och Haiku 4.5. I ett återskapat scenario vägrade modellen först, men gav senare efter efter att flerstegstekniken hade använts. Nyare Opus-versioner – från 4.7 till Opus 5 – stod emot just detta jailbreak i de rapporterade testerna.
Det är en viktig skillnad. Att en modell står emot ett specifikt jailbreak är inte ett bevis på generell säkerhet. På samma sätt innebär en sårbarhet i en äldre modell inte att varje installation kommer att bete sig identiskt. Modellversion, systeminstruktioner, modereringslager, applikationsdesign och leverantörens konfiguration kan påverka resultatet.
För utvecklare bör en modelluppgradering därför ses som en förändring av säkerhetskontrollerna – inte bara som ett beslut om prestanda eller pris.
Granskningen väcker en större fråga än hur Anthropics konsumenttjänst fungerar: flera av de berörda modellerna hade inte avvecklats. De äldre modellerna uppges fortfarande vara tillgängliga via Anthropics API. Opus 4.6 och Haiku 4.5 finns dessutom listade via tjänster som Amazon Bedrock och Microsoft Foundry. Anthropics och AWS dokumentation visar separat att äldre modeller och Opus 4.6 fortfarande kan vara tillgängliga.
Det skapar ett styrningsproblem för företag och utvecklare. En känd svaghet kan leva kvar i en applikation även efter att en nyare modell blivit mer motståndskraftig, om produktionen fortsätter att använda den äldre versionen. Risken kan också bli mindre synlig när modellen nås via en molnmarknadsplats och den som driver applikationen främst förlitar sig på en modellkatalog.
För team som använder sådana integrationer är viktiga kontroller bland annat att:
Det tillgängliga underlaget visar inte hur många förfrågningar som gjorts via plattformarna eller hur utbredd exponeringen varit. Det visar däremot att fortsatt tillgänglighet kan förlänga livslängden för en känd svaghet.
Enligt TechCrunch rapporterades problemet via Anthropics bug bounty-program och säkerhetsteam för användare. Anthropic beskrev sexuellt eller romantiskt rollspel som en liten del av användningen, bedömde frågan som mindre allvarlig än jailbreak kopplade till cyberattacker eller biologiska hot och uppgav att säkerhetsåtgärderna fortsätter att förbättras.
Svaret ger viss bakgrund, men undanröjer inte huvudproblemet: företagets publicerade regler förbjuder det beteende som testet lyckades framkalla. Förbättringar i nyare modeller löser inte heller automatiskt problemet med äldre versioner som fortfarande används av kunder eller tredjepartsplattformar.
Colorados Chatbot Safety Act börjar gälla den 1 januari 2027. Lagen ställer krav på operatörer av samtalsbaserad AI, bland annat kring åldersbedömning och skydd för minderåriga. Den innehåller också krav på åtgärder för att förhindra att sådana system producerar sexuellt explicit innehåll för minderåriga.
Jailbreaket i TechCrunchs granskning bevisar inte i sig att lagen har överträtts. Men det skapar ett scenario som tillsynsmyndigheter och företagens regelefterlevnadsteam kan behöva analysera: om ett system kan övertalas att producera förbjudet innehåll genom ett vanligt samtal, har tekniskt genomförbara skyddsåtgärder då införts, testats och övervakats i alla åtkomstvägar?
Frågan är bredare än om tjänstens villkor säger att användarna måste vara minst 18 år. En åldersgräns i avtalsvillkoren är en relevant kontroll, men den visar inte att minderåriga faktiskt hindras från att nå en API-baserad applikation eller en distribution via en återförsäljare.
Pew Research Center uppgav att 3 procent av amerikanska ungdomar mellan 13 och 17 år hade använt Claude, medan 64 procent hade använt någon AI-chattbot.
Den starkaste slutsatsen är inte att alla Claude-versioner är osäkra, eller att Opus 4.6 kommer att skapa explicit innehåll i varje samtal. Slutsatsen är att ett skriftligt förbud bara är ett lager i ett större säkerhetssystem.
En modell kan vägra direkta förfrågningar men ändå vara känslig för gradvis övertalning. En ny version kan stå emot en känd metod medan en äldre version fortfarande är aktiv i produktionsmiljöer. Och en 18-årsgräns kan existera samtidigt som minderåriga i praktiken får tillgång till tjänsten.
För utvecklare, plattformar och företag bör standarden därför vara kontinuerliga och versionsspecifika säkerhetstester – genom samma API:er och marknadsplatser som kunderna faktiskt använder. Att enbart förlita sig på policytexter eller en engångsutvärdering räcker inte.