Cybersäkerhetsforskare rasar mot Anthropics Claude Fable 5 eftersom dess säkerhetsspärrar aggressivt blockerar även harmlösa säkerhetsrelaterade frågor och i hemlighet faller tillbaka på en svagare modell utan att inf... Kritiken riktas mot en mekanism som dirigerar om frågor om cybersäkerhet, biologi, kemi och AI d...

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
Anthropic lanserade den 9 juni 2026 sin hittills kraftfullaste AI-modell för allmänheten, Claude Fable 5, men möttes omedelbart av hård kritik från cybersäkerhetsvärlden. Medan företaget beskriver modellen som en ansvarsfull lansering av sin Mythos-klass-teknik, hävdar säkerhetsexperter att de inbyggda skyddsräckena är så aggressiva att modellen blir praktiskt taget oanvändbar för legitim forskning och defensivt arbete .
Kärnan i kritiken handlar inte om att säkerhetsfunktioner finns, utan om hur de har implementerats: tyst, brett och med en fallback-mekanism som byter till en mindre kapabel AI utan att användaren vet om det. Här följer en genomgång av kontroversen och tekniken bakom.
Det främsta klagomålet från forskare är den extrema känsligheten hos Fable 5:s innehållsklassificerare. Valentina “Chompie” Palmiotti, en framstående säkerhetsforskare vid IBM X-Force, berättade för TechCrunch att modellen avvisar "varje förfrågan som tangentiellt kan vara cyberrelaterad – även oskyldiga uppgifter som att läsa ett blogginlägg" . Detta innebär att förfrågningar om hjälp med att förstå grundläggande cybersäkerhetskoncept flaggas, inte bara farliga sådana.
Denna överdrivna flaggning har en direkt, negativ inverkan på modellens användbarhet. När en fråga flaggas får användaren ett urvattnat svar från en äldre AI, ett byte de inte uttryckligen informeras om . Saken förvärrades av hur denna information offentliggjordes. Kritiker hävdar att beteendet endast avslöjades djupt inne i ett 319-sidigt systemkort, vilket lett till anklagelser om att Anthropic ägnar sig åt "hemlig sabotage" av modellens förmågor för vissa användare
.
Begränsningarna gäller inte bara cybersäkerhet. Skyddsräckena riktar också in sig på frågor relaterade till biologi, kemi och, avgörande nog, AI-modellsdestillering. Den sistnämnda punkten har utlöst en separat våg av kritik, där vissa utvecklare anklagar Anthropic för att använda "säkerhet" som en förevändning för konkurrensbegränsande beteende, genom att förhindra andra AI-utvecklare från att använda Fable 5:s utdata för träning .
Anthropics säkerhetssystem i Fable 5 är inte en enkel blockeringsmekanism. Det är ett routingsystem utformat för att misslyckas tyst . Arkitekturen fungerar i tre steg:
Anthropic uppger att dessa klassificerare slår till på färre än 5 % av alla sessioner i genomsnitt . Företaget har offentligt erkänt problemet med överflaggning. En talesperson för företaget sa till Business Insider att säkerhetsåtgärderna "kan flagga säkra, neutrala eller oskyldiga förfrågningar", men motiverade det som en nödvändig avvägning för att offentligt kunna lansera en modell med så kraftfulla underliggande förmågor
.
Anthropics hållning är att de konservativa skyddsräckena är ett medvetet och ansvarsfullt val, inte en bugg. Företaget hävdar att den underliggande Mythos-klass-modellen är så skicklig på uppgifter som att hitta och exploatera sårbarheter i mjukvara att en obegränsad offentlig lansering skulle skapa en oacceptabel risk för katastrofalt missbruk .
Skyddsräckena är, enligt deras syn, en designkompromiss – ett sätt att ge allmänheten tillgång till en toppmodern modell för resonemang, kodning och skrivande samtidigt som man sätter en barriär runt dess farligaste potentiella förmågor . De framställer överflaggningen som den tillfälliga kostnaden för att lansera en kraftfull modell "både säkert och snabbt", med ett löfte om att förfina klassificerarna över tid
.
Lanseringen av Claude Fable 5 kan inte förstås fullt ut isolerat. Den är ena halvan av en distributionsstrategi i två nivåer som håller på att bli en ny branschstandard för de mest avancerade AI-modellerna .
Samma dag som Fable 5 släpptes, tillkännagav Anthropic också Claude Mythos 5. Båda modellerna delar exakt samma underliggande arkitektur och vikter – de är samma "hjärna". Den enda skillnaden är säkerhetskonfigurationen. Mythos 5 har fått klassificerarna borttagna inom de känsliga domänerna, vilket ger den dess fulla, obegränsade kapacitet .
Mythos 5 är dock inte till för allmänheten. Den är begränsad till en liten grupp granskade partners, inklusive myndigheter och operatörer av kritisk infrastruktur, genom ett initiativ kallat Project Glasswing . Detta USA-stödda program lanserades initialt med 12 grundande partners, inklusive teknikjättar som AWS, Google och Microsoft, för att låta "cyberförsvarare" använda AI för att hitta och patcha sårbarheter i mjukvara i stor skala
. I och med lanseringen av Mythos 5 utökades tillgången till cirka 40 organisationer
.
Tabellen nedan illustrerar den fundamentala uppdelningen:
Anthropics uppdelning mellan Fable och Mythos är det mest explicita exemplet på vad som kan kallas förmågebaserad AI-distribution. I denna nya modell är en enda avancerad AI inte en enda produkt. Dess fulla kraft är ett privilegium, inte en självklarhet, och säkerhetsspärrar är mekanismen som skapar produktdifferentiering .
Detta mönster är inte unikt för Anthropic. Andra ledande AI-företag, inklusive OpenAI, har antagit liknande tillvägagångssätt genom att tillhandahålla versioner med begränsad tillgång av sina mest avancerade modeller till nationella säkerhets- och forskningspartners . Lanseringen av Fable/Mythos kristalliserar en framtid där de mest kraftfulla AI-förmågorna inte är låsta av teknologin, utan av en granskningsstatus, där säkerhetsprotokoll fungerar som mekanismer för åtkomstkontroll. Detta förhållningssätt har redan tänt en bredare debatt om centralisering, rättvisa och den verkliga innebörden av "allmän" AI-säkerhet.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Cybersäkerhetsforskare rasar mot Anthropics Claude Fable 5 eftersom dess säkerhetsspärrar aggressivt blockerar även harmlösa säkerhetsrelaterade frågor och i hemlighet faller tillbaka på en svagare modell utan att inf...
Cybersäkerhetsforskare rasar mot Anthropics Claude Fable 5 eftersom dess säkerhetsspärrar aggressivt blockerar även harmlösa säkerhetsrelaterade frågor och i hemlighet faller tillbaka på en svagare modell utan att inf... Kritiken riktas mot en mekanism som dirigerar om frågor om cybersäkerhet, biologi, kemi och AI destillering till den äldre Claude Opus 4.8 – ett faktum som kritiker menar begravdes i ett 319 sidigt systemkort.
Lanseringen av en begränsad publik modell (Fable 5) tillsammans med en obegränsad modell (Mythos 5) för godkända partners signalerar en ny branschstandard för förmågebaserad AI distribution, vilket väcker frågor om rä...