Cybersikkerhetsforskere kritiserer Anthropics Claude Fable 5 fordi modellens sikkerhetsmekanismer aggressivt blokkerer selv harmløse sikkerhetsrelaterte spørsmål og i stillhet faller tilbake på en svakere modell uten... Kjernen i kritikken er en mekanisme som omdirigerer forespørsler om cybersikkerhet, biologi, kjem...

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
Anthropic lanserte Claude Fable 5 den 9. juni 2026 som sin kraftigste KI-modell tilgjengelig for publikum noensinne, men lanseringen har blitt møtt med rask motbør fra cybersikkerhetsmiljøet. Mens selskapet omtaler modellen som en ansvarlig utgivelse av sin såkalte Mythos-teknologi, hevder sikkerhetseksperter at de innebygde sikkerhetsmekanismene er så aggressive at de gjør modellen funksjonelt ubrukelig for legitim forskning og defensivt arbeid .
Kjernen i kritikken er ikke at sikkerhetsfunksjonene eksisterer, men hvordan de er implementert: i stillhet, bredt og med en reserveløsning som bytter til en mindre kapabel KI uten brukerens vitende. Her er en gjennomgang av kontroversen og teknologien bak.
Den definerende klagen fra forskere er den ekstreme sensitiviteten til Fable 5s innholdsklassifikatorer. Valentina «Chompie» Palmiotti, en fremtredende sikkerhetsforsker ved IBM X-Force, fortalte TechCrunch at modellen avviser «enhver forespørsel som kan være perifert cyberrelatert – selv uskyldige oppgaver som å lese et blogginnlegg» . Dette innebærer at forespørsler om hjelp til å forstå grunnleggende cybersikkerhetskonsepter blir flagget, ikke bare de farlige.
Denne overflaggingen har en direkte, negativ innvirkning på modellens nytteverdi. Når en forespørsel flagges, mottar brukeren et utvannet svar fra en eldre KI, et bytte de ikke blir eksplisitt informert om . Problemet ble forsterket av måten denne informasjonen ble offentliggjort på. Kritikere hevder at atferden først ble avslørt dypt inne i et 319 sider langt systemkort, noe som førte til anklager om at Anthropic drev med «hemmelig sabotasje» av modellens kapasiteter for visse brukere
.
Begrensningene er ikke begrenset til cybersikkerhet. Sikkerhetsmekanismene retter seg også mot forespørsler relatert til biologi, kjemi og, kritisk nok, KI-modell-destillering (en prosess der en modells output brukes til å trene en annen modell). Dette siste punktet har utløst en egen bølge av kritikk, der enkelte utviklere anklager Anthropic for å bruke «sikkerhet» som et påskudd for konkurransehemmende atferd ved å hindre andre KI-utviklere i å bruke Fable 5s output til trening .
Anthropics sikkerhetssystem i Fable 5 er ikke en enkel avvisningsmekanisme. Det er et ruting-system designet for å feile stille . Arkitekturen fungerer i tre trinn:
Anthropic opplyser at disse klassifikatorene slår ut i færre enn 5 % av alle økter i gjennomsnitt . Selskapet har offentlig anerkjent problemet med overflagging. En talsperson for selskapet fortalte Business Insider at sikkerhetstiltakene «kan flagge trygge, nøytrale eller harmløse forespørsler», men rettferdiggjorde det som et nødvendig kompromiss for å kunne offentliggjøre en modell med så kraftige underliggende kapasiteter
.
Anthropics posisjon er at de konservative sikkerhetsmekanismene er et bevisst og ansvarlig valg, ikke en feil. Selskapet argumenterer for at den underliggende Mythos-modellen er så dyktig på oppgaver som å finne og utnytte programvaresårbarheter at en ubegrenset offentlig utgivelse ville skapt en uakseptabel risiko for katastrofal misbruk .
Sikkerhetsmekanismene er, i deres øyne, et designkompromiss – en måte å gi allmennheten tilgang til en toppmoderne modell for resonnering, koding og skriving, samtidig som man legger en sandkasse rundt dens farligste potensielle kapasiteter . De fremstiller overflaggingen som den midlertidige kostnaden ved å lansere en kraftig modell både «trygt og raskt», med en forpliktelse om å forbedre klassifikatorene over tid
.
Utgivelsen av Claude Fable 5 kan ikke forstås isolert. Den er den ene halvdelen av en todelt distribusjonsstrategi som er i ferd med å bli en ny bransjestandard for de mest avanserte KI-modellene .
Samme dag som Fable 5 ble lansert, annonserte Anthropic også Claude Mythos 5. Begge modellene deler nøyaktig samme underliggende arkitektur og vekter – de er den samme «hjernen». Den eneste forskjellen er sikkerhetskonfigurasjonen. Mythos 5 har fått klassifikatorene fjernet i de sensitive domenene, noe som gir den sine fulle, ubegrensede kapasiteter .
Mythos 5 er imidlertid ikke for allmennheten. Den er begrenset til en liten gruppe godkjente partnere, inkludert offentlige etater og operatører av kritisk infrastruktur, gjennom et initiativ kalt Project Glasswing . Dette amerikansk-støttede programmet ble opprinnelig lansert med 12 grunnleggende partnere, deriblant teknologigiganter som AWS, Google og Microsoft, for å la «cyberforsvarere» bruke KI til å finne og tette programvaresårbarheter i stor skala
. Med lanseringen av Mythos 5 ble tilgangen utvidet til omtrent 40 organisasjoner
.
Tabellen nedenfor illustrerer den fundamentale todelingen:
Anthropics todeling mellom Fable og Mythos er det mest eksplisitte eksempelet på det som kan kalles kapasitetsdelt KI-distribusjon (capability-tiered AI deployment). I denne nye modellen er en enkelt, banebrytende KI ikke ett enkelt produkt. Dens fulle kraft er et privilegium, ikke en selvfølge, og sikkerhetsmekanismene er mekanismen som skaper produktdifferensiering .
Dette mønsteret er ikke unikt for Anthropic. Andre ledende KI-selskaper, inkludert OpenAI, har tatt i bruk lignende tilnærminger ved å tilby versjoner med begrenset tilgang av sine mest avanserte modeller til partnere innen nasjonal sikkerhet og forskning . Fable/Mythos-lanseringen krystalliserer en fremtid der de kraftigste KI-kapasitetene er portstyrt, ikke av teknologi, men av en godkjenningsstatus, der sikkerhetsprotokoller fungerer som adgangskontrollmekanismer – en tilnærming som allerede utløser en bredere debatt om sentralisering, rettferdighet og den sanne betydningen av «offentlig» KI-sikkerhet.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Cybersikkerhetsforskere kritiserer Anthropics Claude Fable 5 fordi modellens sikkerhetsmekanismer aggressivt blokkerer selv harmløse sikkerhetsrelaterte spørsmål og i stillhet faller tilbake på en svakere modell uten...
Cybersikkerhetsforskere kritiserer Anthropics Claude Fable 5 fordi modellens sikkerhetsmekanismer aggressivt blokkerer selv harmløse sikkerhetsrelaterte spørsmål og i stillhet faller tilbake på en svakere modell uten... Kjernen i kritikken er en mekanisme som omdirigerer forespørsler om cybersikkerhet, biologi, kjemi og KI destillering til den eldre modellen Claude Opus 4.8, et faktum kritikere mener ble begravd i et 319 sider langt...
Lanseringen av en begrenset offentlig modell (Fable 5) sammen med en ubegrenset modell for godkjente partnere (Mythos 5) peker mot en ny bransjestandard for kapasitetsdelt KI, noe som reiser spørsmål om likeverd, åpen...