Badacze cyberbezpieczeństwa krytykują Claude Fable 5 od Anthropic, bo jego zabezpieczenia agresywnie blokują nawet niewinne zapytania związane z bezpieczeństwem i po cichu przełączają się na słabszy model, nie informu... Kontrowersje dotyczą mechanizmu przekierowującego zapytania o cyberbezpieczeństwo, biologię, che...

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
Premiera najnowszego modelu AI od Anthropic, Claude Fable 5, która miała miejsce 9 czerwca 2026 roku, zamiast euforii wywołała falę ostrej krytyki ze strony społeczności ekspertów ds. cyberbezpieczeństwa. Choć firma przedstawia model jako odpowiedzialne, publiczne wydanie swojej najpotężniejszej technologii klasy Mythos, specjaliści twierdzą, że wbudowane zabezpieczenia są tak restrykcyjne, iż czynią go bezużytecznym do legalnych badań i prac obronnych .
Istotą problemu nie jest samo istnienie funkcji bezpieczeństwa, ale sposób ich implementacji: działają po cichu, mają szeroki zakres i wykorzystują mechanizm awaryjny, który podmienia AI na słabszą bez wiedzy użytkownika. Oto szczegóły kontrowersji i technologii, która za nią stoi.
Głównym zarzutem badaczy jest ekstremalna czułość klasyfikatorów treści w Fable 5. Valentina „Chompie” Palmiotti, ceniona badaczka bezpieczeństwa z IBM X-Force, powiedziała w wywiadzie dla TechCrunch, że model odrzuca „każde zapytanie, które może być choćby luźno związane z cyberbezpieczeństwem – nawet tak niewinne zadania, jak przeczytanie wpisu na blogu” . Oznacza to, że blokowane są nie tylko niebezpieczne zapytania, ale też prośby o pomoc w zrozumieniu podstawowych koncepcji cyberbezpieczeństwa.
Nadgorliwe flagowanie ma bezpośredni, negatywny wpływ na użyteczność modelu. Gdy zapytanie zostanie oznaczone, użytkownik otrzymuje „rozwodnioną” odpowiedź od starszej AI, o której zmianie nie jest wyraźnie informowany . Sprawę pogarsza sposób, w jaki informacja ta została ujawniona. Krytycy argumentują, że mechanizm ten opisano głęboko w liczącej 319 stron karcie systemowej, co doprowadziło do oskarżeń o „potajemny sabotaż” możliwości modelu przez Anthropic
.
Ograniczenia nie dotyczą tylko cyberbezpieczeństwa. Zabezpieczenia celują również w zapytania związane z biologią, chemią i, co kluczowe, destylacją modeli AI. Ten ostatni punkt wywołał kolejną falę krytyki – niektórzy deweloperzy oskarżają Anthropic o wykorzystywanie pretekstu „bezpieczeństwa” do działań antykonkurencyjnych, uniemożliwiając innym twórcom AI wykorzystywanie wyników Fable 5 do trenowania własnych modeli .
System bezpieczeństwa w Fable 5 to nie prosty mechanizm odmowy. To system routingu zaprojektowany tak, by „zawodził po cichu” . Jego architektura działa w trzech krokach:
Anthropic twierdzi, że te klasyfikatory uruchamiają się średnio w mniej niż 5% wszystkich sesji . Firma publicznie przyznała, że występuje problem nadmiernego flagowania. Rzecznik firmy powiedział Business Insider, że zabezpieczenia „mogą wychwytywać bezpieczne, neutralne lub nieszkodliwe zapytania”, ale uzasadnił to jako konieczny kompromis, aby móc publicznie udostępnić model o tak potężnych możliwościach
.
Stanowisko Anthropic jest takie, że konserwatywne zabezpieczenia to celowy i odpowiedzialny wybór, a nie błąd. Firma argumentuje, że bazowy model klasy Mythos jest tak biegły w zadaniach takich jak znajdowanie i wykorzystywanie luk w oprogramowaniu, że nieograniczone publiczne udostępnienie stwarzałoby niedopuszczalne ryzyko katastrofalnego użycia .
Z ich punktu widzenia, zabezpieczenia są kompromisem projektowym – sposobem na zapewnienie społeczeństwu dostępu do najnowocześniejszego modelu zdolnego do rozumowania, kodowania i pisania, przy jednoczesnym odizolowaniu jego najniebezpieczniejszych potencjalnych możliwości . Przedstawiają nadmierne flagowanie jako tymczasowy koszt szybkiego i bezpiecznego udostępnienia potężnego modelu, zobowiązując się do stopniowego udoskonalania klasyfikatorów
.
Premiera Claude Fable 5 nie może być rozpatrywana w oderwaniu od kontekstu. Jest to jedna strona medalu w dwupoziomowej strategii wdrażania, która staje się nowym standardem w branży dla przełomowych modeli AI .
Tego samego dnia co Fable 5, Anthropic ogłosiło również Claude Mythos 5. Oba modele mają identyczną architekturę i wagi – to ten sam „mózg”. Jedyną różnicą jest konfiguracja bezpieczeństwa. W Mythos 5 usunięto klasyfikatory dla wrażliwych domen, co zapewnia mu pełne, nieograniczone możliwości .
Mythos 5 nie jest jednak dostępny publicznie. Jest zarezerwowany dla niewielkiej grupy sprawdzonych partnerów, w tym agencji rządowych i operatorów infrastruktury krytycznej, w ramach inicjatywy o nazwie Project Glasswing . Ten wspierany przez rząd USA program został początkowo uruchomiony z 12 partnerami-założycielami, w tym gigantami technologicznymi jak AWS, Google i Microsoft, aby umożliwić „cyberobrońcom” wykorzystanie AI do znajdowania i łatania luk w oprogramowaniu na masową skalę
. Wraz z premierą Mythos 5 dostęp rozszerzono do około 40 organizacji
.
Poniższa tabela ilustruje ten fundamentalny podział:
Podział Fable/Mythos od Anthropic jest najbardziej wyrazistym przykładem tego, co można nazwać wdrażaniem AI z podziałem na poziomy możliwości (capability-tiered AI deployment). W tym nowym modelu pojedyncza, przełomowa AI nie jest jednym produktem. Jej pełna moc jest przywilejem, a nie rzeczą oczywistą, a zabezpieczenia są mechanizmem tworzącym zróżnicowanie produktów .
Ten schemat nie jest unikalny dla Anthropic. Inne wiodące firmy AI, w tym OpenAI, przyjęły podobne podejście, udostępniając wersje swoich najbardziej zaawansowanych modeli z ograniczonym dostępem partnerom z sektora bezpieczeństwa narodowego i badawczego . Premiera Fable/Mythos krystalizuje wizję przyszłości, w której najpotężniejsze możliwości AI są reglamentowane nie przez technologię, ale przez status weryfikacji. Protokoły bezpieczeństwa pełnią podwójną funkcję mechanizmów kontroli dostępu – podejście, które już teraz wywołuje szerszą debatę na temat centralizacji, równości i prawdziwego znaczenia „publicznego” bezpieczeństwa AI. To już nie tylko kwestia bezpieczeństwa, ale i fundamentalnych zasad dostępu do technologii przyszłości.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Badacze cyberbezpieczeństwa krytykują Claude Fable 5 od Anthropic, bo jego zabezpieczenia agresywnie blokują nawet niewinne zapytania związane z bezpieczeństwem i po cichu przełączają się na słabszy model, nie informu...
Badacze cyberbezpieczeństwa krytykują Claude Fable 5 od Anthropic, bo jego zabezpieczenia agresywnie blokują nawet niewinne zapytania związane z bezpieczeństwem i po cichu przełączają się na słabszy model, nie informu... Kontrowersje dotyczą mechanizmu przekierowującego zapytania o cyberbezpieczeństwo, biologię, chemię i destylację AI do starszego modelu Claude Opus 4.8.
Jednoczesna premiera ograniczonego modelu publicznego (Fable 5) i nieograniczonego, dostępnego tylko dla zaufanych partnerów (Mythos 5), wyznacza nowy standard w branży – wdrażanie AI z podziałem na poziomy dostępu, c...