Исследователи кибербезопасности недовольны Claude Fable 5: защитные механизмы агрессивно блокируют даже безобидные запросы, связанные с безопасностью, и скрытно переключаются на более слабую модель без предупреждения. Основная критика направлена на механизм, который перенаправляет запросы по кибербезопасности, биоло...

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
Компания Anthropic выпустила Claude Fable 5 9 июня 2026 года, представив его как самую мощную модель ИИ, доступную широкой публике. Однако релиз немедленно столкнулся с резкой критикой со стороны сообщества кибербезопасности .
Если для Anthropic это «ответственный» запуск технологии класса Mythos, то эксперты по безопасности уверены: встроенные предохранители оказались настолько агрессивными, что сделали модель практически бесполезной для проведения легальных исследований и защитных работ. И корень проблемы — не в самом факте наличия защиты, а в её непрозрачной реализации.
Ключевая претензия исследователей — крайняя чувствительность классификаторов контента в Fable 5. Модель, по их словам, «отклоняет любой запрос, который хоть отдаленно касается кибербезопасности — даже такие безобидные задачи, как чтение поста в блоге» . Об этом в интервью TechCrunch заявила Валентина «Chompie» Палмиотти, исследователь безопасности из IBM X-Force. Проще говоря, под блокировку попадают не только потенциально опасные, но и фундаментальные запросы на понимание основ кибербезопасности
.
Такая чрезмерная фильтрация напрямую снижает полезность модели. Когда запрос помечается как небезопасный, пользователь молча получает «урезанный» ответ от более старой и слабой модели. О самом факте подмены его явно не уведомляют . Ситуацию усугубило то, как именно раскрывалась эта информация. Критики утверждают, что такое поведение было описано лишь в недрах 319-страничной сопроводительной документации (системной карты), что породило обвинения в «тайном саботаже»
.
Ограничения затронули не только кибербезопасность. Предохранители также срабатывают на запросы, связанные с биологией, химией и, что критически важно, дистилляцией моделей ИИ. Последний пункт вызвал отдельную волну возмущения: разработчики обвинили Anthropic в использовании «безопасности» как предлога для неконкурентного поведения, чтобы помешать другим ИИ-компаниям обучаться на ответах Fable 5 .
Система безопасности Fable 5 — это не простой блокировщик, а механизм скрытой маршрутизации . Архитектура состоит из трех шагов:
Anthropic утверждает, что такие срабатывания происходят в среднем менее чем в 5% сессий . Компания публично признала проблему гиперчувствительности. Представитель Anthropic сообщил Business Insider, что меры безопасности «могут помечать безопасные, нейтральные или безобидные запросы», но оправдал это как необходимый компромисс для того, чтобы вообще выпустить в свет модель с такой мощной внутренней «начинкой»
.
Позиция Anthropic такова: консервативные предохранители — это осознанный и ответственный выбор, а не ошибка. Компания настаивает, что лежащая в основе архитектура класса Mythos настолько искусна в поиске и эксплуатации программных уязвимостей, что ее бесконтрольный выпуск создал бы неприемлемый риск катастрофического злоупотребления .
В их понимании, ограничения — это конструктивный компромисс: способ дать публике доступ к передовым возможностям анализа, программирования и работы с текстом, поместив «песочницу» вокруг самых опасных способностей. Они называют чрезмерную фильтрацию временной платой за быстрый и безопасный релиз , обещая со временем доработать классификаторы.
Релиз Claude Fable 5 нельзя рассматривать в отрыве от его «близнеца». Это часть новой двухуровневой стратегии развертывания, которая становится индустриальным стандартом для передовых моделей ИИ .
В один день с Fable 5 Anthropic анонсировала и Claude Mythos 5. Обе модели имеют идентичную архитектуру и веса — это один и тот же «мозг». Разница лишь в конфигурации безопасности: у Mythos 5 классификаторы в чувствительных областях отключены, давая полный доступ ко всем возможностям .
Но Mythos 5 — не для всех. Доступ к нему строго ограничен узким кругом проверенных партнеров, включая государственные органы и операторов критической инфраструктуры, через инициативу Project Glasswing . Эта программа, поддерживаемая правительством США, изначально стартовала с 12 учредителями, включая таких гигантов, как AWS, Google и Microsoft, чтобы позволить «защитникам» использовать ИИ для поиска и исправления уязвимостей в промышленных масштабах
. С выходом Mythos 5 доступ расширили примерно до 40 организаций
.
Таблица ниже наглядно показывает принципиальный раскол:
Пример Anthropic — самый яркий образец развертывания ИИ с разделением по уровню доступа. В этой новой реальности одна и та же передовая модель не является единым продуктом. Её полная мощность — это привилегия проверенных, а предохранители становятся механизмом, создающим продуктовую дифференциацию .
Эта модель не уникальна. Другие ведущие компании, включая OpenAI, используют похожие подходы, предоставляя версии своих мощнейших ИИ с ограниченным доступом для национальной безопасности и научных кругов . Запуск дуэта Fable/Mythos кристаллизует будущее, в котором самые мощные возможности ИИ закрыты не технологически, а статусом верификации. Протоколы безопасности при этом выполняют двойную функцию механизма контроля доступа, что уже вызывает бурные споры о централизации, справедливости и истинном значении «общественной» безопасности ИИ.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Исследователи кибербезопасности недовольны Claude Fable 5: защитные механизмы агрессивно блокируют даже безобидные запросы, связанные с безопасностью, и скрытно переключаются на более слабую модель без предупреждения.
Исследователи кибербезопасности недовольны Claude Fable 5: защитные механизмы агрессивно блокируют даже безобидные запросы, связанные с безопасностью, и скрытно переключаются на более слабую модель без предупреждения. Основная критика направлена на механизм, который перенаправляет запросы по кибербезопасности, биологии, химии и дистилляции ИИ на устаревшую модель Claude Opus 4.8.
Одновременный выпуск ограниченной публичной модели (Fable 5) и версии без ограничений для проверенных партнеров (Mythos 5) задает новый отраслевой стандарт развертывания ИИ с разделением по уровню доступа, поднимая во...