GRAM (Gradient Routed Auxiliary Modules) — экспериментальный метод претренировки от Anthropic и AE Studio, который направляет знания двойного назначения (вирусология, кибербезопасность) в специальные модули внутри LLM... В конфигурации с четырьмя категориями знаний одна модель, обученная с GRAM, теоретически может и...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Anthropic совместно с AE Studio представили экспериментальную технику под названием GRAM (Gradient-Routed Auxiliary Modules), которая может дать моделям ИИ своего рода «выключатель» для опасных знаний. Вместо того чтобы тренировать отдельные модели для каждого уровня безопасности, GRAM позволяет создать одну модель со съемными отсеками для знаний двойного назначения — таких как вирусология, кибербезопасность и ядерная физика . Исследования носят предварительный характер — Anthropic подчеркивает, что метод не применялся ни в одной из производственных моделей Claude
— однако он представляет собой многообещающее направление, позволяющее сделать безопасность ИИ более точечной, чем сегодняшние грубые инструменты.
GRAM — это метод претренировки, предназначенный для локализации знаний двойного назначения (информации, которая может быть использована как во благо, так и во вред) в сменные нейронные модули внутри языковой модели . После обучения эти модули можно включать или отключать, что дает операторам тонкий контроль над тем, какие опасные способности сохраняет модель
. Тот же подход может позволить создавать разные профили доступа для разных пользователей: исследователи смогут включить знания по вирусологии, в то время как у публичного чат-бота они будут отключены
.
GRAM расширяет стандартную архитектуру Transformer, добавляя небольшие вспомогательные модули — по сути, выделенные нейроны на каждом слое, — которые предназначены для захвата определенных знаний двойного назначения во время обучения . Ключевой механизм — градиентная маршрутизация (gradient routing): во время обратного распространения ошибки взвешенные маски управляют тем, какие параметры обновляются на основе каких данных
.
После завершения обучения отдельные модули можно удалить или отключить, чтобы ограничить доступ к определенной способности, или оставить на месте для тех развертываний, которым разрешено использовать эти знания . Поскольку каждой категории двойного назначения соответствует свой модуль, одна модель, обученная с GRAM для четырех категорий, теоретически может быть настроена на 2⁴ = 16 различных профилей возможностей, просто включая или отключая каждый модуль независимо
.
Исследователи протестировали GRAM в нескольких условиях и на моделях разных размеров :
Исследование GRAM появляется одновременно с реальным примером проблемы, которую оно призвано решить. В июне 2025 года администрация Трампа ввела экспортные ограничения на модели Anthropic Claude Fable 5 и Mythos 5 из-за опасений по поводу кибербезопасности, заблокировав доступ для любых иностранных граждан — как внутри, так и за пределами США, включая сотрудников Anthropic с иностранным гражданством . Запрет продлился 18 дней, после чего Министерство торговли сняло его после проверки национальной безопасности
.
Этот эпизод иллюстрирует текущее состояние контроля доступа к ИИ: целая модель — со всеми ее возможностями — рассматривается как единое неделимое целое. Если модель обладает опасной способностью, сегодня единственный вариант — заблокировать всю систему. GRAM предлагает более тонкую альтернативу: вместо блокировки всей модели можно разрешать или запрещать определенные категории знаний в зависимости от контекста развертывания .
Исследователи Anthropic прямо указывают, что GRAM — предварительная работа, и выделяют несколько ограничений :
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
GRAM (Gradient Routed Auxiliary Modules) — экспериментальный метод претренировки от Anthropic и AE Studio, который направляет знания двойного назначения (вирусология, кибербезопасность) в специальные модули внутри LLM...
GRAM (Gradient Routed Auxiliary Modules) — экспериментальный метод претренировки от Anthropic и AE Studio, который направляет знания двойного назначения (вирусология, кибербезопасность) в специальные модули внутри LLM... В конфигурации с четырьмя категориями знаний одна модель, обученная с GRAM, теоретически может иметь 16 различных профилей возможностей — просто включая или отключая нужные модули.
Техника появилась в контексте реальных политических решений: в июне 2025 года администрация Трампа ввела, а затем сняла экспортные ограничения на модели Anthropic Claude Fable 5 и Mythos 5 из за опасений по поводу киб...