GRAM (Gradient Routed Auxiliary Modules) — експериментальний метод претренування від Anthropic та AE Studio, який спрямовує знання подвійного призначення (вірусологія, кібербезпека) у спеціальні модулі, які потім можн... У конфігурації з чотирма категоріями знань подвійного призначення одна модель, навчена за методо...
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Компанії Anthropic та AE Studio представили експериментальну техніку під назвою GRAM (Gradient-Routed Auxiliary Modules), яка може надати моделям штучного інтелекту своєрідний «вимикач» для небезпечних знань. Замість того щоб навчати окремі моделі для кожного сценарію безпеки, GRAM дозволяє створити єдину модель зі знімними модулями, що містять знання подвійного призначення, як-от вірусологія, кібербезпека або ядерна фізика R. Варто наголосити: це попереднє дослідження, і Anthropic заявляє, що метод не застосовувався до жодної з продукційних моделей Claude R. Однак це перспективний напрямок, який може зробити безпеку ШІ більш «хірургічною» порівняно з сучасними грубими інструментами.
GRAM — це метод претренування, розроблений для того, щоб локалізувати знання подвійного призначення (інформацію, яку можна використати як на користь, так і на шкоду) у спеціальні нейронні модулі всередині мовної моделі R. Після навчання ці модулі можна вмикати або вимикати, що дає операторам точний контроль над тим, які небезпечні можливості зберігає модель R. Цей підхід також може дозволити створювати різні профілі доступу для різних користувачів: дослідники могли б увімкнути знання з вірусології, тоді як для публічного чат-бота вони залишалися б вимкненими R.
GRAM розширює стандартну архітектуру трансформера, додаючи невеликі допоміжні модулі — практично, спеціалізовані нейрони на кожному шарі — які призначені для захоплення конкретних знань подвійного призначення під час тренування RR. Ключовий механізм — це gradient routing (маршрутизація градієнтів): під час зворотного поширення помилки спеціальні зважені маски визначають, які параметри оновлюються для яких даних OL.
Після завершення навчання окремі модулі можна видалити або вимкнути, щоб обмежити доступ до певної можливості, або залишити їх активними для тих розгортань, де такі знання дозволені R. Оскільки кожна категорія подвійного призначення має власний модуль, одна модель, навчена за методом GRAM із чотирма категоріями, теоретично може мати 2⁴ = 16 різних профілів можливостей — просто вмикаючи або вимикаючи кожен модуль незалежно R.
Дослідники протестували GRAM у кількох умовах та на моделях різного розміру R:
Дослідження GRAM з'явилося одночасно з реальним прикладом проблеми, яку воно намагається вирішити. У червні 2025 року адміністрація Трампа запровадила експортні обмеження на моделі Anthropic Claude Fable 5 та Mythos 5 через занепокоєння щодо кібербезпеки. Заборона стосувалася доступу для будь-яких іноземних громадян — як всередині США, так і за їх межами, включно зі співробітниками Anthropic, які є іноземцями ACC. Заборона тривала 18 днів, після чого Міністерство торгівлі США скасувало її після перевірки національної безпеки FA.
Цей епізод яскраво ілюструє поточний стан контролю доступу до ШІ: ціла модель з усіма її можливостями розглядається як єдине неподільне ціле. Якщо модель має небезпечну здатність, єдиний вихід сьогодні — заблокувати всю систему повністю. GRAM пропонує більш гнучку альтернативу: замість блокування цілої моделі, система могла б дозволяти або забороняти конкретні категорії знань залежно від контексту використання R.
Дослідники з Anthropic чітко визначають GRAM як попередню роботу та виділяють кілька обмежень R:
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GRAM (Gradient Routed Auxiliary Modules) — експериментальний метод претренування від Anthropic та AE Studio, який спрямовує знання подвійного призначення (вірусологія, кібербезпека) у спеціальні модулі, які потім можн...
GRAM (Gradient Routed Auxiliary Modules) — експериментальний метод претренування від Anthropic та AE Studio, який спрямовує знання подвійного призначення (вірусологія, кібербезпека) у спеціальні модулі, які потім можн... У конфігурації з чотирма категоріями знань подвійного призначення одна модель, навчена за методом GRAM, теоретично може мати 16 різних профілів можливостей — залежно від того, які модулі увімкнені чи вимкнені [7].
Дослідження з'явилося на тлі реальних політичних подій: у червні 2025 року адміністрація Трампа запровадила (а згодом скасувала) експортні обмеження на моделі Anthropic Claude Fable 5 та Mythos 5 через занепокоєння що...