GRAM (Gradient Routed Auxiliary Modules) é um método experimental de pré treinamento da Anthropic e AE Studio que roteia conhecimentos de uso duplo — como virologia ou cibersegurança — para módulos dedicados dentro de... Em uma configuração com quatro categorias de uso duplo, um único modelo treinado com GRAM pode,...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
A Anthropic, em parceria com a AE Studio, apresentou uma técnica experimental chamada GRAM (Gradient-Routed Auxiliary Modules) que pode dar aos modelos de IA um "interruptor" granular para conhecimentos perigosos. Em vez de treinar modelos separados para cada configuração de segurança, o GRAM visa construir um único modelo com compartimentos removíveis para capacidades de uso duplo, como virologia, cibersegurança e física nuclear . A pesquisa é preliminar — a Anthropic afirma que ela não foi aplicada a nenhum modelo Claude de produção
—, mas representa uma direção promissora para tornar a segurança da IA mais cirúrgica do que o atual conjunto de ferramentas contundentes.
GRAM é um método de pré-treinamento projetado para localizar conhecimento de uso duplo — informações que podem ser usadas tanto para fins benéficos quanto prejudiciais — em módulos neurais removíveis dentro de um modelo de linguagem . Após o treinamento, esses módulos podem ser ativados ou desativados, dando aos operadores um controle refinado sobre quais capacidades perigosas o modelo retém
. A mesma abordagem também poderia permitir diferentes perfis de acesso para diferentes usuários: pesquisadores poderiam ativar o conhecimento em virologia enquanto um chatbot público o mantém desabilitado
.
O GRAM aumenta a arquitetura Transformer padrão adicionando pequenos módulos auxiliares — essencialmente neurônios dedicados em cada camada — que são destinados a capturar capacidades específicas de uso duplo durante o treinamento . O mecanismo chave é o roteamento de gradiente (gradient routing): durante a retropropagação, máscaras ponderadas controlam quais parâmetros são atualizados para quais dados
.
Uma vez concluído o treinamento, módulos individuais podem ser removidos ou desabilitados para reduzir o acesso a uma capacidade específica, ou mantidos no local para implantações que podem usar esse conhecimento . Como cada categoria de uso duplo mapeia para seu próprio módulo, um único modelo treinado com GRAM com quatro categorias pode, teoricamente, ser configurado em 2⁴ = 16 perfis de capacidade distintos, ativando ou desativando cada módulo de forma independente
.
Os pesquisadores testaram o GRAM em várias configurações e tamanhos de modelo :
A pesquisa GRAM surge junto com um exemplo do mundo real de alto risco do problema que ela visa resolver. Em junho de 2025, o governo Trump impôs controles de exportação aos modelos Claude Fable 5 e Mythos 5 da Anthropic após preocupações com cibersegurança, bloqueando o acesso de qualquer estrangeiro — dentro ou fora dos EUA, incluindo funcionários estrangeiros da Anthropic . A proibição durou 18 dias antes de o Departamento de Comércio suspendê-la após uma revisão de segurança nacional
.
Este episódio ilustra o estado atual do controle de acesso à IA: um modelo inteiro — com todas as suas capacidades — é tratado como uma unidade única e indivisível. Se um modelo tem uma capacidade perigosa, a única opção hoje é reter todo o sistema. O GRAM propõe uma alternativa mais refinada: em vez de bloquear um modelo inteiro, um sistema poderia permitir ou desabilitar categorias específicas de conhecimento, dependendo do contexto de implantação .
Os pesquisadores da Anthropic identificam explicitamente o GRAM como um trabalho preliminar e destacam várias limitações :
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
GRAM (Gradient Routed Auxiliary Modules) é um método experimental de pré treinamento da Anthropic e AE Studio que roteia conhecimentos de uso duplo — como virologia ou cibersegurança — para módulos dedicados dentro de...
GRAM (Gradient Routed Auxiliary Modules) é um método experimental de pré treinamento da Anthropic e AE Studio que roteia conhecimentos de uso duplo — como virologia ou cibersegurança — para módulos dedicados dentro de... Em uma configuração com quatro categorias de uso duplo, um único modelo treinado com GRAM pode, teoricamente, ser configurado em 16 perfis de capacidade diferentes, ativando ou desativando módulos específicos.
A técnica chega em meio a debates políticos reais: em junho de 2025, o governo Trump impôs — e depois suspendeu — controles de exportação sobre os modelos Claude Fable 5 e Mythos 5 da Anthropic após preocupações com c...