GRAM (Gradient Routed Auxiliary Modules) es un método de preentrenamiento experimental de Anthropic y AE Studio que enruta conocimientos de doble uso (como virología o ciberseguridad) hacia módulos dedicados dentro de... Con cuatro categorías de doble uso, un solo modelo entrenado con GRAM se puede configurar teóric...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Anthropic y AE Studio han presentado una técnica experimental llamada GRAM (Gradient-Routed Auxiliary Modules, o Módulos Auxiliares Enrutados por Gradiente) que podría funcionar como un "interruptor de apagado" granular para conocimientos peligrosos en los modelos de IA. En lugar de entrenar modelos separados para cada configuración de seguridad, GRAM busca construir un solo modelo con compartimentos extraíbles para capacidades de doble uso, como virología, ciberseguridad y física nuclear . La investigación es preliminar —Anthropic aclara que no se ha aplicado a ningún modelo de producción de Claude
— pero representa una dirección prometedora para hacer que la seguridad de la IA sea más quirúrgica que las herramientas contundentes actuales.
GRAM es un método de preentrenamiento diseñado para localizar el conocimiento de doble uso —información que puede ser utilizada tanto para fines beneficiosos como dañinos— en módulos neuronales extraíbles dentro de un modelo de lenguaje . Tras el entrenamiento, esos módulos se pueden activar o desactivar, lo que otorga a los operadores un control fino sobre qué capacidades peligrosas conserva el modelo
. El mismo enfoque también podría habilitar diferentes perfiles de acceso para distintos usuarios: los investigadores podrían activar el conocimiento en virología mientras que un chatbot público lo mantendría desactivado
.
GRAM amplía la arquitectura estándar de los Transformers añadiendo pequeños módulos auxiliares —esencialmente neuronas dedicadas en cada capa— que están diseñados para capturar capacidades específicas de doble uso durante el entrenamiento . El mecanismo clave es el enrutamiento por gradiente (gradient routing): durante la retropropagación, unas máscaras ponderadas controlan qué parámetros se actualizan con cada dato
.
Una vez completado el entrenamiento, los módulos individuales se pueden eliminar o desactivar para reducir el acceso a una capacidad particular, o dejarlos activos para implementaciones que sí estén autorizadas a usar ese conocimiento . Dado que cada categoría de doble uso se asigna a su propio módulo, un solo modelo entrenado con GRAM que tenga cuatro categorías se puede configurar teóricamente en 2⁴ = 16 perfiles de capacidades distintos, activando o desactivando cada módulo de forma independiente
.
Los investigadores probaron GRAM en varios entornos y tamaños de modelo :
La investigación de GRAM llega junto con un ejemplo de alto riesgo del problema que pretende resolver. En junio de 2025, la administración Trump impuso controles de exportación a los modelos Claude Fable 5 y Mythos 5 de Anthropic debido a preocupaciones de ciberseguridad, bloqueando el acceso a cualquier extranjero —dentro o fuera de EE. UU., incluidos los empleados extranjeros de Anthropic— . La prohibición duró 18 días antes de que el Departamento de Comercio la levantara tras una revisión de seguridad nacional
.
Este episodio ilustra el estado actual del control de acceso a la IA: un modelo completo —con todas sus capacidades— se trata como una unidad indivisible. Si un modelo tiene una capacidad peligrosa, la única opción hoy es retener todo el sistema. GRAM propone una alternativa más granular: en lugar de bloquear un modelo entero, un sistema podría permitir o deshabilitar categorías específicas de conocimiento según el contexto de implementación .
Los investigadores de Anthropic identifican explícitamente GRAM como un trabajo preliminar y destacan varias limitaciones :
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
GRAM (Gradient Routed Auxiliary Modules) es un método de preentrenamiento experimental de Anthropic y AE Studio que enruta conocimientos de doble uso (como virología o ciberseguridad) hacia módulos dedicados dentro de...
GRAM (Gradient Routed Auxiliary Modules) es un método de preentrenamiento experimental de Anthropic y AE Studio que enruta conocimientos de doble uso (como virología o ciberseguridad) hacia módulos dedicados dentro de... Con cuatro categorías de doble uso, un solo modelo entrenado con GRAM se puede configurar teóricamente en 16 perfiles de capacidades distintos, activando o desactivando módulos específicos.
La técnica llega en un contexto político relevante: en junio de 2025, la administración Trump impuso —y luego levantó— controles de exportación sobre los modelos Claude Fable 5 y Mythos 5 de Anthropic por preocupacion...