GRAM은 표준 트랜스포머 아키텍처에 작은 보조 모듈(auxiliary module), 즉 각 레이어마다 전용 뉴런을 추가한다. 이 모듈은 훈련 중 특정 이중용도 능력을 포착하도록 설계되었다RR. 핵심 메커니즘은 그래디언트 라우팅(gradient routing) 이다. 역전파(backpropagation) 과정에서 가중치 마스크가 어떤 데이터에 대해 어떤 파라미터를 업데이트할지 제어한다OL.
훈련이 완료되면 개별 모듈을 제거하거나 비활성화해 특정 능력에 대한 접근을 차단하거나, 해당 지식 사용이 허가된 배포 환경에서는 그대로 둘 수 있다R. 각 이중용도 범주가 자체 모듈에 매핑되므로, 4개 범주를 가진 단일 GRAM 훈련 모델은 각 모듈을 독립적으로 켜고 끄는 방식으로 이론상 2⁴ = 16가지 서로 다른 기능 프로필로 구성할 수 있다R.
연구진은 여러 환경과 모델 크기에서 GRAM을 테스트했다R:
GRAM 연구는 이 기술이 해결하려는 문제의 현실적 사례와 함께 주목받고 있다. 2025년 6월, 트럼프 행정부는 사이버보안 우려를 이유로 Anthropic의 Claude Fable 5·Mythos 5 모델에 수출 통제를 부과했다. 이 조치는 미국 내외를 막론하고 모든 외국인(Anthropic의 외국인 직원 포함)의 접근을 차단했다ACC. 해당 금지는 18일간 지속되다가 상무부가 국가안보 검토 후 해제했다FA.
이 사건은 현재 AI 접근 통제의 현실을 극명하게 보여준다. 즉, 모든 능력을 가진 모델 전체가 하나의 분할 불가능한 단위로 취급된다는 점이다. 모델에 위험한 능력이 하나라도 있으면 오늘날의 선택지는 시스템 전체를 차단하는 것뿐이다. GRAM은 이보다 훨씬 세분화된 대안을 제시한다. 모델 전체를 잠그는 대신, 배포 환경에 따라 특정 지식 범주만 허용하거나 차단할 수 있게 하는 것이다R.
Anthropic 연구진은 GRAM을 명시적으로 초기 연구(preliminary work)로 규정하며 여러 한계를 지적했다R: