GRAM utvider den standard Transformer-arkitekturen ved å legge til små hjelpemoduler – dedikerte nevroner på hvert lag – som er ment å fange opp spesifikke dual-use-kapabiliteter under trening . Nøkkelmekanismen er gradientruting: under tilbakepropagering styrer vektede masker hvilke parametere som oppdateres for hvilke data
.
Når treningen er fullført, kan individuelle moduler fjernes eller deaktiveres for å redusere tilgangen til en bestemt kapabilitet, eller de kan beholdes for distribusjoner som har lov til å bruke kunnskapen . Fordi hver dual-use-kategori har sin egen modul, kan en enkelt GRAM-trent modell med fire kategorier i teorien konfigureres i 2⁴ = 16 distinkte kapabilitetsprofiler ved å slå hver modul av eller på uavhengig
.
GRAM-forskningen kommer samtidig som et høyprofilt eksempel fra virkeligheten på problemet den forsøker å løse. I juni 2025 innførte Trump-administrasjonen eksportkontroll på Anthropics Claude Fable 5- og Mythos 5-modeller etter bekymringer rundt cybersikkerhet, og blokkerte tilgang for alle utenlandske statsborgere – både i og utenfor USA, inkludert utenlandske Anthropic-ansatte . Forbudet varte i 18 dager før Handelsdepartementet opphevet det etter en nasjonal sikkerhetsgjennomgang
.
Denne episoden illustrerer dagens tilstand for AI-tilgangskontroll: en hel modell – med alle dens kapabiliteter – blir behandlet som en udelelig enhet. Hvis en modell har en farlig kapabilitet, er det eneste alternativet i dag å holde tilbake hele systemet. GRAM foreslår et mer finmasket alternativ: i stedet for å låse ned en hel modell, kunne et system tillate eller deaktivere spesifikke kategorier av kunnskap avhengig av distribusjonskonteksten .