GRAM (Gradient Routed Auxiliary Modules) er en eksperimentel prætræningsmetode fra Anthropic og AE Studio, der leder dobbeltanvendelig viden – som virologi eller cybersikkerhed – ind i dedikerede moduler i en sprogmod... I et setup med fire dobbeltanvendelseskategorier kan en enkelt GRAM trænet model teoretisk konfi...
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Anthropic og AE Studio har præsenteret en eksperimentel teknik kaldet GRAM (Gradient-Routed Auxiliary Modules), som kan give AI-modeller en form for frakoblingsknap til farlig viden. I stedet for at træne separate modeller til hver sikkerhedskonfiguration, sigter GRAM mod at bygge en enkelt model med aftagelige rum til dobbeltanvendelseskapaciteter som virologi, cybersikkerhed og kernefysik . Forskningen er foreløbig – Anthropic understreger, at den ikke er blevet anvendt på nogen produktionsmodel af Claude
– men den repræsenterer en lovende retning for at gøre AI-sikkerhed mere kirurgisk end dagens grove værktøjer.
GRAM er en prætræningsmetode designet til at lokalisere dobbeltanvendelsesviden – information, der både kan bruges til gavnlige og skadelige formål – i aftagelige neurale moduler inde i en sprogmodel . Efter træning kan disse moduler tændes eller slukkes, hvilket giver operatører finmasket kontrol over, hvilke farlige kapaciteter modellen bevarer
. Samme tilgang kunne også muliggøre forskellige adgangsprofiler for forskellige brugere: forskere kunne tænde for virologividen, mens en offentlig chatbot holder den slukket
.
GRAM udvider den standard Transformer-arkitektur ved at tilføje små hjælpemoduler – dedikerede neuroner på hvert lag – som er beregnet til at fange specifikke dobbeltanvendelseskapaciteter under træning . Nøglemekanismen er gradientrouting: under backpropagation styrer vægtede masker, hvilke parametre der opdateres for hvilke data
.
Når træningen er færdig, kan individuelle moduler fjernes eller deaktiveres for at reducere adgangen til en bestemt kapacitet, eller de kan blive siddende til implementeringer, der må bruge den viden . Fordi hver dobbeltanvendelseskategori har sit eget modul, kan en enkelt GRAM-trænet model med fire kategorier teoretisk konfigureres i 2⁴ = 16 forskellige kapabilitetsprofiler ved at tænde eller slukke for hvert modul uafhængigt
.
Forskerne testede GRAM i flere forskellige opsætninger og modelstørrelser :
GRAM-forskningen kommer samtidig med et virkeligt eksempel på det problem, den forsøger at løse. I juni 2025 indførte Trump-administrationen eksportkontrol på Anthropics Claude Fable 5 og Mythos 5 modeller efter bekymringer om cybersikkerhed, hvilket blokerede adgang for alle udenlandske statsborgere – inde eller uden for USA, inklusive udenlandske statsborgere ansat hos Anthropic . Forbuddet varede 18 dage, før Handelsministeriet ophævede det efter en national sikkerhedsgennemgang
.
Denne episode illustrerer den nuværende tilstand af AI-adgangskontrol: en hel model – med alle dens kapaciteter – behandles som en udelelig enhed. Hvis en model har en farlig kapacitet, er den eneste mulighed i dag at tilbageholde hele systemet. GRAM foreslår et mere finkornet alternativ: i stedet for at låse en hel model ned, kunne et system tillade eller deaktivere specifikke kategorier af viden afhængigt af implementeringskonteksten .
Anthropics forskere identificerer eksplicit GRAM som foreløbigt arbejde og fremhæver flere begrænsninger :
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GRAM (Gradient Routed Auxiliary Modules) er en eksperimentel prætræningsmetode fra Anthropic og AE Studio, der leder dobbeltanvendelig viden – som virologi eller cybersikkerhed – ind i dedikerede moduler i en sprogmod...
GRAM (Gradient Routed Auxiliary Modules) er en eksperimentel prætræningsmetode fra Anthropic og AE Studio, der leder dobbeltanvendelig viden – som virologi eller cybersikkerhed – ind i dedikerede moduler i en sprogmod... I et setup med fire dobbeltanvendelseskategorier kan en enkelt GRAM trænet model teoretisk konfigureres i 16 forskellige kapabilitetsprofiler ved at tænde eller slukke for specifikke moduler [7].
Teknikken kommer samtidig med en virkelig politisk debat: i juni 2025 indførte Trump administrationen – og senere ophævede – eksportkontrol på Anthropics Claude Fable 5 og Mythos 5 modeller efter bekymringer om cybers...