GRAM (Gradient Routed Auxiliary Modules) ist eine experimentelle Vortrainingsmethode von Anthropic und AE Studio, die Dual Use Wissen – etwa aus Virologie oder Cybersicherheit – in dedizierte Module innerhalb eines LL... In einem Szenario mit vier Dual Use Kategorien kann ein einzelnes GRAM trainiertes Modell theore...
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Anthropic und AE Studio haben eine experimentelle Technik namens GRAM (Gradient-Routed Auxiliary Modules) vorgestellt, die KIs sozusagen mit einem „Ausschalter“ für gefährliches Wissen ausstatten könnte . Anstatt für jede Sicherheitskonfiguration ein separates Modell zu trainieren, zielt GRAM darauf ab, ein einziges Modell mit herausnehmbaren Fachbereichen für Dual-Use-Fähigkeiten wie Virologie, Cybersicherheit und Kernphysik zu bauen
. Die Forschung ist vorläufig – Anthropic betont, dass sie in keinem produktiven Claude-Modell angewendet wurde
–, doch sie zeigt eine vielversprechende Richtung auf, um KI-Sicherheit präziser zu gestalten als die derzeitigen groben Werkzeuge.
GRAM ist eine Vortrainingsmethode, die Dual-Use-Wissen – also Informationen, die sowohl für nützliche als auch für schädliche Zwecke verwendet werden können – in herausnehmbare neuronale Module innerhalb eines Sprachmodells lokalisiert . Nach dem Training können diese Module ein- oder ausgeschaltet werden, was den Betreibern eine feingranulare Kontrolle darüber gibt, welche gefährlichen Fähigkeiten das Modell behält
. Derselbe Ansatz könnte auch unterschiedliche Zugriffsprofile für verschiedene Nutzer ermöglichen: Forscher könnten das Virologie-Wissen aktivieren, während ein öffentlich zugänglicher Chatbot es deaktiviert lässt
.
GRAM erweitert die standardmäßige Transformer-Architektur um kleine Hilfsmodule – im Grunde spezielle Neuronen in jeder Schicht –, die während des Trainings bestimmte Dual-Use-Fähigkeiten erfassen sollen . Der entscheidende Mechanismus ist das Gradienten-Routing: Während der Rückwärtspropagierung steuern gewichtete Masken, welche Parameter für welche Daten aktualisiert werden
.
Nach Abschluss des Trainings können einzelne Module entfernt oder deaktiviert werden, um den Zugriff auf eine bestimmte Fähigkeit zu reduzieren, oder belassen werden, wenn die Nutzung dieses Wissens erlaubt ist . Da jede Dual-Use-Kategorie ein eigenes Modul hat, kann ein einzelnes GRAM-trainiertes Modell mit vier Kategorien theoretisch in 2⁴ = 16 verschiedene Fähigkeitsprofile konfiguriert werden, indem jedes Modul unabhängig ein- oder ausgeschaltet wird
.
Die Forscher testeten GRAM in verschiedenen Umgebungen und Modellgrößen :
Die GRAM-Forschung kommt zu einem Zeitpunkt, an dem das Problem, das sie lösen soll, auf der weltpolitischen Bühne exemplarisch ausgetragen wird. Im Juni 2025 verhängte die Trump-Administration aus Cybersicherheitsbedenken Exportkontrollen gegen Anthropics Modelle Claude Fable 5 und Mythos 5. Der Zugriff wurde für alle ausländischen Staatsangehörigen – innerhalb und außerhalb der USA, einschließlich ausländischer Anthropic-Mitarbeiter – blockiert . Das Verbot dauerte 18 Tage, bis das Handelsministerium es nach einer nationalen Sicherheitsprüfung aufhob
.
Diese Episode verdeutlicht den aktuellen Stand der KI-Zugriffskontrolle: Ein ganzes Modell mit all seinen Fähigkeiten wird als eine unteilbare Einheit behandelt. Besitzt ein Modell eine gefährliche Fähigkeit, bleibt heute nur die Möglichkeit, das gesamte System zu sperren. GRAM schlägt eine feinere Alternative vor: Anstatt ein ganzes Modell zu blockieren, könnte ein System je nach Einsatzumgebung bestimmte Wissenskategorien erlauben oder deaktivieren .
Die Forscher von Anthropic weisen ausdrücklich darauf hin, dass es sich bei GRAM um eine vorläufige Arbeit handelt, und nennen mehrere Einschränkungen :
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
GRAM (Gradient Routed Auxiliary Modules) ist eine experimentelle Vortrainingsmethode von Anthropic und AE Studio, die Dual Use Wissen – etwa aus Virologie oder Cybersicherheit – in dedizierte Module innerhalb eines LL...
GRAM (Gradient Routed Auxiliary Modules) ist eine experimentelle Vortrainingsmethode von Anthropic und AE Studio, die Dual Use Wissen – etwa aus Virologie oder Cybersicherheit – in dedizierte Module innerhalb eines LL... In einem Szenario mit vier Dual Use Kategorien kann ein einzelnes GRAM trainiertes Modell theoretisch in 16 verschiedene Fähigkeitsprofile konfiguriert werden, indem bestimmte Module an oder ausgeschaltet werden.
Die Technik erscheint vor dem Hintergrund realer politischer Debatten: Im Juni 2025 verhängte die Trump Administration Exportkontrollen gegen Anthropics Claude Fable 5 und Mythos 5 aus Cybersicherheitsgründen – und ho...