GRAM(Gradient Routed Auxiliary Modules)は、アンソロピックとAE Studioが開発した実験的な事前学習手法。ウイルス学やサイバーセキュリティといった悪用可能な知識をLLM内部の専用モジュールにルーティングし、後から取り外し可能にする。 4つの悪用可能カテゴリを持つ設定では、1つのGRAM学習済みモデルから、各モジュールのオン/オフを切り替えることで理論上16通りの能力プロファイルを構成できる。
研究の答え

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
アンソロピック(Anthropic)とAE Studioは、AIモデルに危険な知識に対する「オフスイッチ」を組み込む実験的手法「GRAM(Gradient-Routed Auxiliary Modules)」を発表した。これは、セキュリティ設定ごとに別々のモデルを訓練する代わりに、ウイルス学、サイバーセキュリティ、原子核物理学といった悪用の可能性がある能力(デュアルユース能力)を、単一モデル内の取り外し可能な区画に格納する手法である。ただし、この研究はあくまで予備的なものであり、アンソロピックは「現在のところ、本番のClaudeモデルには適用していない」としている
。
GRAMは、悪用可能な知識を言語モデル内部の取り外し可能なニューラルモジュールに局在化させるための事前学習手法である。訓練後、それらのモジュールはオンにもオフにもでき、オペレーターはモデルが保持する危険な能力をきめ細かく制御できるようになる
。同じ手法により、ユーザーごとに異なるアクセスプロファイルを設定することも可能だ。研究者はウイルス学に関する知識をオンにし、一般公開向けチャットボットではそれを無効にしておく、といった使い方が想定される
。
GRAMは標準的なTransformerアーキテクチャを拡張し、各層に小さな補助モジュール(専用ニューロン)を追加する。これらのモジュールは訓練中に特定のデュアルユース能力を捕捉するように設計されている。核となるメカニズムは勾配ルーティング(gradient routing)である。逆伝播の際、重み付けされたマスクによって、どのデータに対してどのパラメータが更新されるかを制御する
。
訓練が完了すると、個々のモジュールは削除または無効化して特定の能力へのアクセスを制限することも、許可されたデプロイ環境ではそのまま残すこともできる。各デュアルユースカテゴリがそれぞれのモジュールに対応しているため、4つのカテゴリを持つ1つのGRAM訓練済みモデルでは、各モジュールを独立してオン/オフすることで理論上2⁴ = 16通りの能力プロファイルを構成できる
。
GRAMの研究は、この手法が解決しようとする問題の現実的な事例と同時期に登場した。2025年6月、トランプ政権はサイバーセキュリティ上の懸念から、アンソロピックのClaude Fable 5およびMythos 5モデルに対する輸出規制を発動。米国国内外の外国人(アンソロピックに所属する外国人社員を含む)のアクセスをすべて遮断した。この規制は18日間続いた後、商務省が国家安全保障レビューを経て解除した
。
この事例は、現在のAIアクセス制御の現状を如実に示している。モデルはそのすべての能力とともに単一の不可分な単位として扱われる。もしモデルに危険な能力があれば、現状ではシステム全体を利用停止にする以外の選択肢はない。GRAMはより細かな代替案を提案する。すなわち、モデル全体をロックダウンする代わりに、デプロイ環境に応じて特定の知識カテゴリを許可または無効にするというものだ。
アンソロピックの研究者らはGRAMを予備的段階の研究と明確に位置づけ、いくつかの限界を挙げている:
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
GRAM(Gradient Routed Auxiliary Modules)は、アンソロピックとAE Studioが開発した実験的な事前学習手法。ウイルス学やサイバーセキュリティといった悪用可能な知識をLLM内部の専用モジュールにルーティングし、後から取り外し可能にする。
GRAM(Gradient Routed Auxiliary Modules)は、アンソロピックとAE Studioが開発した実験的な事前学習手法。ウイルス学やサイバーセキュリティといった悪用可能な知識をLLM内部の専用モジュールにルーティングし、後から取り外し可能にする。 4つの悪用可能カテゴリを持つ設定では、1つのGRAM学習済みモデルから、各モジュールのオン/オフを切り替えることで理論上16通りの能力プロファイルを構成できる。
この技術は現実の政策論争と同時期に登場した。2025年6月、トランプ政権はサイバーセキュリティ上の懸念を理由に、アンソロピックのClaude Fable 5とMythos 5に輸出規制を課したが、18日後に解除されている。