AMD、Supermicro、Spectro Cloudの3社が共同開発し、2026年8月5日にラスベガスで開催されたAi4 2026カンファレンスで発表された。本稿では、その仕組み、コスト、そして対象ユーザーを詳しく解説する。
AMD Instinct Coderの中核的な差別化要因は、ポリシーベースのインテリジェントモデルルーティングである。コード生成、要約、リファクタリングといった日常的なコーディングリクエストは、AMDにより最適化されたGLM-5.2 mixture-of-expertsモデル(総パラメータ744B、トークンあたり約40Bが活性化)がローカルで処理する。一方、複雑な推論を要するクエリは、ローカルモデルでは扱いきれない場合に、OpenAI GPT、Anthropic Claude、Google Geminiといったフロンティアモデルに転送される。この階層型推論設計こそが、主張されているコスト削減のメカニズムである。
リファレンスシステムは、事前検証済みのラック統合型アプライアンスで、単一SKUとして出荷される。
| コンポーネント | 仕様 |
|---|---|
| CPU | 2x AMD EPYC 9575Fプロセッサ(各64コア、3.3 GHz) |
| GPU | 8x AMD Instinct MI325Xアクセラレータ(各256GB HBM3Eメモリ、ピーク帯域幅6TB/s)、空冷または液冷バリエーション |
| ネットワーキング | 2x AMD Pensando Pollara 400Gb/s SmartNIC |
| シャーシ | Supermicro AS-8126GS-TNMR、完全検証・ラック統合済み |
このシステムは「電源を入れてプラグを差せば、文字通りそのまま動作する」アプライアンスとして設計されており、発売四半期中に単一SKUとして提供される予定である。
Spectro CloudのPaletteAI Inference Launchpadは、ハードウェアを実用的にするソフトウェア層である。以下の機能を提供する。
AMDとSpectro Cloudは、本プラットフォームにより、すべてのリクエストをクラウドベースのフロンティアモデルAPIに送信する場合と比較して、AIコーディングのトークンコストを最大70%削減できると主張している。AMDの資料では、設備投資の回収期間は最短6ヶ月とされている。これらの主張は第三者による独立検証を経ておらず、実際の削減効果は組織のワークロード構成や使用パターン、クラウドAPIの価格に依存する。
ダン・マクナマラ氏(AMD、SVP & GM、コンピュート&エンタープライズAI):
「組織には、コードがどこで処理され、どのモデルが使用され、そのコストがいくらなのかを制御する能力が必要です。AMD Instinct Coderは、高性能なAMDコンピュートとオープンなソフトウェアエコシステムを、SupermicroおよびSpectro Cloudのテクノロジーと組み合わせることで、より多くのワークロードをローカルで実行し、フロンティアモデルを選択的に使用し、インフラストラクチャを自社で運用するためのシンプルな方法を顧客に提供します。」
テンリー・フー氏(Spectro Cloud、共同創業者兼CEO):
「組織は、フロンティアモデルの能力と、ローカル推論の経済性および制御性の間で選択を強いられるべきではありません。」
ヴィク・マリアラ氏(Supermicro、SVP、AIおよびエンタープライズ):
Supermicroの役割は、デプロイの複雑さを軽減し、ハードウェア納品から本番推論までの期間を短縮するための、事前検証、ラック統合、システム認定を含む。
本プラットフォームは、Ai4 2026(2026年8月4日~6日、ラスベガス)で発表された。この発表は、企業が開発チームや自動化ワークフロー全体でAIコーディングエージェントを拡大するにつれて、トークンコストが急上昇しているという明確なエンタープライズの課題に対応するものである。初期導入企業であるBMCは、すでに自社のHelix Agentic Engineering業務向けに本プラットフォームを導入している。
AMD Instinct Coderは、能力、コスト、制御性のバランスをとり、プロプライエタリなソースコードをサードパーティのAPIに送信できない、あるいは送信したくない企業向けに、ガバナンスが効いたオンプレミス代替手段として位置づけられている。