GEEKOMは、4台のA9 Megaをクラスタ化し、クラウドに送信せずDeepSeek V4 Flashを実行するデモを公開しました。合計で64コア・128スレッド、Radeon 8060Sの160 Compute Unit、512GBのLPDDR5X 8000統合メモリを備えます。 各ノードはUSB4で接続され、Ubuntu、AMD ROCm、DwarfStarによってモデルを分散配置。OpenAI互換APIを通じて、社内アプリやエージェントから利用できる構成です。
研究の答え

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GEEKOMは、4台のA9 MegaミニPCをUSB4で接続し、DeepSeek V4 Flashを分散推論するローカルAIクラスターをデモしました。Ubuntu、AMDのGPU向けソフトウェア基盤「ROCm」、そしてDwarfStarを組み合わせ、クラウドやデータセンターのサーバーにプロンプトや文書を送らず、オンプレミス環境でモデルを動かす構成です。結果はOpenAI互換APIとして公開され、既存の社内アプリや開発ツールから接続できる形になっています。
DeepSeek V4 Flashは、総パラメータ数が約2840億、1トークンの生成時に実際に使われるパラメータが約130億のMixture-of-Experts(MoE)モデルとされています。また、最大100万トークンのコンテキストに対応する設計です。
この規模のモデルを1台の小型PCに収めるのではなく、複数ノードのメモリと演算資源に分散させるのが、今回のデモのポイントです。ただし、4台分のメモリを単純に合算した512GBが、そのままモデルに利用できるわけではありません。実際にモデルの重み、ランタイム、キャッシュ、OSに割り当てられる容量は、精度、量子化方式、ソフトウェア設定によって変わります。
各A9 Megaは、AMD Ryzen AI Max+ 395を搭載しています。CPUは16コア・32スレッド、GPUはRDNA 3.5ベースのRadeon 8060Sです。4台を合計すると、次の構成になります。
ここでいう統合メモリは、CPUとGPUが共有するメモリです。専用GPUを搭載した一般的なサーバーとは異なり、各ミニPC内のCPU・GPU資源を使いながら、モデルをノード間に分割して処理します。
GEEKOMによると、4台のA9 MegaはUSB4で接続され、Ubuntu、ROCm、DwarfStarを含むソフトウェア構成でDeepSeek V4 Flashを動かします。最適化されたモデルを複数ノードに分割し、推論リクエストをOpenAI互換エンドポイントで受け付ける仕組みです。
OpenAI互換APIに対応する点は、企業導入を考えるうえで重要です。すでにOpenAI形式のエンドポイントに対応している社内アプリ、AIエージェント、開発ツールなら、統合部分を全面的に作り直さずにローカルモデルへ接続できる可能性があります。
つまり、狙いは1台のデスクトップでチャットボットを動かすことよりも、組織内ネットワークに閉じたプライベートAIサービスを構築することにあります。
一方、今回の発表だけでは、一般的なデータセンター向けサーバーと同じ性能や信頼性があるとは判断できません。ノード間の接続トポロジー、実効帯域幅、遅延、モデルの分割方式、精度や量子化形式、オーケストレーション設定、障害時の復旧方法などは明らかにされていません。モデル並列処理ではノード間通信が頻繁に発生するため、これらの条件が推論性能に大きく影響します。
A9 MegaはPCIe 4.0対応のM.2スロットを2基備え、最大8TBのSSDストレージに対応するとされています。 4台すべてを最大構成にした場合、理論上の総容量は最大32TBです。これはクラスター全体で8TBという意味ではなく、各マシンに最大8TBを搭載した場合の合計です。
ストレージ容量は、システムの統合メモリ512GBとは別のものです。また、最大32TBという数字だけでは、DeepSeekのモデルファイルやキャッシュが実際にどれだけのディスク容量を必要とするかは分かりません。
ノード間接続にはUSB4が使われています。A9 Megaの製品情報では、USB4ポートは最大40Gbpsと記載されています。 ただし、このインターフェース上の理論値は、クラスターの実測性能を意味しません。プロトコルのオーバーヘッド、接続トポロジー、通信パターンによって、分散推論で利用できる実効帯域幅と遅延は変わります。
GEEKOMが打ち出すのは、オンプレミス型のプライベートAIアプライアンスです。企業は、プロンプト、社内文書、生成結果を自社ネットワーク内に置いたまま、社内アプリやエージェントからモデルを利用できる可能性があります。AMDのROCmを使うため、この構成ではNVIDIA CUDAベースのシステムを必須としません。
データの保存場所、プライバシー、ネットワーク分離を重視するチームにとっては、検討対象になり得ます。ただし、クラウドに任せていた運用の責任は自社側に移ります。ハードウェアの稼働状況、OSやモデルの更新、アクセス制御、監視、冷却、電力、ソフトウェアの安定性などを運用者が管理しなければなりません。
GEEKOMのA9 Megaの掲載価格は1台3,999ドルです。 そのため4台の本体価格は、単純計算で約15,996ドルになります。
ただし、この金額には、追加ストレージ、ケーブル、ネットワーク機器、設置作業、電気代、保守、サポートなどは含まれません。評価すべきなのは4台の購入価格だけではなく、分散推論サービスを継続運用するための総コストと、実際に処理できる業務量です。
今回の発表から確認できるのは、GEEKOMが4台のA9 MegaでDeepSeek V4 Flashを展開したという事実です。しかし、この構成について、第三者が再現できる標準化ベンチマークは提示されていません。
持続的なトークン生成速度、初回トークンまでの時間、同時利用者数、長大なコンテキストでの遅延、消費電力、ノード障害時の挙動といった情報は未公開です。
100万トークンのコンテキストに対応するというモデル仕様も、4ノードのA9 Megaが100万トークンのリクエストを高速かつ低コストで処理できることを意味しません。実際の性能は、モデルのビルド、精度、量子化、メモリ割り当て、入力長、同時リクエスト数、ノード間通信のオーバーヘッドなどに左右されます。
したがって、現時点では「本番環境で検証済みのAI基盤」というより、ローカル展開が可能であることを示す技術デモと見るのが妥当です。
Ryzen AI Max+ 395を搭載したミニPCは、GEEKOMだけの製品カテゴリーではありません。同じプロセッサーと、場合によっては128GBの統合メモリを備える製品を他社も販売しています。
MinisforumのN5 Maxも比較対象の一つです。ただし、ServeTheHomeの報告によると、実際の小売版N5 Maxは、CES 2026で見られた初期プロトタイプの128GB構成ではなく、基板上に固定された64GBのLPDDR5X統合メモリを搭載して出荷されました。
このため、GEEKOMのより重要な差別化要素は、Ryzen AI Max+ 395そのものではなく、4台を連携させたソフトウェア構成と、その上でDeepSeek V4 Flashを動かしたというデモにあります。実用性を判断するには、再現可能なセットアップ手順、標準化ベンチマーク、ネットワーク測定、消費電力、現実的な負荷での安定稼働に関する情報が必要です。
GEEKOMの構成は、4台のミニPCを組み合わせて大容量のAMDローカル推論基盤を作る方法を示しました。合計で64 CPUコア、128スレッド、Radeon 8060Sの160 Compute Unit、512GBの統合メモリを備え、USB4、Ubuntu、ROCm、DwarfStarを使ってDeepSeek V4 Flashを分散実行します。
魅力は、非常に大規模なMoEモデルを、使い慣れたAPI経由で社内ネットワークに閉じて利用できる可能性です。しかし、現在の資料が裏付けているのはデプロイの実施であり、速度、効率、信頼性、本番運用への適性ではありません。
GEEKOMが再現可能なベンチマークと実装の詳細を公開するまでは、この4ノード構成は専用AIインフラの代替品というより、興味深いオンプレミス実証として評価するのがよさそうです。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
GEEKOMは、4台のA9 Megaをクラスタ化し、クラウドに送信せずDeepSeek V4 Flashを実行するデモを公開しました。合計で64コア・128スレッド、Radeon 8060Sの160 Compute Unit、512GBのLPDDR5X 8000統合メモリを備えます。
GEEKOMは、4台のA9 Megaをクラスタ化し、クラウドに送信せずDeepSeek V4 Flashを実行するデモを公開しました。合計で64コア・128スレッド、Radeon 8060Sの160 Compute Unit、512GBのLPDDR5X 8000統合メモリを備えます。 各ノードはUSB4で接続され、Ubuntu、AMD ROCm、DwarfStarによってモデルを分散配置。OpenAI互換APIを通じて、社内アプリやエージェントから利用できる構成です。
A9 Megaの価格は1台3,999ドル。4台では約15,996ドルですが、ストレージ、配線、ネットワーク機器、導入費用、電力、保守費用は別途必要です。