GEEKOM 示範將 DeepSeek V4 Flash 分散到四部 A9 Mega 上運行,毋須把提示詞及文件交予雲端;整個叢集合共 64 個 CPU 核心、128 條執行緒、160 個 Radeon 8060S 計算單元,以及 512GB LPDDR5X 8000 統一記憶體。 四部機透過 USB4 連接,並使用 Ubuntu、AMD ROCm 及 DwarfStar 將模型分拆部署,再以 OpenAI compatible API 提供本地服務。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GEEKOM 最近展示了一個四節點的本地 AI 推理平台:將四部 A9 Mega 迷你電腦透過 USB4 連成一個分散式叢集,再配合 Ubuntu、AMD ROCm 及 DwarfStar,將 DeepSeek V4 Flash 分拆到不同節點上運行,最後透過 OpenAI-compatible API 提供服務。
換句話說,企業內部應用程式、AI agent 或開發工具,可以像連接一般 OpenAI 風格端點一樣,呼叫這個留在本地網絡內的模型。GEEKOM 將方案定位為毋須依賴數據中心或雲端推理的 private AI 部署。
DeepSeek V4 Flash 被描述為一個約 2,840 億參數的 Mixture-of-Experts(MoE)模型,但每個 token 實際啟用的參數約為 130 億;模型支援最多 100 萬 token 的 context window。
單部 A9 Mega 採用 AMD Ryzen AI Max+ 395,配備 16 核心、32 條執行緒,以及基於 RDNA 3.5 的 Radeon 8060S 圖像處理器。四部機合計規格如下:
這套設計的重點在於統一記憶體。模型不需要完全塞入一張擁有超大顯存的獨立 GPU,而是可以分散使用多部電腦的記憶體及圖像運算資源。不過,512GB 是總記憶體數字,並不等於全部都可以用來存放模型;實際可用容量還要視乎精度、量化方式、runtime overhead、cache 及作業系統佔用而定。
按照 GEEKOM 的說法,四部機以 USB4 互聯,軟件層則由 Ubuntu、AMD ROCm 及 DwarfStar 組成。優化後的 DeepSeek V4 Flash 會分配到不同節點,再由叢集提供 OpenAI-compatible endpoint。
這種 API 相容性對企業部署有一定實際價值。現有支援 OpenAI 風格 API 的內部應用程式、agent 及開發工具,理論上毋須大幅重寫整個整合層,就可以改為連接本地模型。重點因此不是「一部桌面電腦跑 chatbot」,而是用四部迷你電腦砌出一個留在企業自身環境內的 AI 服務。
但示範成功,並不代表它等同於傳統數據中心伺服器。現有公告沒有交代網絡拓撲、有效頻寬、節點間延遲、模型精度、量化格式、sharding 策略、orchestration 設定或故障恢復方式。 對分散式推理而言,這些細節相當關鍵,因為模型平行運算往往需要節點之間頻繁交換數據。
每部 A9 Mega 設有兩個 PCIe 4.0 M.2 插槽,規格上最多支援 8TB SSD。 如果四部機都裝到標稱上限,整個安裝的理論儲存容量可達 32TB。不過,這個數字與 512GB 系統統一記憶體是兩回事,也不能直接推斷 DeepSeek V4 Flash 部署本身需要多少磁碟空間。
GEEKOM 表示節點之間使用 USB4 連接;產品資料亦列出最高 40Gbps 的 USB4 介面。 但介面標稱速度不等於實際叢集效能。協議開銷、連接拓撲,以及軟件的通信模式,都會影響分散式推理時真正得到的頻寬及延遲。
GEEKOM 的主要定位,是一套 on-premises private-AI 方案。理論上,企業可以將提示詞、內部文件及模型輸出留在自己的網絡內,同時讓業務系統及 agent 透過本地 API 使用大型模型。這套設計使用 ROCm 作為 AMD 圖像硬件的軟件層,並非以 NVIDIA CUDA 系統為必要前提。
對有數據留存、私隱或網絡隔離要求的團隊來說,這可能比把資料送上公有雲更吸引。不過,代價是營運責任轉移到企業自己身上:硬件可用性、系統更新、模型檔案、權限控制、監控、散熱、電力消耗及軟件穩定性,都要由營運方自行管理。
GEEKOM 目前列出的 A9 Mega 價格為 3,999 美元。 因此四部機合共約 15,996 美元。這個估算尚未包括額外 SSD、線材、網絡設備、安裝、人手、電費、維護及技術支援。
所以真正需要比較的,不只是四部迷你電腦的入場價,而是整套分散式推理服務的總擁有成本,以及它可以長期穩定支援的工作量。
GEEKOM 的公告證明公司曾經在四部 A9 Mega 上部署 DeepSeek V4 Flash,但沒有提供這個確切配置的獨立、標準化測試結果。目前未見持續輸出速度、首 token 延遲、同時連線數、長 context 延遲、耗電量或節點故障行為等數據。
因此,這次示範較適合視為「部署得到」的 proof of concept,而不是已驗證的生產級 benchmark。DeepSeek V4 Flash 支援 100 萬 token context,固然是一項重要規格,但不代表四節點 A9 Mega 叢集可以快速或低成本處理 100 萬 token 請求。實際表現會取決於模型版本、精度、記憶體分配、提示長度、同時請求數量,以及節點間通信開銷。
Ryzen AI Max+ 395 並非 GEEKOM 獨有。市場上亦有其他採用同一處理器的迷你電腦,部分更提供 128GB 統一記憶體。 Minisforum N5 Max 是其中一款相近設計,但 ServeTheHome 報道,零售版配備的是 64GB 焊接式 LPDDR5X 統一記憶體,而不是較早期原型機展示的 128GB。
因此,GEEKOM 真正較有特色的地方,並不是處理器本身,而是聲稱完成了四節點軟件部署示範。至於方案能否由技術展示走到實際業務環境,仍要看公司會否公開可重現的安裝方法、標準化 benchmark、網絡測試、耗電數據,以及長時間高負載下的穩定性證據。
GEEKOM 示範了一種以四部迷你電腦組成大型 AMD 本地推理平台的方法:合計 64 個 CPU 核心、128 條執行緒、160 個 Radeon 8060S 計算單元及 512GB 統一記憶體,透過 USB4 連接,並由 Ubuntu、ROCm 及 DwarfStar 管理。
它的吸引力在於,企業或許可以透過熟悉的 API,在自己的網絡內使用一個超大型 MoE 模型,同時減少把敏感資料交予雲端的需要。但目前證據只足以確認這套部署曾經存在,未足以證明它的速度、能源效率或生產環境可靠性。
在 GEEKOM 公開可重現的 benchmark 及更多實作細節之前,這個四部 A9 Mega 叢集比較適合被視為一個幾有趣的本地 AI 示範,而不是已證實可以取代專用 AI 基礎設施的方案。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
GEEKOM 示範將 DeepSeek V4 Flash 分散到四部 A9 Mega 上運行,毋須把提示詞及文件交予雲端;整個叢集合共 64 個 CPU 核心、128 條執行緒、160 個 Radeon 8060S 計算單元,以及 512GB LPDDR5X 8000 統一記憶體。
GEEKOM 示範將 DeepSeek V4 Flash 分散到四部 A9 Mega 上運行,毋須把提示詞及文件交予雲端;整個叢集合共 64 個 CPU 核心、128 條執行緒、160 個 Radeon 8060S 計算單元,以及 512GB LPDDR5X 8000 統一記憶體。 四部機透過 USB4 連接,並使用 Ubuntu、AMD ROCm 及 DwarfStar 將模型分拆部署,再以 OpenAI compatible API 提供本地服務。
以 GEEKOM 列出的每部 3,999 美元計算,四部 A9 Mega 約需 15,996 美元,未計額外儲存、網絡設備、部署、電費及支援成本。