GEEKOM 展示了四台 A9 Mega 通过 USB4 组成集群,在不依赖云端推理的情况下运行 DeepSeek V4 Flash;整套系统拥有 64 个 CPU 核心、128 个线程、160 个 Radeon 8060S 计算单元和 512GB LPDDR5X 8000 统一内存。 这套部署据称使用 Ubuntu、AMD ROCm 和 DwarfStar,将模型分布到多个节点,并通过兼容 OpenAI API 的接口向本地应用提供服务。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GEEKOM 展示了一套由四台 A9 Mega 组成的本地分布式推理集群。四台迷你主机通过 USB4 连接,在 Ubuntu、AMD ROCm 和 DwarfStar 软件的协同下,将 DeepSeek V4 Flash 部署到多个节点,并通过兼容 OpenAI API 的接口提供服务。GEEKOM 将其定位为一种不必把提示词和内部文档发送到云端的本地化方案。
这项演示之所以引人关注,是因为 DeepSeek V4 Flash 被描述为一款约 2840 亿参数的混合专家模型(MoE),每个 token 实际激活的参数约为 130 亿;其上下文窗口最高可达 100 万 token。
每台 A9 Mega 搭载 AMD Ryzen AI Max+ 395,配备 16 核、32 线程 CPU,以及基于 RDNA 3.5 架构的 Radeon 8060S 图形单元。四台设备合计可得到以下配置:
统一内存是这套方案的关键。与依赖单块大显存独立加速卡的传统方案不同,集群可以把模型相关的工作负载分摊到多台设备的内存和图形资源上。不过,512GB 是系统总内存,并不等于可直接用于模型的容量。模型权重、运行时开销、KV 缓存和操作系统所占空间,都会受到精度、量化方式及软件配置影响。
GEEKOM 表示,四台机器通过 USB4 通信,并采用 Ubuntu、AMD ROCm 和 DwarfStar 软件栈。经过优化的 DeepSeek V4 Flash 会被拆分到不同节点,再由集群通过兼容 OpenAI 的接口处理请求。
API 兼容性对实际部署很重要。已经支持 OpenAI 风格接口的内部应用、智能体和开发工具,理论上可以连接到这个本地模型,而不必重写整套集成逻辑。因此,这项方案的目标并不是在一台桌面电脑上运行普通聊天机器人,而是把多台迷你主机组合成企业内部的私有 AI 服务。
但这并不意味着该集群具备传统数据中心服务器的相同性能。GEEKOM 提供的公告没有说明具体网络拓扑、有效带宽、通信延迟、分片策略、模型精度、量化格式、编排配置或故障恢复机制。这些因素都可能显著影响推理速度,尤其是在模型并行需要节点之间频繁交换数据时。
目前披露的节点间连接方式是 USB4。GEEKOM 的产品资料也列出了 A9 Mega 的 USB4 接口,标称速率最高为 40Gbps。不过,接口标称速率不能直接等同于集群实测性能。协议开销、连接拓扑以及软件通信模式,都会决定分布式推理实际能够获得的带宽和延迟。
每台 A9 Mega 配备两个 PCIe 4.0 M.2 插槽,标称最高支持 8TB SSD。如果四台设备都扩展到这一上限,整套集群的理论存储容量最高可达 32TB。这与 512GB 系统统一内存是两个不同概念,也不能仅凭存储容量判断 DeepSeek 部署本身需要占用多少磁盘空间。
GEEKOM 试图将这套系统包装成一台本地部署的私有 AI 设备。理论上,企业可以让提示词、内部文档和模型输出留在自己的网络环境中,同时通过本地 API 向业务应用和智能体提供模型服务。ROCm 则为 AMD 图形硬件提供软件支持,在这套设计中不必依赖基于 NVIDIA CUDA 的系统。
对于有数据驻留、隐私保护或网络隔离要求的团队来说,这种模式可能具有吸引力。但它也把更多运维责任交给了使用方:企业需要自行管理硬件可用性、系统和模型更新、模型文件、访问控制、监控、散热、供电以及软件稳定性。
GEEKOM 为 A9 Mega 标出的价格是 3,999 美元。因此,四台设备的采购成本约为 15,996 美元。这个数字还不包括额外存储、线缆、网络设备、安装部署、电费、维护和技术支持。
对于一套尚未经过独立验证的分布式推理系统来说,这是一笔不小的投入。真正需要比较的并不只是四台迷你主机的售价,而是完整的集群部署和运营成本,以及它能够稳定支撑的实际工作负载。
GEEKOM 的公告证明了公司已经在四台 A9 Mega 上展示 DeepSeek V4 Flash 的部署,但没有提供针对这一确切配置的独立、标准化测试结果。现有资料没有给出持续生成速度、首 token 延迟、并发用户数、长上下文延迟、功耗或节点故障时的表现。
因此,这次展示更适合被视为“部署可行性演示”,而不是经过验证的生产级基准测试。DeepSeek V4 Flash 支持 100 万 token 上下文是一个重要规格,但这并不代表四节点 A9 Mega 集群能够快速或经济地处理百万 token 请求。实际表现将取决于模型构建方式、精度、内存分配、提示长度、并发请求数量以及节点间通信开销。
Ryzen AI Max+ 395 平台并非 GEEKOM 独占。其他厂商也在销售采用同一处理器的迷你主机,其中部分型号同样提供 128GB 统一内存。Minisforum N5 Max 就是一个相近设计。不过,ServeTheHome 报道称,零售版 N5 Max 配备的是 64GB 板载 LPDDR5X 统一内存,而不是早期原型机展示的 128GB 配置。
这意味着,GEEKOM 更值得关注的差异点是其宣称的四节点软件部署,而不是 Ryzen AI Max+ 395 处理器本身。要判断这套方案是否超越技术展示、具备实际使用价值,还需要更多公开信息,包括可复现的安装步骤、统一测试结果、网络测量数据、功耗数据,以及在真实负载下长期稳定运行的证据。
GEEKOM 的演示展示了一种用四台迷你主机构建大内存 AMD 推理平台的方式:整套系统拥有 64 个 CPU 核心、128 个线程、160 个 Radeon 8060S 计算单元和 512GB 统一内存,并通过 USB4 连接,使用 Ubuntu、ROCm 和 DwarfStar 管理。
它的实际卖点,是让企业通过熟悉的 API,在本地、私有环境中访问一款规模庞大的混合专家模型。但目前的证据只能确认这套部署存在,尚不足以证明它的速度、能效或生产就绪程度。在 GEEKOM 发布可复现的性能测试和更完整的实现细节之前,这个四节点集群更适合被看作一项颇具吸引力的本地 AI 演示,而不是已经证实能够替代专用 AI 基础设施的产品。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
GEEKOM 展示了四台 A9 Mega 通过 USB4 组成集群,在不依赖云端推理的情况下运行 DeepSeek V4 Flash;整套系统拥有 64 个 CPU 核心、128 个线程、160 个 Radeon 8060S 计算单元和 512GB LPDDR5X 8000 统一内存。
GEEKOM 展示了四台 A9 Mega 通过 USB4 组成集群,在不依赖云端推理的情况下运行 DeepSeek V4 Flash;整套系统拥有 64 个 CPU 核心、128 个线程、160 个 Radeon 8060S 计算单元和 512GB LPDDR5X 8000 统一内存。 这套部署据称使用 Ubuntu、AMD ROCm 和 DwarfStar,将模型分布到多个节点,并通过兼容 OpenAI API 的接口向本地应用提供服务。
按 GEEKOM 标出的每台 3,999 美元计算,四台设备合计约 15,996 美元;但官方尚未公布该配置的独立、标准化性能测试结果。