GEEKOM показала DeepSeek V4 Flash, що працює на чотирьох A9 Mega без хмарної інференс інфраструктури: разом вони мають 64 ядра CPU, 128 потоків, 160 обчислювальних блоків Radeon 8060S і 512 ГБ об’єднаної пам’яті LPDDR... Вузли з’єднані через USB4, а для локального розгортання заявлені Ubuntu, AMD ROCm і DwarfStar.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GEEKOM продемонструвала розподілений локальний кластер із чотирьох міні-ПК A9 Mega для запуску DeepSeek V4 Flash. Системи з’єднали через USB4, а програмний стек на базі Ubuntu, AMD ROCm і DwarfStar розподіляє модель між вузлами та надає доступ до неї через API, сумісний з OpenAI. За задумом компанії, це альтернатива передаванню запитів і внутрішніх документів у хмарну інфраструктуру.
Демонстрація привертає увагу масштабом моделі. DeepSeek V4 Flash описується як модель типу mixture-of-experts приблизно на 284 мільярди параметрів, хоча для кожного токена активується близько 13 мільярдів. Заявлена довжина контексту сягає одного мільйона токенів.
Кожен A9 Mega побудований на базі AMD Ryzen AI Max+ 395 — 16-ядерного процесора на 32 потоки, доповненого графікою Radeon 8060S. У сумі чотири системи дають:
Саме архітектура об’єднаної пам’яті є ключовою для такої конфігурації. Замість одного дискретного прискорювача з достатнім обсягом відеопам’яті кластер розподіляє навантаження між пам’яттю та графічними ресурсами кількох комп’ютерів.
Втім, 512 ГБ — це не те саме, що 512 ГБ доступної місткості для ваг моделі. Реальний обсяг залежить від точності обчислень, квантизації, системних потреб, кешів і параметрів програмного забезпечення.
За даними GEEKOM, чотири машини обмінюються даними через USB4 і використовують Ubuntu, платформу AMD ROCm та програмне забезпечення DwarfStar. Оптимізована версія DeepSeek V4 Flash розподіляється між вузлами, після чого система обслуговує запити через OpenAI-сумісний endpoint.
Сумісність із таким API важлива для практичного розгортання. Внутрішні застосунки, AI-агенти та інструменти розробників, які вже підтримують OpenAI-подібні endpoint-и, потенційно можуть підключитися до локальної моделі без повної перебудови інтеграції.
Отже, йдеться не стільки про чат-бота на одному домашньому комп’ютері, скільки про спробу створити приватний AI-сервіс усередині організації.
Однак сама демонстрація не означає, що кластер має характеристики повноцінного серверного рішення для дата-центру. У заявлених матеріалах немає даних про топологію, фактичну пропускну здатність і затримки з’єднання, стратегію шардінгу, точність моделі, формат квантизації, параметри оркестрації або поведінку системи в разі відмови вузла. Усе це може суттєво вплинути на продуктивність, особливо коли модель потребує частого обміну даними між машинами.
Кожен A9 Mega має два слоти M.2 PCIe 4.0 і, за специфікацією, підтримує до 8 ТБ SSD-накопичувачів. Теоретично повністю укомплектований кластер із чотирьох вузлів може мати до 32 ТБ сховища — по 8 ТБ на кожен комп’ютер.
Це окрема характеристика від 512 ГБ системної об’єднаної пам’яті. Вона також не показує, скільки дискового простору фактично потребуватиме конкретне розгортання DeepSeek.
Заявлений канал зв’язку між вузлами — USB4. У матеріалах GEEKOM також вказані порти USB4 зі швидкістю до 40 Гбіт/с. Проте паспортна швидкість інтерфейсу не дорівнює виміряній продуктивності кластера: на результат впливають службові витрати протоколу, топологія та характер обміну даними між вузлами.
GEEKOM позиціонує конфігурацію як локальну приватну AI-платформу. Теоретично організація може зберігати запити, внутрішні документи та відповіді в межах власної мережі, надаючи корпоративним застосункам і агентам доступ до моделі через локальний API.
ROCm у цій схемі виконує роль програмного шару для графіки AMD, тому саме ця конфігурація не потребує системи на базі NVIDIA CUDA.
Такий підхід може зацікавити команди з вимогами до приватності, розміщення даних або ізоляції мережі. Водночас відповідальність переходить до оператора: йому доведеться самостійно забезпечувати доступність обладнання, оновлення, контроль доступу, моніторинг, охолодження, електроживлення та стабільність програмного забезпечення.
GEEKOM вказує ціну A9 Mega на рівні $3 999. Отже, чотири вузли коштуватимуть приблизно $15 996 — ще до витрат на додаткові SSD, кабелі, мережеве обладнання, монтаж, електроенергію, технічну підтримку та обслуговування.
Це значні інвестиції для системи, чиї робочі характеристики у виробничих сценаріях поки не підтверджені незалежно. Оцінювати таке рішення варто не лише за ціною чотирьох міні-ПК, а й за повною вартістю експлуатації розподіленого сервісу та навантаженням, яке він здатен стабільно обслуговувати.
Заява GEEKOM підтверджує, що компанія розгорнула DeepSeek V4 Flash на чотирьох A9 Mega, але не містить незалежних стандартизованих результатів саме для цієї конфігурації.
Немає оприлюднених показників сталої швидкості генерації токенів, часу до першого токена, кількості одночасних користувачів, затримки на довгому контексті, енергоспоживання чи поведінки системи після відмови окремого вузла.
Тому демонстрацію коректніше сприймати як підтвердження можливості розгортання, а не як доведений виробничий бенчмарк. Підтримка контексту до одного мільйона токенів є важливою характеристикою моделі, але сама по собі не доводить, що чотиривузловий A9 Mega-кластер зможе швидко або економно обробляти запити такого масштабу.
Реальна швидкодія залежатиме від версії моделі, точності, розподілу пам’яті, довжини запиту, кількості паралельних звернень і накладних витрат на комунікацію між вузлами.
Платформа Ryzen AI Max+ 395 не є ексклюзивною для GEEKOM. Інші виробники також продають міні-ПК на цьому процесорі, а деякі моделі мають 128 ГБ об’єднаної пам’яті.
Порівнянним рішенням є Minisforum N5 Max, хоча, за даними ServeTheHome, серійна версія цієї моделі постачається з 64 ГБ розпаяної LPDDR5X-пам’яті, тоді як у ранньому прототипі було показано 128 ГБ.
Отже, головною відмінністю GEEKOM є не сам процесор, а заявлена демонстрація роботи програмного кластера з чотирьох вузлів. Чи матиме цей підхід практичну цінність за межами технічної демонстрації, залежатиме від деталей, які поки не опубліковані: відтворюваної інструкції зі встановлення, стандартизованих тестів, вимірювань мережі, даних про енергоспоживання та доказів стабільної роботи під реальним навантаженням.
GEEKOM показала компактний спосіб зібрати великопам’ятну AMD-платформу для інференсу з чотирьох міні-ПК: 64 ядра CPU, 128 потоків, 160 обчислювальних блоків Radeon 8060S і 512 ГБ об’єднаної пам’яті, з’єднаних через USB4 та керованих за допомогою Ubuntu, ROCm і DwarfStar.
Практична обіцянка — локальний і приватний доступ до великої mixture-of-experts-моделі через знайомий API. Але наявні матеріали підтверджують факт розгортання, а не його швидкість, ефективність чи готовність до промислової експлуатації.
Поки GEEKOM не оприлюднить відтворювані бенчмарки та технічні деталі реалізації, цей кластер варто сприймати як цікавий локальний експеримент, а не як доведену заміну спеціалізованій AI-інфраструктурі.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GEEKOM показала DeepSeek V4 Flash, що працює на чотирьох A9 Mega без хмарної інференс інфраструктури: разом вони мають 64 ядра CPU, 128 потоків, 160 обчислювальних блоків Radeon 8060S і 512 ГБ об’єднаної пам’яті LPDDR...
GEEKOM показала DeepSeek V4 Flash, що працює на чотирьох A9 Mega без хмарної інференс інфраструктури: разом вони мають 64 ядра CPU, 128 потоків, 160 обчислювальних блоків Radeon 8060S і 512 ГБ об’єднаної пам’яті LPDDR... Вузли з’єднані через USB4, а для локального розгортання заявлені Ubuntu, AMD ROCm і DwarfStar.
За ціною GEEKOM у $3 999 за один A9 Mega чотири системи коштують приблизно $15 996 — без урахування додаткових накопичувачів, кабелів, мережевого обладнання, електроенергії та обслуговування.