GEEKOM har demonstrerat DeepSeek V4 Flash körandes över fyra A9 Mega mini pc:er utan molninferens. Noderna kopplas samman via USB4 och använder enligt uppgift Ubuntu, AMD ROCm och DwarfStar för att fördela modellen och exponera ett OpenAI kompatibelt API för lokala applikationer.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GEEKOM har demonstrerat en lokal inferenslösning där fyra A9 Mega-mini-pc:er tillsammans kör DeepSeek V4 Flash. Datorerna kopplas samman via USB4 och använder Ubuntu, AMD:s ROCm-plattform samt programvaran DwarfStar för att hantera den distribuerade installationen. Resultatet exponeras genom ett OpenAI-kompatibelt API, så att befintliga interna applikationer och AI-agenter kan ansluta utan att hela integrationslagret behöver byggas om.
Tanken är att företag ska kunna behandla frågor, dokument och genererade svar i den egna miljön i stället för att skicka informationen till en molntjänst. Det gör klustret mer till en kompakt, lokal AI-server än till fyra vanliga skrivbordsdatorer.
DeepSeek V4 Flash beskrivs som en mixture-of-experts-modell med omkring 284 miljarder parametrar. Eftersom modellen bara aktiverar cirka 13 miljarder parametrar per token kan den vara effektivare än den totala parameterstorleken först antyder. Den är dessutom utformad för kontextfönster på upp till en miljon tokens.
Enligt GEEKOMs demonstration fördelas den optimerade modellen över de fyra noderna. Det innebär dock inte att klustret automatiskt får samma egenskaper som en traditionell server med en gemensam höghastighetsaccelerator. Hur väl lösningen fungerar beror bland annat på modellens precision och kvantisering, hur arbetet delas upp samt hur snabbt noderna kan kommunicera med varandra.
Varje A9 Mega bygger på AMD Ryzen AI Max+ 395, en processor med 16 kärnor och 32 trådar, tillsammans med Radeon 8060S-grafik. Fyra identiska system ger på pappret följande sammanlagda specifikationer:
Det delade minnet mellan CPU och grafikdel är centralt för upplägget. I stället för att försöka få plats med hela den distribuerade modellen i ett enda grafikkort använder klustret minnes- och grafikresurserna i flera system.
512 GB är däremot inte samma sak som 512 GB tillgängligt för modellvikter. Operativsystem, körmiljö, cacheminne och annan overhead tar också plats. Den faktiska kapaciteten påverkas av bland annat precision, kvantisering och programvarukonfiguration.
GEEKOM uppger att de fyra maskinerna kommunicerar över USB4 och använder Ubuntu, ROCm och DwarfStar för den lokala driftsättningen. A9 Mega har USB4-portar som anges klara upp till 40 Gbit/s.
Det är viktigt att skilja på den nominella gränssnittshastigheten och den prestanda som faktiskt är tillgänglig för modellkörning. Protokollkostnader, topologi, latens och hur ofta noderna måste utbyta data påverkar den effektiva bandbredden. GEEKOM har inte offentliggjort uppgifter om klustrets exakta nätverkstopologi, uppmätta latens eller orkestreringsinställningar.
Det saknas också detaljer om modellens exakta precision, kvantiseringsformat, shardingstrategi och hur systemet hanterar en nod som fallerar. Sådana uppgifter är avgörande om lösningen ska bedömas som en produktionsplattform och inte bara som en teknisk demonstration.
Varje A9 Mega har två M.2-platser för PCIe 4.0-SSD och anges stödja upp till 8 TB lagring. Om alla fyra datorer utrustas till den maximala kapaciteten blir den teoretiska totalsiffran därför 32 TB.
Detta är separat från de 512 GB systemminne som delas mellan CPU och grafikdel. Lagringssiffran säger inte heller hur mycket utrymme just DeepSeek-installationen kräver, eftersom det beror på modellfiler, format, kvantisering och övrig programvara.
GEEKOM positionerar lösningen som en lokal och privat AI-plattform. Ett företag skulle i princip kunna låta interna system, dokument och AI-agenter använda modellen via det OpenAI-kompatibla API:t, samtidigt som data stannar inom den egna nätverksmiljön. ROCm står för AMD:s programvarustack för grafikberäkningar, vilket innebär att just denna konstruktion inte kräver en NVIDIA-baserad CUDA-plattform.
Det kan vara intressant för verksamheter med krav på datasekretess, nätverksisolering eller kontroll över var information behandlas. Men ansvaret flyttas samtidigt från molnleverantören till organisationen själv. Den som driver klustret måste hantera tillgänglighet, uppdateringar, åtkomstkontroller, övervakning, modellfiler, kylning, energiförbrukning och felsökning.
GEEKOM listar A9 Mega till 3 999 dollar. Fyra datorer kostar därmed cirka 15 996 dollar innan man räknar in eventuella lagringsuppgraderingar, kablage, nätverksutrustning, installation, el, underhåll och support.
Det är en betydande investering för en plattform vars produktionsprestanda ännu inte har verifierats oberoende. Den relevanta kostnaden är därför inte bara inköpspriset, utan även vad det kostar att driva en distribuerad inferenstjänst och vilka arbetslaster den klarar på ett stabilt sätt.
GEEKOMs tillkännagivande visar att DeepSeek V4 Flash har distribuerats över fyra A9 Mega-system. Däremot innehåller det inga oberoende eller standardiserade mätningar för just denna konfiguration.
Det saknas bland annat siffror för:
Stödet räcker därför till att kalla lösningen ett bevis på att driftsättningen är genomförbar – inte till att dra slutsatser om hastighet, effektivitet eller produktionsmognad. Att modellen har stöd för upp till en miljon tokens betyder inte att klustret kan bearbeta miljon-token-frågor snabbt eller kostnadseffektivt.
Den verkliga prestandan påverkas av modellversion, precision, minnesfördelning, promptens längd, antalet samtidiga förfrågningar och kommunikationskostnaden mellan noderna.
Ryzen AI Max+ 395-plattformen är inte unik för GEEKOM. Flera tillverkare säljer mini-pc:er med samma processor och i vissa fall 128 GB enhetligt minne. Minisforums N5 Max är ett jämförbart alternativ, även om den kommersiella versionen enligt ServeTheHome levererades med 64 GB fastlödd LPDDR5X i stället för de 128 GB som fanns i en tidigare prototyp.
GEEKOMs mer intressanta särdrag är därför inte processorn i sig, utan den påstådda demonstrationen med fyra sammankopplade noder. För att visa att upplägget är mer än ett teknikexperiment behövs reproducerbara installationsinstruktioner, standardiserade benchmarkresultat, mätningar av nätverksprestanda, energidata och dokumentation av stabil drift under realistiska arbetslaster.
GEEKOM visar ett kompakt sätt att bygga en AMD-baserad AI-plattform med stort sammanlagt minne. Fyra A9 Mega ger totalt 64 CPU-kärnor, 128 trådar, 160 Radeon 8060S Compute Units och 512 GB enhetligt LPDDR5X-8000-minne. Systemen kopplas samman via USB4 och hanteras med Ubuntu, ROCm och DwarfStar.
Den praktiska lockelsen är tydlig: lokal och potentiellt privat åtkomst till en mycket stor mixture-of-experts-modell via ett välkänt API. Men dagens underlag styrker främst att GEEKOM har fått demonstrationen att fungera – inte att lösningen är snabb, energisnål eller redo att ersätta dedikerad AI-infrastruktur.
Tills företaget publicerar reproducerbara benchmarkresultat och fler tekniska detaljer bör fyrklustret därför ses som en intressant lokal AI-demonstration, snarare än som en bevisad produktionsplattform.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GEEKOM har demonstrerat DeepSeek V4 Flash körandes över fyra A9 Mega mini pc:er utan molninferens.
GEEKOM har demonstrerat DeepSeek V4 Flash körandes över fyra A9 Mega mini pc:er utan molninferens. Noderna kopplas samman via USB4 och använder enligt uppgift Ubuntu, AMD ROCm och DwarfStar för att fördela modellen och exponera ett OpenAI kompatibelt API för lokala applikationer.
Med GEEKOMs listpris på 3 999 dollar per A9 Mega kostar fyra system cirka 15 996 dollar – innan extra lagring, kablage, nätverksutrustning, installation och support.