GEEKOM har demonstrert DeepSeek V4 Flash på fire A9 Mega min PC er uten skybasert inferens. Maskinene er koblet sammen over USB4 og bruker Ubuntu, AMD ROCm og DwarfStar til å fordele modellen og tilby et OpenAI kompatibelt endepunkt for lokale applikasjoner.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GEEKOM har demonstrert DeepSeek V4 Flash som en distribuert, lokal AI-tjeneste på fire A9 Mega-min PC-er. Maskinene skal være koblet sammen over USB4, mens Ubuntu, AMD ROCm og DwarfStar håndterer den lokale utrullingen og gjør resultatet tilgjengelig gjennom et OpenAI-kompatibelt API. GEEKOM fremstiller løsningen som et alternativ til å sende spørsmål og dokumenter til skyinfrastruktur.
Det er en oppsiktsvekkende demonstrasjon fordi DeepSeek V4 Flash beskrives som en Mixture-of-Experts-modell med rundt 284 milliarder parametere, hvor omtrent 13 milliarder er aktive for hvert token. Modellen er dessuten laget for kontekstvinduer på opptil én million token.
Hver A9 Mega er bygget rundt AMD Ryzen AI Max+ 395, en prosessor med 16 kjerner og 32 tråder, sammen med Radeon 8060S-grafikk. Samlet får de fire systemene følgende spesifikasjoner:
Unified memory er sentralt i denne løsningen. I stedet for å bruke ett separat grafikkort med nok minne til å holde hele den distribuerte modellen, fordeles arbeidsbelastningen på minnet og grafikkressursene i flere maskiner.
Det er likevel viktig å ikke lese 512 GB som ren, tilgjengelig modellkapasitet. Hvor mye som faktisk kan brukes til modellvekter, runtime-overhead, cacher og operativsystemet, avhenger blant annet av presisjon, kvantisering og programvareoppsett.
Ifølge GEEKOM kommuniserer de fire maskinene over USB4 og bruker en programvarestakk bestående av Ubuntu, AMDs ROCm-plattform og DwarfStar. En optimalisert versjon av DeepSeek V4 Flash deles opp mellom nodene, som deretter håndterer forespørsler gjennom et OpenAI-kompatibelt endepunkt.
API-kompatibiliteten kan gjøre løsningen enklere å ta i bruk. Interne applikasjoner, agenter og utviklerverktøy som allerede støtter OpenAI-lignende endepunkter, kan i prinsippet koble seg til den lokale modellen uten at hele integrasjonen må bygges på nytt.
Dette handler dermed mindre om å kjøre en chatbot på én stasjonær PC, og mer om å sette opp en privat AI-tjeneste i virksomhetens eget miljø.
Demonstrasjonen betyr imidlertid ikke at klyngen har samme egenskaper som en tradisjonell server i et datasenter. Kunngjøringen oppgir ikke topologi, faktisk båndbredde, forsinkelse, sharding-strategi, modellpresisjon, kvantiseringsformat, orkestreringsinnstillinger eller hvordan feil håndteres. Slike detaljer kan påvirke inferensytelsen betydelig, særlig når modellparallell kjøring krever hyppig kommunikasjon mellom nodene.
Hver A9 Mega har to M.2-spor for PCIe 4.0 og er spesifisert for opptil 8 TB SSD-lagring. En komplett installasjon med fire maskiner kan dermed teoretisk få opptil 32 TB lagring, dersom alle systemene utstyres til maksimal kapasitet.
Dette er separat fra de 512 GB med unified memory. Lagringstallet sier heller ikke hvor mye diskplass selve DeepSeek-installasjonen krever.
Den rapporterte forbindelsen mellom nodene er USB4. GEEKOM oppgir også USB4-porter på A9 Mega med hastigheter på opptil 40 Gbit/s. Disse grensesnittallene kan ikke uten videre brukes som mål på klyngens faktiske ytelse. Protokolloverhead, topologi og måten programvaren kommuniserer på, avgjør hvilken båndbredde og forsinkelse den distribuerte inferensen faktisk får.
GEEKOM posisjonerer løsningen som en lokal, privat AI-plattform. I prinsippet kan en virksomhet beholde spørsmål, interne dokumenter og genererte svar i sitt eget nettverk, samtidig som applikasjoner og AI-agenter bruker modellen via det lokale API-et.
ROCm tilbyr programvarelaget for AMD-grafikken, slik at akkurat denne konstruksjonen ikke er avhengig av et NVIDIA-system med CUDA.
Dette kan være interessant for virksomheter med krav til datalagring, personvern eller isolerte nettverk. Samtidig flyttes mer av ansvaret over på operatøren. Virksomheten må selv håndtere tilgjengelighet, oppdateringer, modellfiler, tilgangskontroll, overvåking, kjøling, strømforbruk og programvarefeil.
GEEKOM oppgir en pris på 3 999 dollar for én A9 Mega. Fire noder koster dermed rundt 15 996 dollar, før eventuell ekstra lagring, kabling, nettverksutstyr, installasjon, strøm, vedlikehold og support.
Det er en betydelig investering for en løsning hvor produksjonsegenskapene ennå ikke er uavhengig dokumentert. Den relevante sammenligningen er derfor ikke bare innkjøpsprisen for fire min PC-er, men den totale kostnaden ved å drifte en distribuert inferenstjeneste – og hvilke arbeidsbelastninger den faktisk kan håndtere pålitelig.
GEEKOMs kunngjøring viser at selskapet har distribuert DeepSeek V4 Flash på fire A9 Mega-systemer. Den inneholder imidlertid ingen uavhengige, standardiserte resultater for akkurat denne konfigurasjonen.
Det mangler blant annet tall for:
Demonstrasjonen bør derfor foreløpig forstås som et bevis på at løsningen kan settes opp, ikke som en verifisert produksjonsbenchmark. At modellen støtter én million token i kontekst, betyr heller ikke at en fire-noders A9 Mega-klynge kan behandle slike forespørsler raskt eller kostnadseffektivt.
Den reelle ytelsen vil avhenge av modellversjon, presisjon, minnefordeling, promptlengde, antall samtidige forespørsler og kommunikasjonskostnaden mellom nodene.
Ryzen AI Max+ 395-plattformen er ikke eksklusiv for GEEKOM. Flere leverandører selger min PC-er med samme prosessor, og noen tilbyr også 128 GB unified memory.
Minisforum N5 Max er et sammenlignbart eksempel. ServeTheHome rapporterte imidlertid at butikkversjonen ble levert med 64 GB loddet LPDDR5X-unified memory, ikke 128 GB-konfigurasjonen som ble vist i en tidligere prototype.
GEEKOMs viktigste særpreg er derfor den påståtte demonstrasjonen av programvare for fire noder – ikke selve prosessoren. Om løsningen har verdi utover en teknisk presentasjon, vil avhenge av detaljer som fortsatt ikke er offentliggjort: reproduserbare oppsettsinstruksjoner, standardiserte tester, målinger av nettverket, strømdata og dokumentasjon på stabil drift under realistiske arbeidsbelastninger.
GEEKOM viser en kompakt måte å bygge en AMD-basert inferensplattform med mye minne på: fire min PC-er med til sammen 64 CPU-kjerner, 128 tråder, 160 Radeon 8060S Compute Units og 512 GB unified memory, koblet sammen over USB4 og administrert med Ubuntu, ROCm og DwarfStar.
Det mest interessante er løftet om lokal og privat tilgang til en svært stor Mixture-of-Experts-modell gjennom et kjent API. Men dokumentasjonen støtter foreløpig at utrullingen eksisterer – ikke at vi kan konkludere om hastighet, effektivitet eller produksjonsmodenhet.
Før GEEKOM publiserer reproduserbare benchmarkresultater og flere tekniske detaljer, er det mest presist å se klyngen som en interessant lokal AI-demonstrasjon, ikke som en dokumentert erstatning for dedikert AI-infrastruktur.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GEEKOM har demonstrert DeepSeek V4 Flash på fire A9 Mega min PC er uten skybasert inferens.
GEEKOM har demonstrert DeepSeek V4 Flash på fire A9 Mega min PC er uten skybasert inferens. Maskinene er koblet sammen over USB4 og bruker Ubuntu, AMD ROCm og DwarfStar til å fordele modellen og tilby et OpenAI kompatibelt endepunkt for lokale applikasjoner.
Med en oppgitt pris på 3 999 dollar per A9 Mega koster fire noder rundt 15 996 dollar, før ekstra lagring, kabler, nettverksutstyr, installasjon og drift.