De optelsom van 512 GB mag echter niet worden gelezen als 512 GB die volledig beschikbaar is voor de modelgewichten. Hoeveel ruimte overblijft voor model, runtime, caches en besturingssysteem hangt af van onder meer de gebruikte precisie, kwantisatie en softwareconfiguratie.
Volgens GEEKOM communiceren de vier machines via USB4 en bestaat de softwarestack uit Ubuntu, AMD ROCm en DwarfStar. Een geoptimaliseerde versie van DeepSeek V4 Flash wordt over de nodes verdeeld, waarna de cluster verzoeken afhandelt via een OpenAI-compatibel endpoint.
Die API-compatibiliteit kan de ingebruikname vereenvoudigen. Interne applicaties, agents en ontwikkelaarstools die al met OpenAI-achtige endpoints overweg kunnen, zouden zo verbinding kunnen maken met het lokale model zonder dat de volledige integratielaag opnieuw moet worden gebouwd.
Het gaat daarmee minder om een chatbot die op één desktop draait en meer om een private AI-dienst binnen de eigen IT-omgeving van een organisatie.
De demonstratie zegt nog niets over de eigenschappen van een conventionele AI-server. GEEKOM maakt in de aankondiging niet bekend welke netwerktopologie, effectieve bandbreedte, latency, shardingstrategie, modelprecisie, kwantisatie-indeling, orkestratie-instellingen of foutafhandeling wordt gebruikt. Dat zijn geen details in de marge: vooral bij modelparallelisme kan de communicatie tussen nodes de uiteindelijke prestaties sterk beïnvloeden.
Elke A9 Mega heeft twee M.2-slots voor PCIe 4.0-ssd’s en wordt gespecificeerd voor maximaal 8 TB opslag. Als alle vier de systemen volledig worden uitgerust, komt het theoretische maximum daarmee uit op 32 TB.
Die opslagcapaciteit staat los van de 512 GB unified memory. Ze zegt bovendien niet hoeveel schijfruimte de DeepSeek-installatie zelf nodig heeft.
De verbinding tussen de nodes verloopt volgens GEEKOM via USB4. In de productspecificaties worden USB4-poorten met een snelheid tot 40 Gbit/s genoemd. Die maximale interfacesnelheid is niet hetzelfde als de gemeten snelheid van de AI-cluster. Protocoloverhead, de gekozen topologie en het communicatiepatroon van de software bepalen hoeveel bandbreedte en welke latency in de praktijk beschikbaar zijn.
GEEKOM positioneert de opstelling als een on-premises private-AI-apparaat. Organisaties zouden prompts, interne documenten en gegenereerde antwoorden binnen hun eigen netwerk kunnen houden, terwijl bedrijfsapplicaties en agents het model via de lokale API gebruiken. ROCm vormt daarbij de softwarelaag voor AMD-graphics, zonder dat deze specifieke configuratie op NVIDIA CUDA hoeft te draaien.
Dat kan interessant zijn voor organisaties met eisen rond gegevenslocatie, privacy of netwerkisolatie. De verantwoordelijkheid verschuift daarmee wel naar de beheerder. Die moet zelf zorgen voor hardwarebeschikbaarheid, updates, modelbestanden, toegangsbeheer, monitoring, koeling, stroomverbruik en softwarebetrouwbaarheid.
GEEKOM vermeldt een prijs van 3.999 dollar voor één A9 Mega. Vier nodes kosten daarmee ongeveer 15.996 dollar. Daar komen eventuele opslaguitbreidingen, bekabeling, netwerkapparatuur, installatie, elektriciteit, onderhoud en ondersteuning nog bij.
Dat is een aanzienlijke investering voor een systeem waarvan de productiekarakteristieken nog niet onafhankelijk zijn vastgesteld. De relevante vergelijking is daarom niet alleen de aanschafprijs van vier mini-pc’s, maar de totale kosten van een gedistribueerde inferentiedienst en de werklast die die dienst betrouwbaar kan verwerken.
De aankondiging laat zien dat GEEKOM DeepSeek V4 Flash op vier A9 Mega-systemen heeft geïmplementeerd. Er zijn echter geen onafhankelijke, gestandaardiseerde resultaten aangeleverd voor precies deze configuratie.
Cijfers over aanhoudende tokens per seconde, tijd tot het eerste token, gelijktijdige gebruikers, latency bij lange contexten, energieverbruik en gedrag bij uitval ontbreken. Ook wordt niet uitgelegd hoe de cluster zich houdt wanneer meerdere verzoeken tegelijk binnenkomen.
De demonstratie moet daarom voorlopig worden gezien als bewijs dat de implementatie bestaat, niet als een gevalideerde productbenchmark. Dat DeepSeek V4 Flash contextvensters tot één miljoen tokens ondersteunt, betekent niet automatisch dat deze vier-node-cluster verzoeken van één miljoen tokens snel of betaalbaar kan verwerken. De werkelijke prestaties hangen af van de modelbuild, precisie, geheugenverdeling, promptlengte, het aantal gelijktijdige verzoeken en de communicatie-overhead tussen de nodes.
De Ryzen AI Max+ 395 is niet exclusief voor GEEKOM. Ook andere fabrikanten verkopen mini-pc’s met dezelfde processor en soms 128 GB unified memory. De Minisforum N5 Max is een vergelijkbaar ontwerp. ServeTheHome meldde echter dat de retailversie met 64 GB gesoldeerd LPDDR5X-unified memory werd geleverd, in plaats van de 128GB-configuratie die in een eerder prototype te zien was.
De belangrijkste onderscheidende factor van GEEKOM is daarom niet de processor op zichzelf, maar de geclaimde softwarematige demonstratie met vier nodes. Of die aanpak meer is dan een technisch visitekaartje, hangt af van informatie die nog niet is gepubliceerd: reproduceerbare installatie-instructies, gestandaardiseerde benchmarks, metingen van de verbinding, energiegegevens en bewijs van stabiele werking onder realistische werklasten.
GEEKOM laat zien hoe vier compacte AMD-mini-pc’s samen een platform met veel geheugen kunnen vormen voor lokale AI-inferentie: 64 CPU-cores, 128 threads, 160 Radeon 8060S Compute Units en 512 GB unified memory, verbonden via USB4 en beheerd met Ubuntu, ROCm en DwarfStar.
De belofte is duidelijk: organisaties zouden een zeer groot mixture-of-experts-model lokaal en privé kunnen benaderen via een vertrouwde API. De beschikbare informatie onderbouwt op dit moment echter vooral het bestaan van de implementatie, niet de snelheid, efficiëntie of productierijpheid ervan.
Tot GEEKOM reproduceerbare benchmarks en meer details over de implementatie publiceert, is de cluster het best te beschouwen als een interessante on-premises demonstratie — en nog niet als bewezen vervanging voor gespecialiseerde AI-infrastructuur.