GEEKOM demostró DeepSeek V4 Flash funcionando en cuatro mini PC A9 Mega sin depender de inferencia en la nube: en conjunto ofrecen 64 núcleos de CPU, 128 hilos, 160 unidades de cómputo Radeon 8060S y 512 GB de memoria... Los nodos se conectaron mediante USB4 y utilizaron Ubuntu, AMD ROCm y DwarfStar para distribuir...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GEEKOM ha mostrado un clúster de inferencia distribuida formado por cuatro mini PC A9 Mega capaces de ejecutar DeepSeek V4 Flash de manera local. Los equipos se conectan entre sí mediante USB4 y utilizan Ubuntu, la plataforma ROCm de AMD y el software DwarfStar para repartir el modelo entre los nodos y ofrecer el resultado a través de una API compatible con OpenAI.
La propuesta busca evitar que las consultas, los documentos internos y las respuestas tengan que enviarse a una infraestructura en la nube. En lugar de un único servidor tradicional, GEEKOM plantea una pequeña plataforma de IA instalada en las propias dependencias de una organización.
DeepSeek V4 Flash se describe como un modelo de tipo mixture of experts (MoE) de aproximadamente 284.000 millones de parámetros, aunque activa alrededor de 13.000 millones por token. También está diseñado para admitir ventanas de contexto de hasta un millón de tokens.
Ese tamaño explica el interés de la demostración: la memoria total de varios equipos puede utilizarse para distribuir el modelo y sus recursos de ejecución. No obstante, los 512 GB anunciados no equivalen automáticamente a 512 GB disponibles para los pesos del modelo. La capacidad útil depende de la precisión empleada, la cuantización, las cachés, la sobrecarga del tiempo de ejecución y la memoria que necesite el sistema operativo.
Cada A9 Mega integra un AMD Ryzen AI Max+ 395 con 16 núcleos y 32 hilos, acompañado de gráficos Radeon 8060S basados en la arquitectura RDNA 3.5. Al sumar los cuatro ordenadores, el clúster alcanza:
La memoria unificada es una pieza clave del diseño. CPU y GPU pueden compartir el mismo espacio de memoria, mientras que la carga se distribuye entre los cuatro sistemas. Aun así, la cifra agregada no permite saber por sí sola qué modelos, formatos de precisión o longitudes de contexto podrá manejar el conjunto en condiciones reales.
Según GEEKOM, Ubuntu, ROCm y DwarfStar se encargan de ejecutar la versión optimizada de DeepSeek V4 Flash y dividirla entre los cuatro nodos. El servicio resultante se expone mediante un punto de acceso compatible con la API de OpenAI.
Esta compatibilidad puede simplificar la integración con aplicaciones internas, agentes y herramientas de desarrollo que ya trabajan con endpoints de estilo OpenAI. Por eso, el objetivo no parece ser únicamente ejecutar un chatbot en un ordenador de sobremesa, sino ofrecer un servicio privado de IA dentro de la red de una empresa.
La demostración, sin embargo, no convierte automáticamente el clúster en un sustituto de un servidor de centro de datos. El anuncio no detalla la topología, el ancho de banda efectivo, la latencia, la estrategia de particionado, la precisión del modelo, el formato de cuantización, la orquestación ni el comportamiento ante fallos. Todos esos factores pueden influir de forma decisiva en la inferencia distribuida, especialmente cuando los nodos tienen que intercambiar datos con frecuencia.
La conexión entre equipos se realiza mediante USB4. El material del producto de GEEKOM también indica que el A9 Mega incorpora puertos USB4 de hasta 40 Gb/s.
Esa cifra corresponde a la velocidad nominal de la interfaz, no al rendimiento medido del clúster. El protocolo, la topología física, la sobrecarga de comunicación y el patrón de intercambio del software determinan el ancho de banda y la latencia que realmente quedan disponibles para el modelo.
Cada A9 Mega dispone de dos ranuras M.2 PCIe 4.0 y admite hasta 8 TB de almacenamiento SSD. Si los cuatro nodos se configurasen con la capacidad máxima, el conjunto podría alcanzar teóricamente 32 TB de almacenamiento.
Ese dato es independiente de los 512 GB de memoria unificada y tampoco indica cuánto espacio ocuparía exactamente la instalación de DeepSeek V4 Flash. El tamaño final dependería del modelo utilizado, su precisión, la cuantización y los archivos auxiliares necesarios para ponerlo en funcionamiento.
GEEKOM presenta el sistema como una solución de IA privada on-premises, es decir, instalada y administrada dentro de la propia organización. En principio, esto permitiría mantener las consultas, los documentos y las respuestas dentro de la red corporativa, mientras las aplicaciones internas acceden al modelo mediante la API local.
El uso de ROCm también sitúa el proyecto dentro del ecosistema de aceleración de AMD, sin plantear como requisito una plataforma basada en NVIDIA y CUDA.
Este enfoque puede resultar interesante para empresas con requisitos de privacidad, residencia de datos o aislamiento de red. A cambio, la responsabilidad pasa al operador: tendrá que encargarse de las actualizaciones, los modelos, los controles de acceso, la supervisión, la refrigeración, el consumo eléctrico, la disponibilidad del hardware y la fiabilidad del software.
GEEKOM fija el precio del A9 Mega en 3.999 dólares. Comprar cuatro unidades eleva el coste de los equipos a aproximadamente 15.996 dólares.
La cifra no incluye ampliaciones de almacenamiento, cableado, equipos de red, instalación, electricidad, mantenimiento ni soporte. Por tanto, la comparación con un servidor de IA no debería limitarse al precio de compra de los cuatro mini PC: también habría que valorar el coste total de operar un servicio de inferencia distribuida y la carga de trabajo que puede sostener de forma fiable.
El anuncio demuestra que GEEKOM ha desplegado DeepSeek V4 Flash en cuatro A9 Mega, pero no aporta resultados independientes y estandarizados para esta configuración concreta. No se publican cifras de tokens por segundo sostenidos, tiempo hasta el primer token, número de usuarios simultáneos, latencia con contextos largos, consumo eléctrico ni comportamiento ante fallos.
Por eso, lo presentado debe interpretarse como una demostración técnica del despliegue, no como una prueba de rendimiento validada para producción. Que DeepSeek V4 Flash admita contextos de hasta un millón de tokens no significa que este clúster pueda procesar solicitudes de esa longitud con rapidez o de forma económica.
El resultado real dependería de la versión del modelo, la precisión, la asignación de memoria, la longitud de las instrucciones, el número de solicitudes simultáneas y el coste de las comunicaciones entre nodos. Hasta que GEEKOM publique instrucciones reproducibles y mediciones verificables, no es posible determinar si la propuesta compite con soluciones de IA dedicadas.
El Ryzen AI Max+ 395 también aparece en mini PC de otros fabricantes, algunos con 128 GB de memoria unificada. Minisforum, por ejemplo, ofrece diseños comparables como el N5 Max. Sin embargo, ServeTheHome señaló que la versión comercial del N5 Max se distribuyó con 64 GB de LPDDR5X unificada soldada, frente a los 128 GB del prototipo mostrado anteriormente.
En consecuencia, la principal diferencia de GEEKOM no sería el procesador por sí solo, sino la demostración de un despliegue distribuido de cuatro nodos. Su utilidad más allá del escaparate técnico dependerá de que se publiquen detalles como la configuración reproducible, las mediciones de red, el consumo, las pruebas estandarizadas y la estabilidad bajo cargas de trabajo realistas.
El experimento de GEEKOM presenta una forma compacta de construir una plataforma de inferencia AMD de gran capacidad combinando cuatro mini PC: 64 núcleos de CPU, 128 hilos, 160 unidades de cómputo Radeon 8060S y 512 GB de memoria unificada, conectados mediante USB4 y gestionados con Ubuntu, ROCm y DwarfStar.
La promesa es atractiva: ejecutar localmente un modelo MoE de gran tamaño y ofrecerlo a aplicaciones internas mediante una API conocida, sin enviar los datos a la nube. Pero las pruebas disponibles respaldan la existencia del despliegue, no una conclusión sobre su velocidad, eficiencia o preparación para producción.
Hasta que aparezcan benchmarks reproducibles y más información sobre la implementación, el clúster de cuatro A9 Mega debe considerarse una demostración técnica interesante, no un reemplazo demostrado para la infraestructura de IA dedicada.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
GEEKOM demostró DeepSeek V4 Flash funcionando en cuatro mini PC A9 Mega sin depender de inferencia en la nube: en conjunto ofrecen 64 núcleos de CPU, 128 hilos, 160 unidades de cómputo Radeon 8060S y 512 GB de memoria...
GEEKOM demostró DeepSeek V4 Flash funcionando en cuatro mini PC A9 Mega sin depender de inferencia en la nube: en conjunto ofrecen 64 núcleos de CPU, 128 hilos, 160 unidades de cómputo Radeon 8060S y 512 GB de memoria... Los nodos se conectaron mediante USB4 y utilizaron Ubuntu, AMD ROCm y DwarfStar para distribuir el modelo y ofrecer un punto de acceso compatible con la API de OpenAI a aplicaciones locales.
Al precio anunciado de 3.999 dólares por A9 Mega, los cuatro equipos suman unos 15.996 dólares, sin contar almacenamiento adicional, cableado, instalación, consumo eléctrico ni soporte.