A GEEKOM demonstrou o DeepSeek V4 Flash rodando em quatro A9 Mega, sem inferência na nuvem: o conjunto soma 64 núcleos de CPU, 128 threads, 160 Compute Units Radeon 8060S e 512 GB de memória unificada LPDDR5X 8000. Os nós foram conectados por USB4 e usaram Ubuntu, AMD ROCm e DwarfStar para distribuir o modelo e disp...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
A GEEKOM demonstrou um cluster de inferência distribuída, instalado localmente, formado por quatro mini PCs A9 Mega para executar o DeepSeek V4 Flash. As máquinas foram conectadas por USB4, enquanto Ubuntu, a plataforma AMD ROCm e o software DwarfStar cuidaram da implantação local e da distribuição do modelo. O resultado é disponibilizado por uma API compatível com a OpenAI, sem depender do envio de prompts e documentos para uma infraestrutura de nuvem.
A proposta chama atenção pelo tamanho do modelo. O DeepSeek V4 Flash é descrito como um modelo de mistura de especialistas, ou MoE, com aproximadamente 284 bilhões de parâmetros — embora cerca de 13 bilhões sejam ativados a cada token. Ele também foi projetado para janelas de contexto de até 1 milhão de tokens.
Cada A9 Mega usa o processador AMD Ryzen AI Max+ 395, com 16 núcleos e 32 threads, acompanhado pelos gráficos Radeon 8060S. Somados, os quatro computadores oferecem:
A memória unificada é um dos pontos centrais da ideia. Em vez de colocar todo o modelo em um único acelerador dedicado com memória suficiente, o cluster divide a carga entre os recursos de memória e de processamento gráfico das quatro máquinas.
Ainda assim, os 512 GB não devem ser interpretados como capacidade livre para os pesos do modelo. O espaço efetivamente disponível depende da precisão numérica, da quantização, dos caches, da sobrecarga do ambiente de execução e do sistema operacional.
Segundo a GEEKOM, os quatro computadores se comunicam por USB4 e usam uma combinação de Ubuntu, ROCm e DwarfStar. O modelo otimizado do DeepSeek V4 Flash é particionado entre os nós, que atendem às solicitações por um endpoint compatível com a API da OpenAI.
Essa compatibilidade pode facilitar a integração. Aplicações internas, agentes e ferramentas de desenvolvimento que já aceitam endpoints no padrão OpenAI poderiam se conectar ao modelo local sem que toda a camada de integração precisasse ser refeita.
Na prática, portanto, a proposta está menos ligada a executar um chatbot em um único desktop e mais à criação de um serviço privado de IA dentro da própria organização.
A demonstração, porém, não significa que o cluster tenha as mesmas características de um servidor convencional de data center. O anúncio não informa a topologia da conexão, a largura de banda efetiva, a latência, a estratégia de particionamento, a precisão do modelo, o formato de quantização, as configurações de orquestração ou o comportamento em caso de falha. Esses fatores podem alterar bastante o desempenho, especialmente quando o processamento paralelo exige comunicação frequente entre os nós.
Cada A9 Mega tem dois slots M.2 PCIe 4.0 e é especificado para até 8 TB de armazenamento SSD. Se todos os quatro computadores forem configurados no limite anunciado, a instalação poderia chegar teoricamente a 32 TB de armazenamento.
Esse número é separado dos 512 GB de memória unificada do sistema. Ele também não informa quanto espaço a implantação do DeepSeek ocupa no SSD, já que isso depende da versão do modelo, da precisão e dos arquivos auxiliares utilizados.
A conexão entre os nós é feita por USB4. O material do produto também lista portas USB4 com velocidade de até 40 Gb/s. Essa especificação da interface não equivale ao desempenho medido do cluster: a velocidade disponível para a inferência distribuída depende da sobrecarga do protocolo, da topologia e do padrão de comunicação adotado pelo software.
A GEEKOM posiciona o conjunto como uma solução de IA privada on-premises — isto é, instalada e operada dentro da infraestrutura da própria empresa. Em tese, prompts, documentos internos e respostas geradas poderiam permanecer na rede da organização, enquanto aplicações e agentes acessariam o modelo pela API local.
O ROCm fornece a camada de software para o hardware gráfico da AMD, sem exigir uma infraestrutura baseada em NVIDIA CUDA neste projeto específico.
Esse formato pode interessar a equipes com exigências de privacidade, residência de dados ou isolamento de rede. Por outro lado, a responsabilidade também muda de mãos: o operador precisa cuidar da disponibilidade do hardware, atualizações, arquivos do modelo, controle de acesso, monitoramento, refrigeração, consumo de energia e confiabilidade do software.
A GEEKOM lista o A9 Mega por US$ 3.999. Quatro unidades chegam, portanto, a aproximadamente US$ 15.996, antes de considerar armazenamento além da configuração incluída, cabos, equipamentos de rede, instalação, energia, manutenção e suporte.
É um investimento considerável para uma configuração cuja operação em produção ainda não foi validada de forma independente. A comparação correta não é apenas com o preço de quatro mini PCs, mas com o custo total de manter um serviço distribuído de inferência e com a carga de trabalho que ele consegue sustentar de maneira confiável.
O anúncio da GEEKOM mostra que a empresa implantou o DeepSeek V4 Flash em quatro A9 Mega, mas não apresenta resultados independentes e padronizados para essa configuração exata.
Não foram divulgados números de tokens por segundo em operação sustentada, tempo até o primeiro token, quantidade de usuários simultâneos, latência com contexto longo, consumo de energia ou comportamento diante de falhas.
Por isso, a demonstração deve ser vista como uma prova de implantação, e não como um benchmark de produção validado. A capacidade de trabalhar com até 1 milhão de tokens de contexto é uma especificação importante, mas não prova que o cluster consiga processar solicitações desse tamanho de forma rápida ou econômica.
O desempenho real dependeria da compilação do modelo, da precisão, da alocação de memória, do tamanho do prompt, do número de solicitações simultâneas e da sobrecarga de comunicação entre os computadores.
A plataforma Ryzen AI Max+ 395 não é exclusiva da GEEKOM. Outros fabricantes também vendem mini PCs com o mesmo processador e, em alguns casos, 128 GB de memória unificada.
O Minisforum N5 Max é um projeto comparável. No entanto, segundo a ServeTheHome, a versão comercial foi lançada com 64 GB de memória unificada LPDDR5X soldada, e não com os 128 GB vistos em um protótipo anterior.
Isso faz com que o diferencial mais relevante da GEEKOM seja a demonstração de software em quatro nós — e não o processador isoladamente. Para saber se a abordagem vai além de uma vitrine técnica, ainda seriam necessários instruções reproduzíveis de configuração, benchmarks padronizados, medições de rede, dados de consumo e evidências de operação estável em cargas realistas.
O experimento da GEEKOM mostra uma forma compacta de montar uma plataforma AMD de inferência com muita memória: quatro mini PCs que, juntos, somam 64 núcleos de CPU, 128 threads, 160 Compute Units Radeon 8060S e 512 GB de memória unificada, conectados por USB4 e administrados com Ubuntu, ROCm e DwarfStar.
A promessa é oferecer acesso local e privado a um modelo MoE de grande porte por meio de uma API familiar. Mas as evidências disponíveis confirmam a existência da implantação, não sua velocidade, eficiência ou prontidão para uso em produção.
Até que a GEEKOM publique benchmarks reproduzíveis e mais detalhes da implementação, o cluster deve ser entendido como uma demonstração on-premises interessante — e não como um substituto comprovado para uma infraestrutura dedicada de IA.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A GEEKOM demonstrou o DeepSeek V4 Flash rodando em quatro A9 Mega, sem inferência na nuvem: o conjunto soma 64 núcleos de CPU, 128 threads, 160 Compute Units Radeon 8060S e 512 GB de memória unificada LPDDR5X 8000.
A GEEKOM demonstrou o DeepSeek V4 Flash rodando em quatro A9 Mega, sem inferência na nuvem: o conjunto soma 64 núcleos de CPU, 128 threads, 160 Compute Units Radeon 8060S e 512 GB de memória unificada LPDDR5X 8000. Os nós foram conectados por USB4 e usaram Ubuntu, AMD ROCm e DwarfStar para distribuir o modelo e disponibilizá lo por meio de uma API compatível com a OpenAI.
Com preço listado de US$ 3.999 por A9 Mega, os quatro sistemas custam cerca de US$ 15.996, antes de armazenamento adicional, cabeamento, implantação e suporte.