A Nvidia anunciou em 24 de agosto que o Groq 3 LPX entrou em produção completa. Em um teste da Artificial Analysis, o sistema gerou 3.400 tokens por segundo com o modelo Gemma 4 31B e contexto de 100 mil tokens — dese...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full-production launch of its Groq 3 LPX dedicated AI-inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack-scale accelerator had entered full production as the low-latency, long-context inference component of the Vera Rubin platform. It is intended for rapid token gen. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
A Nvidia anunciou no evento Hot Chips, em 24 de agosto, que seu acelerador de inferência em escala de rack Groq 3 LPX entrou em produção completa. O sistema foi desenvolvido para trabalhar ao lado do Vera Rubin NVL72 e acelerar a geração de tokens — a etapa que mais influencia a rapidez percebida em aplicações interativas de IA. 26
Em um benchmark da Artificial Analysis, o Groq 3 LPX produziu 3.400 tokens de saída por segundo ao executar o modelo aberto Gemma 4 31B com um contexto de 100 mil tokens. O resultado mediano mais preciso foi de 3.431 tokens por segundo, arredondado pela Nvidia em seu anúncio. A companhia afirma que, nesse cenário específico, o sistema foi quatro vezes mais rápido que a plataforma alternativa mais próxima. 1735
O LPX foi projetado para inferência de baixa latência em agentes de IA, assistentes de programação e outros serviços que precisam responder rapidamente mesmo ao lidar com grandes volumes de contexto. A Nvidia o descreve como um acelerador interativo voltado à geração previsível e veloz de tokens. 1926
Para entender a divisão de tarefas, é útil separar duas fases da inferência: prefill e decode. O prefill processa o prompt do usuário e o contexto que o acompanha. Já o decode gera a resposta, normalmente um token por vez.
O Groq 3 LPX é direcionado principalmente à segunda fase. O Vera Rubin NVL72 continua sendo o sistema mais flexível, adequado para treinamento, inferência geral, processamento de contexto e operações de alta vazão. 34
Na prática, a Nvidia apresenta o LPX como complemento — e não como substituto — de sua infraestrutura de GPUs. As GPUs continuam responsáveis pelo processamento acelerado de uso geral, enquanto a arquitetura derivada da Groq é dedicada à parte da inferência em que a latência tem impacto direto na experiência do usuário.
O número divulgado corresponde à mediana de 3.431 tokens de saída por segundo no benchmark de contexto de 100 mil tokens da Artificial Analysis, executado com o Gemma 4 31B. A Nvidia apresentou o resultado arredondado para 3.400 tokens por segundo. 17
A comparação de quatro vezes mais responsividade é uma afirmação específica para o modelo, o tamanho do contexto e a configuração avaliados. Ela não representa uma medida universal de desempenho para todos os modelos ou aplicações de IA. 35
Essa ressalva é importante porque a velocidade de geração de tokens é apenas uma parte do desempenho de um sistema de inferência. O tamanho do modelo, o comprimento do prompt, o número de usuários simultâneos, a memória, a rede e o tempo necessário para processar o contexto inicial também podem alterar a experiência em um serviço real.
A Nebius é a primeira empresa de nuvem de IA anunciada como cliente. A companhia planeja integrar o Groq 3 LPX ao Nebius Token Factory, sua plataforma de inferência em produção, antes do fim de 2026. 2
A própria Groq também afirmou que estará entre os primeiros adotantes. A empresa pretende implantar o LPX ao lado de sistemas Vera Rubin NVL72 em sua nuvem de inferência dedicada. A combinação segue uma lógica clara: o Rubin oferece recursos mais amplos de computação e processamento, enquanto o LPX acelera a geração de tokens em cargas de trabalho com contexto extenso. 18
A Nvidia posicionou o Groq 3 LPX como o sétimo componente principal da plataforma Vera Rubin. Entre os demais está o Vera CPU, que, segundo a empresa, tem 88 núcleos Olympus desenvolvidos sob medida. 33
O Vera CPU é destinado ao trabalho que envolve a execução de agentes de IA, como orquestração, processamento de dados, uso de ferramentas e execução de código. A Nvidia também anunciou que a SpaceXAI planeja usar CPUs Vera em aplicações futuras de IA agêntica e um sistema Vera Rubin NVL72 otimizado em um primeiro satélite de IA Starmind. 40
As iniciativas mostram a estratégia mais ampla da Nvidia: construir “fábricas de IA” com componentes especializados, em vez de tratar toda carga de trabalho como um problema exclusivamente de GPU. Nesse modelo, CPUs coordenam as tarefas dos agentes, GPUs cuidam da computação flexível em larga escala e o LPX se concentra na geração rápida e determinística das respostas.
O lançamento é o resultado mais concreto até agora do acordo firmado pela Nvidia com a Groq em dezembro de 2025. Ainda assim, descrevê-lo simplesmente como uma aquisição da Groq é impreciso.
As informações disponíveis apontam para um licenciamento não exclusivo da tecnologia de inferência da Groq, combinado com a contratação do fundador e CEO Jonathan Ross, do presidente Sunny Madra e de outros funcionários-chave. 48
A Groq continuou operando depois do acordo e posteriormente captou novos recursos, o que é compatível com uma transação envolvendo tecnologia e talentos, e não com a compra integral da empresa operacional. 3
Essa estrutura ajuda a explicar o posicionamento do produto. A Nvidia incorporou a tecnologia de processamento de linguagem da Groq a uma plataforma própria em escala de rack, enquanto a Groq segue como empresa independente e planeja usar o hardware resultante em sua nuvem.
O anúncio não é apenas o lançamento de mais um chip de IA. Ele mostra a Nvidia separando as diferentes etapas da prestação de serviços de IA e destinando a mais sensível à latência a um acelerador dedicado.
Para agentes interativos, um decode mais rápido pode tornar tarefas que exigem várias etapas mais ágeis. O benchmark da Nvidia aponta para um ganho expressivo em uma configuração de contexto longo, mas os resultados no mundo real dependerão da aplicação e de todo o restante da infraestrutura de atendimento.
A entrada em produção completa, a implantação pela Nebius e a adoção planejada pela Groq serão testes mais relevantes para saber se a vantagem de benchmark do LPX pode se transformar em desempenho de nuvem amplamente disponível.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Nvidia anunciou em 24 de agosto que o Groq 3 LPX entrou em produção completa. Em um teste da Artificial Analysis, o sistema gerou 3.400 tokens por segundo com o modelo Gemma 4 31B e contexto de 100 mil tokens — dese...
A Nvidia anunciou em 24 de agosto que o Groq 3 LPX entrou em produção completa. Em um teste da Artificial Analysis, o sistema gerou 3.400 tokens por segundo com o modelo Gemma 4 31B e contexto de 100 mil tokens — dese... O LPX não substitui as GPUs da Nvidia: ele é um acelerador dedicado à etapa de decodificação da inferência, na qual o modelo gera a resposta token por token.
A Nebius será a primeira empresa de nuvem de IA anunciada a adotar o sistema, com planos de integrá lo à plataforma Token Factory.