Nvidia maakte op 24 augustus tijdens Hot Chips bekend dat de Groq 3 LPX volledig in productie is. De rack scale accelerator richt zich op snelle, voorspelbare tokenproductie bij agentische AI met lange contextvensters.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full production launch of its Groq 3 LPX dedicated AI inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack scale accelerator had entered full production as the low latency, long context inference component of the Vera Rubin platform.. Topic tags: general web, openai, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnai
Tijdens Hot Chips op 24 augustus maakte Nvidia bekend dat de Groq 3 LPX volledig in productie is. De rack-scale accelerator wordt onderdeel van het Vera Rubin-platform en is bedoeld voor een specifiek knelpunt bij agentische AI: zo snel mogelijk het volgende token genereren, zodat toepassingen vlot en responsief blijven. 36
De aankondiging kwam nadat Nvidia voor 20 miljard dollar een overeenkomst met Groq sloot. Die omschrijving als een overname is echter niet helemaal juist: beschikbare berichtgeving spreekt over een niet-exclusieve licentie op Groq-technologie en het aantrekken van oprichter Jonathan Ross, president Sunny Madra en andere sleutelfiguren. Groq bleef daarna als zelfstandig bedrijf actief en haalde nieuwe financiering op. 5
Nvidia verwees naar een benchmark van Artificial Analysis met het open-source model Gemma 4 31B. Bij een context van 100.000 tokens kwam de Groq 3 LPX uit op 3.431 outputtokens per seconde; Nvidia rondde dat in zijn aankondiging af op 3.400 tokens per seconde. 16
Volgens Nvidia was de LPX in deze lange-contexttests bovendien vier keer sneller qua responsiviteit dan het dichtstbijzijnde alternatieve platform. Die claim heeft betrekking op latencygevoelige inferentieworkloads en niet op de algemene prestaties van elke AI-toepassing. 6
De LPX is vooral gericht op de decode- of generatiefase van inferentie: het produceren van de opeenvolgende tokens nadat een model de invoer heeft verwerkt. Vera Rubin NVL72 blijft de flexibelere infrastructuur voor training, contextverwerking, prefill en bredere inferentietaken. 36
Nvidia positioneert de LPX als het zevende belangrijke onderdeel van Vera Rubin, naast onder meer de Vera-processor en de Rubin-GPU. De Vera CPU bevat 88 door Nvidia ontworpen Olympus-cores. 2
Nebius is volgens Nvidia de eerste AI-cloudprovider die de Groq 3 LPX adopteert. Het bedrijf wil de accelerator toevoegen aan zijn Token Factory-platform voor productie-inferentie. 6
Groq zegt eveneens tot de eerste gebruikers te behoren. Het bedrijf wil de LPX samen met Vera Rubin NVL72 inzetten in zijn gespecialiseerde cloud voor AI-inferentie. 4
Nvidia schetst hiermee een toekomst waarin AI-datacenters hun hardware meer per taak verdelen. GPU's en Rubin-systemen blijven geschikt voor flexibele, grootschalige berekeningen. De LPX neemt juist de tokenproductie voor zijn rekening die bepaalt hoe snel een gebruiker antwoord krijgt of een AI-agent een volgende stap kan zetten. 36
Dat onderscheid is vooral relevant voor agentische systemen die meerdere acties na elkaar uitvoeren, bijvoorbeeld bij codegeneratie of andere interactieve toepassingen met lange contexten. De aangekondigde productiestatus betekent dat de technologie nu beschikbaar komt voor daadwerkelijke implementaties, al geven de aangeleverde bronnen geen specifieke locatie voor de bekendmaking tijdens Hot Chips.
De beschikbare onderbouwing bevestigt niet afdoende specifieke beweringen over 256 chips per rack, 500 MB on-chip SRAM per chip, productie door Samsung tegenover GPU-productie door TSMC, of vermeende reacties van AMD, Cerebras en OpenAI. Die details zijn daarom niet als vaststaande feiten opgenomen.
Ook is wel onderbouwd dat SpaceXAI Vera-CPU's wil inzetten voor toepassingen rond agentische AI, maar niet de uitgebreidere beweringen over tooluitvoering, simulaties tussen satellieten of de precieze omvang en timing van die inzet. 7
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia maakte op 24 augustus tijdens Hot Chips bekend dat de Groq 3 LPX volledig in productie is.
Nvidia maakte op 24 augustus tijdens Hot Chips bekend dat de Groq 3 LPX volledig in productie is. De rack scale accelerator richt zich op snelle, voorspelbare tokenproductie bij agentische AI met lange contextvensters.
In een Artificial Analysis benchmark behaalde het systeem 3.431 outputtokens per seconde met Gemma 4 31B en een context van 100.000 tokens.