Nvidia a annoncé le 24 août, lors de Hot Chips 2026, que le Groq 3 LPX était entré en production complète. Conçu pour l’inférence à faible latence et les contextes longs, le LPX complète les systèmes Vera Rubin NVL72 au lieu de remplacer les GPU utilisés pour l’entraînement et les tâches d’inférence générales.
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full production launch of its Groq 3 LPX dedicated AI inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack scale accelerator had entered full production as the low latency, long context inference component of the Vera Rubin platform.. Topic tags: general web, openai, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnai
Nvidia a profité de Hot Chips 2026, le 24 août, pour annoncer la mise en production complète du Groq 3 LPX. Cet accélérateur à l’échelle d’un rack est destiné à la partie la plus interactive de l’inférence : la génération rapide et prévisible des tokens qui composent la réponse d’un agent IA. 36
Le LPX est conçu pour fonctionner aux côtés de la plateforme Vera Rubin, et notamment des systèmes Vera Rubin NVL72. Les GPU et les autres composants de Rubin restent chargés des tâches générales — entraînement, traitement du contexte et inférence à haut débit — tandis que le LPX se concentre sur la phase de décodage, c’est-à-dire la production du token suivant. 36
Nvidia a mis en avant un résultat obtenu par Artificial Analysis avec le modèle open source Gemma 4 31B et une fenêtre de contexte de 100 000 tokens. Le système Groq 3 LPX installé dans les centres de données de Nvidia a produit 3 431 tokens par seconde ; l’annonce de Nvidia arrondit ce chiffre à 3 400 tokens par seconde. 16
Selon Nvidia, ce niveau de performance rend le LPX quatre fois plus réactif que la plateforme concurrente la plus proche dans ce type de charge de travail, où les agents doivent analyser de longs historiques et enchaîner rapidement plusieurs étapes. 6
L’objectif n’est donc pas simplement d’augmenter la puissance de calcul maximale. Il s’agit surtout de réduire le délai ressenti par l’utilisateur lorsqu’un agent de programmation, de recherche ou d’automatisation génère sa réponse token après token.
Nvidia présente désormais le Groq 3 LPX comme le septième composant majeur de Vera Rubin. Il rejoint notamment le processeur central Vera, qui intègre 88 cœurs Olympus conçus par Nvidia, ainsi que les autres puces de la plateforme. 2
Cette organisation traduit la stratégie défendue par Nvidia pour les futures « usines d’IA » : attribuer chaque étape à l’architecture la mieux adaptée. Les GPU Rubin assurent la polyvalence et le traitement de grands volumes de données ; le LPX prend en charge la génération interactive lorsque la latence et la régularité sont prioritaires. 36
Nebius est présenté comme le premier cloud IA à adopter le Groq 3 LPX. L’entreprise prévoit de l’intégrer à Token Factory, sa plateforme de production dédiée à l’inférence. 6
Groq figure également parmi les premiers utilisateurs annoncés. La société prévoit de déployer le LPX avec des systèmes Vera Rubin NVL72 dans son cloud d’inférence conçu sur mesure. 4
Cette formulation mérite une précision. Les éléments disponibles décrivent plutôt un accord de 20 milliards de dollars portant sur une licence non exclusive de la technologie Groq et le recrutement de plusieurs dirigeants clés, dont le fondateur Jonathan Ross et le président Sunny Madra, qu’un rachat pur et simple de Groq. 5
Groq a ensuite continué ses activités et levé de nouveaux fonds. Il est donc plus exact de parler d’un transfert de technologie et de talents vers Nvidia, associé à une relation commerciale entre les deux entreprises, plutôt que d’une acquisition complète de Groq. 5
Les informations disponibles ne permettent par ailleurs pas d’étayer précisément certaines affirmations qui circulent sur la configuration matérielle des racks, la fabrication des puces, les réactions d’AMD ou de Cerebras, ou encore un prétendu mode à 750 tokens par seconde chez OpenAI. Ces éléments ne sont pas suffisamment documentés par les sources fournies.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Nvidia a annoncé le 24 août, lors de Hot Chips 2026, que le Groq 3 LPX était entré en production complète.
Nvidia a annoncé le 24 août, lors de Hot Chips 2026, que le Groq 3 LPX était entré en production complète. Conçu pour l’inférence à faible latence et les contextes longs, le LPX complète les systèmes Vera Rubin NVL72 au lieu de remplacer les GPU utilisés pour l’entraînement et les tâches d’inférence générales.
Dans un benchmark d’Artificial Analysis, il a atteint 3 431 tokens générés par seconde avec Gemma 4 31B et un contexte de 100 000 tokens.