Nvidia dévoile Nemotron 3 Ultra, un modèle open source massif de 550 milliards de paramètres, taillé pour les agents IA autonomes et les flux de travail complexes de longue durée avec une fenêtre de contexte d'un mill... Grâce à une architecture hybride Mamba 2 et Mixture of Experts, il atteint des vitesses d'infére...

Create a landscape editorial hero image for this Studio Global article: What are the key details about Nvidia's release of Nemotron 3 Ultra, including its model size, architecture, performance benchmarks, availab. Article summary: Nvidia announced **Nemotron 3 Ultra** at Computex 2026 (June 1) as its largest open-weights model, built specifically for long-running AI agents [3][5]. Here is a comprehensive breakdown:. Topic tags: general, general web, user generated, academic, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Nvidia unveils Nemotron 3 Ultra: America’s smartest open-weights AI model, 30% cheaper to run. Nemotron 3 Ultra, the new flagship AI model features 500-550 billion parameters. Nv" source context "Nvidia unveils Nemotron 3 Ultra: America's smartest open-weights ..." Reference image 2: visual subject "Nemotron 3 Ultra la
Lorsque Jensen Huang est monté sur la scène du Computex le 1ᵉʳ juin 2026, il n'a pas seulement présenté un énième grand modèle de langage. Avec le Nemotron 3 Ultra, Nvidia fait un pari architectural délibéré sur l'avenir de l'IA en entreprise : celui des agents autonomes capables de planifier, raisonner, utiliser des outils et mener des flux de travail complexes pendant des heures, voire des jours. Avec ses 550 milliards de paramètres au total – dont seulement 55 milliards activés par token grâce à une architecture parcimonieuse de type Mixture-of-Experts (MoE) – ce modèle est autant une déclaration sur l'économie de l'inférence que sur l'intelligence brute .
Il s'agit du plus grand modèle open source jamais conçu par Nvidia et du vaisseau amiral d'une famille à trois niveaux, la gamme Nemotron 3, qui a débuté avec le Nano (9 milliards de paramètres) en décembre 2025 et s'est poursuivie avec le Super (49 milliards) en mars 2026 . L'Ultra complète cette gamme avec une vocation explicitement tournée vers l'orchestration et le raisonnement lourd, et non vers les chatbots grand public
.
Là où Nvidia se démarque le plus nettement de la conception standard des grands modèles de langage, c'est dans l'architecture du Nemotron 3 Ultra. Exit le Transformer dense traditionnel : le modèle utilise une architecture hybride baptisée Latent Mixture-of-Experts (LatentMoE), qui entrelace des couches de modèles d'état Mamba-2 avec des couches MoE et un petit nombre de couches d'Attention classiques .
Cette conception répond directement aux deux principaux goulets d'étranglement des tâches agentiques longues : la consommation de mémoire et la vitesse d'inférence. Les modèles d'état comme Mamba-2 évoluent de manière linéaire avec la longueur de la séquence, contrairement aux mécanismes d'attention qui évoluent de façon quadratique. En les combinant avec le routage MoE, qui n'active qu'une fraction des paramètres totaux pour chaque token, Nvidia obtient un modèle qui maintient une précision de pointe tout en étant nettement plus rapide que ses concurrents d'intelligence comparable .
L'architecture intègre également la prédiction multi-token (MTP), une technique où le modèle prédit plusieurs tokens futurs simultanément pendant la génération. Cela agit comme une forme de décodage spéculatif natif, augmentant encore le débit sans nécessiter de modèle auxiliaire .
La fenêtre de contexte d'un million de tokens est un autre choix délibéré. Dans les flux agents, le modèle doit maintenir un état tout au long de dizaines, voire de centaines d'appels d'outils, garder en mémoire de longs historiques de planification et raisonner sur des bases de code ou des collections de documents volumineuses. Une fenêtre plus petite forcerait les agents à tronquer ou synthétiser, perdant ainsi des informations cruciales. La limite d'un million de tokens permet à l'état complet de l'agent, à ses logs et à ses plans de persister durant des sessions prolongées .
Sur l'Artificial Analysis Intelligence Index, un benchmark composite mesurant la capacité des modèles sur plusieurs dimensions, Nemotron 3 Ultra obtient un score de 48, ce qui en fait le modèle open source le mieux classé parmi tous les développeurs américains . Ce score le place devant Llama 3.1 405B et Mixtral 8x22B, bien qu'il reste derrière les meilleurs modèles open source chinois en termes de capacité pure
.
Mais le chiffre le plus significatif est peut-être celui du débit. Selon le rapport technique de Nvidia, le Nemotron 3 Ultra atteint jusqu'à environ 6 fois le débit d'inférence des autres grands modèles open source de pointe, tout en maintenant une précision comparable . Sur le format quantifié NVFP4 fonctionnant sur la plateforme Blackwell de Nvidia, le modèle est 5 fois plus rapide en inférence et réduit le coût total des tâches agentiques complexes de près de 30 %
.
Le rapport technique précise que sur une configuration de 8 000 tokens en entrée et 64 000 tokens en sortie, le Nemotron 3 Ultra affiche un débit 5,9 fois supérieur à celui de GLM-5.1-754B, 4,8 fois supérieur à Kimi-K2.6-1T et 1,6 fois supérieur à Qwen-3.5-397B .
L'histoire des benchmarks n'est pas un sans-faute pour autant. Sur des tests individuels comme MMLU, HumanEval et GSM8K, le modèle surpasse Llama 3.1 405B et Mixtral 8x22B, mais les données montrent des résultats mitigés face à GPT-4o sur certains paramètres . Le rapport technique présente l'avantage comme se situant sur le « front de l'efficacité débit-précision » plutôt que sur un leadership en précision brute
.
Nvidia a publié les poids du modèle sur Hugging Face en deux formats : une version quantifiée NVFP4 (NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4) pour une vitesse maximale sur le matériel Blackwell, et une version BF16 complète pour les environnements nécessitant la plus haute précision . Les poids sont ouverts sous licence OpenMDW de la Linux Foundation, et Nvidia s'est engagé à publier les recettes d'entraînement et les jeux de données lorsque les licences le permettent
.
Les exigences matérielles sont cependant considérables. La configuration minimale pour le déploiement est de 4 GPU GB200, 4 B200, 4 GB300, 4 B300 ou 8 H100 . Pour les développeurs souhaitant expérimenter en local ou sur des infrastructures plus légères, des versions quantifiées GGUF sont disponibles via Unsloth. L'option dynamique 1-bit nécessite environ 189 Go d'espace disque, un chiffre qui relativise l'ampleur du modèle
.
Le déploiement cloud est simplifié grâce à une disponibilité immédiate sur Amazon SageMaker JumpStart, qui permet un déploiement en un clic pour les entreprises utilisant déjà l'infrastructure AWS .
Le lancement du Nemotron 3 Ultra n'est pas un événement isolé. C'est la partie la plus visible d'une vaste offensive stratégique de Nvidia pour devenir le fournisseur par défaut de l'infrastructure des agents IA en entreprise. Cette stratégie s'articule autour de trois axes.
Annoncée lors de la GTC 2026 en mars, la Coalition Nemotron est un groupe collaboratif de laboratoires d'IA et d'entreprises construisant des modèles open source de pointe sur l'infrastructure cloud DGX de Nvidia. Parmi ses membres figurent Cursor, Mistral AI, Perplexity et des dizaines d'autres. Au Computex, Nvidia a élargi la coalition en accueillant H Company, NAVER Cloud, Nous Research et Prime Intellect .
L'objectif de la coalition est de mutualiser l'expertise, les données et la puissance de calcul pour faire progresser les modèles ouverts de pointe, en mettant un accent particulier sur la création des meilleurs « harnais » pour agents et sur une observabilité complète de leur comportement . Les partenaires bénéficient d'un accès anticipé aux nouveaux modèles Nemotron et d'une intégration privilégiée avec l'infrastructure d'agents de Nvidia
.
Lors du même événement, Nvidia a dévoilé ce qu'elle appelle le Nvidia Agent Toolkit, une suite open source conçue pour condenser la complexité du déploiement d'agents autonomes en un pipeline unique optimisé pour Nvidia. La boîte à outils comprend NemoClaw (la version renforcée par Nvidia de l'environnement d'exécution d'agents autonomes OpenClaw), OpenShell pour une exécution sécurisée, les bibliothèques CUDA-X préchargées avec des compétences d'agent comme l'optimisation et la recherche, et la famille de modèles Nemotron elle-même .
L'architecture de cette boîte à outils est notable : elle est agnostique en matière de framework, ce qui signifie que les entreprises peuvent l'utiliser avec LangChain, CrewAI, AutoGen ou leur propre couche d'orchestration. Le pari est qu'en rendant cette suite véritablement utile et open source, Nvidia s'assure que lorsque les entreprises déploieront des flottes d'agents IA à grande échelle, l'inférence se fera par défaut sur des GPU Nvidia .
Plus de 150 partenaires fondateurs se sont engagés à construire des agents IA sur l'infrastructure de Nvidia, parmi lesquels des plateformes logicielles majeures comme CrowdStrike, Palantir, Adobe, Salesforce, SAP, ServiceNow et Siemens . En mars 2026, LangChain – dont les frameworks ont dépassé le milliard de téléchargements – a annoncé une plateforme agentique complète pour l'entreprise construite directement sur les modèles Nemotron et l'Agent Toolkit de Nvidia, LangChain lui-même rejoignant la Coalition Nemotron
.
La profondeur de ces intégrations est cruciale. La plateforme d'ingénierie d'agents LangSmith de LangChain, combinée à l'infrastructure de Nvidia, crée un pipeline de bout en bout couvrant le développement, le déploiement, la supervision et l'audit. Pour les entreprises déjà engagées auprès de l'un ou l'autre de ces fournisseurs, ce partenariat réduit considérablement les frictions liées à la construction de systèmes de production basés sur des agents .
Nvidia positionne explicitement le Nemotron 3 Ultra comme le modèle open source américain le plus intelligent, une revendication lourde de sens. Ces derniers mois, la scène open source a été dominée par des modèles chinois comme DeepSeek et Qwen. Le Nemotron 3 Ultra est la riposte de Nvidia : non pas nécessairement en battant les modèles chinois sur les scores bruts des benchmarks, mais en optimisant pour la charge de travail spécifique (agents de longue durée) et le matériel spécifique (GPU Blackwell avec NVFP4) que les entreprises utiliseront concrètement .
Le modèle prend en charge le contrôle du budget de raisonnement au moment de l'inférence, permettant ainsi aux utilisateurs de choisir entre rapidité et profondeur de réflexion selon la tâche . Cette flexibilité est cruciale pour les systèmes agentiques où différentes sous-tâches exigent des niveaux d'effort cognitif variés : une étape de planification peut nécessiter un raisonnement profond, tandis qu'une étape d'appel d'outil doit être rapide.
La prise en charge linguistique inclut le français, l'anglais, l'espagnol, l'italien, l'allemand, le japonais, le coréen, le portugais et le chinois, ce qui le rend viable pour des déploiements multinationaux en entreprise .
Le Nemotron 3 Ultra ne vise pas principalement à établir des records de benchmark. Son objectif est de définir l'infrastructure par défaut pour les agents IA en entreprise. En ouvrant un modèle à l'échelle de pointe qui fonctionne le plus rapidement sur son propre matériel, en construisant une boîte à outils agent open source qui simplifie le déploiement, et en rassemblant une coalition de laboratoires d'IA et d'éditeurs de logiciels engagés dans cette suite, Nvidia réitère le pari qu'elle a fait avec CUDA : posséder l'expérience développeur, c'est à terme posséder le marché.
Le modèle apporte des avancées techniques significatives – notamment en termes de débit et de longueur de contexte – qui le rendent véritablement adapté aux charges de travail agentiques que les entreprises commencent à déployer. Mais la stratégie consiste tout autant à verrouiller l'infrastructure d'inférence pour ces charges de travail. Pour les entreprises qui évaluent des plateformes d'agents à la mi-2026, la suite Nvidia s'impose désormais comme l'option open source la plus complète du marché.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Nvidia dévoile Nemotron 3 Ultra, un modèle open source massif de 550 milliards de paramètres, taillé pour les agents IA autonomes et les flux de travail complexes de longue durée avec une fenêtre de contexte d'un mill...
Nvidia dévoile Nemotron 3 Ultra, un modèle open source massif de 550 milliards de paramètres, taillé pour les agents IA autonomes et les flux de travail complexes de longue durée avec une fenêtre de contexte d'un mill... Grâce à une architecture hybride Mamba 2 et Mixture of Experts, il atteint des vitesses d'inférence jusqu'à six fois supérieures à celles de ses concurrents, tout en réduisant le coût des tâches agentiques jusqu'à 30...
Son déploiement est exigeant (minimum 4 GPU B200 ou 8 H100), mais les poids sont disponibles en open source sur Hugging Face, avec une version quantifiée GGUF pour une exécution locale et une disponibilité immédiate s...