As escolhas arquiteturais do Nemotron 3 Ultra são o ponto em que a Nvidia mais se distancia do design padrão dos grandes modelos de linguagem. Em vez de um Transformer denso convencional, o modelo usa uma arquitetura híbrida de Mistura Latente de Especialistas (LatentMoE) que intercala camadas de modelo de espaço de estados Mamba-2 com camadas de Mistura de Especialistas e um pequeno número de camadas de Atenção padrão .
Este design ataca diretamente os dois maiores gargalos em tarefas de agentes de longa duração: consumo de memória e velocidade de inferência. Modelos de espaço de estados como o Mamba-2 escalam linearmente com o comprimento da sequência, em vez de quadraticamente, como fazem os mecanismos de atenção. Ao combiná-los com o roteamento MoE — onde apenas uma fração do total de parâmetros é ativada para cada token —, a Nvidia cria um modelo que mantém a precisão de ponta enquanto roda substancialmente mais rápido que concorrentes de inteligência comparável .
A arquitetura também incorpora a Predição de Múltiplos Tokens (MTP), uma técnica em que o modelo prevê vários tokens futuros simultaneamente durante a geração. Isso funciona como uma forma nativa de decodificação especulativa, aumentando ainda mais a taxa de transferência sem exigir um modelo de rascunho separado .
A janela de contexto de 1 milhão de tokens é outra escolha deliberada. Em fluxos de trabalho agentivos, o modelo precisa manter o estado ao longo de dezenas ou centenas de chamadas de ferramentas, guardar longos históricos de planejamento na memória e raciocinar sobre grandes bases de código ou coleções de documentos . Uma janela de contexto menor forçaria os agentes a truncar ou resumir, perdendo informações críticas. O limite de 1 milhão de tokens permite que todo o estado do agente, os logs e os planos persistam durante sessões sustentadas.
No Índice de Inteligência da Artificial Analysis — um benchmark composto que mede a capacidade do modelo em múltiplas dimensões — o Nemotron 3 Ultra alcança uma pontuação de 48, tornando-se o modelo aberto mais bem classificado entre todos os desenvolvedores dos EUA . A pontuação o coloca à frente do Llama 3.1 405B e do Mixtral 8x22B, embora permaneça atrás dos melhores modelos abertos chineses em capacidade geral
.
Mas talvez o número mais significativo seja a taxa de transferência. De acordo com o relatório técnico da Nvidia, o Nemotron 3 Ultra atinge até aproximadamente 6× mais taxa de transferência de inferência em comparação com outros modelos de linguagem grandes e abertos de última geração, mantendo uma precisão equivalente . No formato quantizado NVFP4, rodando na plataforma Blackwell da Nvidia, o modelo chega a uma inferência 5× mais rápida e reduz o custo total de tarefas agentivas complexas em até 30%
.
Comparações específicas de taxa de transferência do relatório técnico mostram que o Nemotron 3 Ultra é 5,9× mais rápido que o GLM-5.1-754B, 4,8× mais rápido que o Kimi-K2.6-1T e 1,6× mais rápido que o Qwen-3.5-397B, todos em uma configuração de 8.000 tokens de entrada e 64.000 tokens de saída .
A história dos benchmarks, no entanto, não é de domínio total. Em avaliações individuais como MMLU, HumanEval e GSM8K, o modelo supera o Llama 3.1 405B e o Mixtral 8x22B, mas os dados de origem mostram resultados mistos quando comparado a modelos como o GPT-4o em certas métricas . O próprio relatório técnico enquadra a vantagem como estando na fronteira entre taxa de transferência de inferência e precisão, e não na liderança isolada da precisão bruta
.
A Nvidia liberou os pesos do modelo no Hugging Face em dois formatos: a versão quantizada NVFP4 (NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4) para máxima velocidade no hardware Blackwell, e uma versão BF16 completa para ambientes que precisam da mais alta precisão . Os pesos são abertos sob a licença OpenMDW da Linux Foundation, e a Nvidia se comprometeu a liberar receitas de treinamento e conjuntos de dados onde for licenciado
.
Os requisitos de hardware, porém, são elevados. A configuração mínima para implantação é de 4× GB200, 4× B200, 4× GB300, 4× B300 ou 8× H100 GPUs . Para desenvolvedores que desejam experimentar localmente ou em infraestrutura mais leve, versões quantizadas GGUF estão disponíveis através da Unsloth, com a opção dinâmica de 1 bit ocupando aproximadamente 189 GB de espaço em disco
.
A implantação na nuvem é simplificada pela disponibilidade imediata no Amazon SageMaker JumpStart, que oferece implantação com um clique para empresas que já operam na infraestrutura da AWS .
O Nemotron 3 Ultra não é um anúncio de produto isolado. É a peça mais visível de um esforço estratégico muito maior da Nvidia para se tornar o provedor de infraestrutura padrão para agentes de IA corporativos. Os componentes dessa investida se dividem em três categorias.
Anunciada na GTC 2026 em março, a Coalizão Nemotron é um grupo colaborativo de laboratórios de IA e empresas que constroem modelos abertos de ponta na infraestrutura DGX Cloud da Nvidia. Os membros incluem Cursor, Mistral AI, Perplexity e dezenas de outros. Na Computex, a Nvidia adicionou H Company, NAVER Cloud, Nous Research e Prime Intellect como novos membros .
O propósito da coalizão é reunir expertise, dados e capacidade computacional para avançar os modelos abertos de fronteira, com ênfase específica na construção dos melhores "arreios" de agente para esses modelos e no fornecimento de observabilidade abrangente sobre o comportamento dos agentes . Os parceiros da coalizão recebem acesso antecipado a novos lançamentos de modelos Nemotron antes da disponibilidade pública e integração preferencial com a infraestrutura de agentes da Nvidia
.
No mesmo evento da GTC, a Nvidia revelou o que chama de Nvidia Agent Toolkit, uma pilha de código aberto projetada para condensar a complexidade da implantação de agentes autônomos em um único pipeline otimizado para a Nvidia. O kit de ferramentas inclui o NemoClaw (a versão "blindada" do runtime de agente autônomo OpenClaw pela Nvidia), OpenShell para execução segura, bibliotecas CUDA-X pré-carregadas com habilidades de agente como otimização e recuperação, e a própria família de modelos Nemotron .
A arquitetura do kit de ferramentas é notável: é agnóstica a frameworks, o que significa que as empresas podem usá-lo com LangChain, CrewAI, AutoGen ou sua própria camada de orquestração. A aposta é que, ao tornar a pilha genuinamente útil e de código aberto, a Nvidia garante que, quando as empresas implantarem frotas de agentes em escala, o padrão por baixo serão as GPUs da Nvidia .
Mais de 150 parceiros fundadores se comprometeram a construir agentes de IA na infraestrutura da Nvidia, incluindo grandes plataformas de software como CrowdStrike, Palantir, Adobe, Salesforce, SAP, ServiceNow e Siemens . Em março de 2026, a LangChain — cujos frameworks ultrapassaram 1 bilhão de downloads — anunciou uma plataforma corporativa completa de IA agentiva construída diretamente sobre os modelos Nemotron e o Agent Toolkit da Nvidia, com a própria LangChain ingressando na Coalizão Nemotron
.
A profundidade dessas integrações é relevante. A plataforma de engenharia de agentes LangSmith da LangChain, combinada com a infraestrutura da Nvidia, cria um pipeline ponta a ponta que abrange desenvolvimento, implantação, monitoramento e auditoria. Para empresas já comprometidas com qualquer um dos fornecedores, essa parceria reduz o atrito de construir sistemas de agentes em produção .
A Nvidia posiciona explicitamente o Nemotron 3 Ultra como o modelo de pesos abertos mais inteligente dos EUA, e esse enquadramento é importante. A fronteira dos pesos abertos tem sido dominada nos últimos meses por modelos chineses da DeepSeek, Qwen e outros. O Nemotron 3 Ultra é a resposta da Nvidia — não necessariamente superando os modelos chineses em pontuações brutas de benchmark, mas otimizando para a carga de trabalho específica (agentes de longa duração) e o hardware específico (GPUs Blackwell com NVFP4) que os clientes corporativos realmente usarão .
O modelo oferece suporte ao controle de orçamento de raciocínio em tempo de inferência, o que significa que os usuários podem balancear entre velocidade e profundidade de raciocínio dependendo da tarefa . Essa capacidade de configuração é importante para sistemas de agentes onde diferentes subtarefas exigem diferentes níveis de esforço cognitivo — uma etapa de planejamento pode precisar de raciocínio profundo, enquanto uma etapa de chamada de ferramenta precisa de velocidade.
O suporte a idiomas abrange inglês, francês, espanhol, italiano, alemão, japonês, coreano, português e chinês, tornando-o viável para implantações corporativas multinacionais .
O Nemotron 3 Ultra não visa primariamente estabelecer recordes de benchmark. Ele visa estabelecer a infraestrutura padrão para agentes de IA corporativos. Ao abrir o código de um modelo de escala de fronteira que roda mais rápido em seu próprio hardware, construir um kit de ferramentas de agente de código aberto que simplifica a implantação e montar uma coalizão de laboratórios de IA e fornecedores de software empresarial comprometidos com essa pilha, a Nvidia está fazendo a mesma aposta que fez com o CUDA: a de que dominar a experiência do desenvolvedor significa, eventualmente, dominar o mercado.
O modelo oferece avanços técnicos significativos — particularmente em taxa de transferência e comprimento de contexto — que o tornam genuinamente adequado para as cargas de trabalho agentivas que as empresas estão começando a implantar. Mas a estratégia é igualmente sobre estabelecer a infraestrutura de inferência para essas cargas de trabalho. Para empresas avaliando plataformas de agentes em meados de 2026, a pilha da Nvidia é agora a opção de código aberto mais completa disponível.