A tese por trás dessa atualização dramática é simples: a revolução da IA está migrando do treinamento para a inferência, e as cargas de trabalho do futuro — sistemas autônomos de IA agêntica com múltiplas etapas — exigem muito mais poder de processamento das CPUs do que a indústria esperava anteriormente .
As cargas de trabalho de IA agêntica devem representar cerca de dois terços do mercado de US$ 220 bilhões em CPUs para servidores até 2030 . Esses sistemas orquestram tarefas complexas de forma autônoma, dependendo fortemente de CPUs para manipulação de dados e coordenação junto com a execução de modelos baseados em GPU .
A inferência se tornou o caso de uso dominante da computação de IA. Em 2026, pela primeira vez, as cargas de trabalho de inferência consomem cerca de 60% da capacidade global de computação de IA, superando o treinamento . Essa mudança favorece arquiteturas com foco em CPU, pois servir modelos em escala exige um grande número de CPUs host, servidores de inferência e infraestrutura de suporte .
A AMD também vê o mercado mais amplo de computação de alto desempenho e adaptativa atingindo US$ 2 trilhões até 2030, contra US$ 365 bilhões em 2025 . O mercado de silício para data centers, sozinho, deve ultrapassar US$ 1 trilhão .
Anunciado no Advancing AI 2026 em 23 de julho de 2026, o Helios é o primeiro sistema integrado de rack de IA refrigerado a líquido da AMD, combinando 72 GPUs Instinct MI455X, CPUs EPYC Venice e rede Pensando . Ele está em produção total desde julho de 2026, com os primeiros embarques para parceiros começando no final do terceiro trimestre de 2026 (setembro de 2026) e aumento de volume no quarto trimestre .
O rack oferece até 2,9 exaflops de throughput de inferência FP4 e 1,4 exaflops de throughput de treinamento FP8, com 260 TB/s de largura de banda de interconexão de escala . O preço estimado para um rack Helios totalmente carregado é de aproximadamente US$ 5,25 milhões .
Construída no processo N2 (2nm) da TSMC, a CPU Venice possui até 256 núcleos por soquete, empacotando 32 núcleos Zen 6c em cada um dos 8 chips . A produção começou na fábrica da TSMC em Taiwan em maio de 2026, com produção futura planejada para a instalação da TSMC no Arizona (embora o volume não seja esperado antes de 2028) .
A Venice está sendo amostrada para clientes e será enviada em racks Helios, bem como em implantações de servidores independentes no final de 2026 e início de 2027 . A variante EPYC 9006 SP7, construída para execução de sandbox de agente de alta densidade, está programada para ser enviada no quarto trimestre de 2026 .
A AMD garantiu compromissos substanciais das três principais empresas de IA, totalizando aproximadamente 14 gigawatts de capacidade de computação :
| Cliente | Compromisso | Detalhes |
|---|---|---|
| OpenAI | ~6 GW | Acordo anunciado em outubro de 2025. ~10% do capital da AMD emitido como warrants de desempenho. A OpenAI espera colocar o Helios online a partir do 4º trimestre de 2026 . |
| Meta | ~6 GW | Acordo anunciado em fevereiro de 2026. Inclui chips MI450-series personalizados e arquitetura de rack Helios codesenvolvida via Open Compute Project. A Meta ainda está validando plataformas EPYC e testando sistemas Helios . |
| Anthropic | Até 2 GW | Acordo anunciado em julho de 2026. A AMD se comprometeu com um investimento estratégico de capital de até US$ 5 bilhões. Espera-se que o primeiro gigawatt de capacidade da GPU MI450-series seja enviado no 1º semestre de 2027 . |
Clientes adicionais incluem Microsoft (implantando racks Helios em data centers do Azure) e Oracle (construindo um supercluster Helios de 50.000 GPUs) .
A pilha de software ROCm da AMD fez progressos substanciais, mas ainda está atrás da CUDA da Nvidia em áreas-chave:
O que funciona:
Lacunas restantes:
Resumo: O ROCm é agora viável para produção em inferência e competitivo em preço por token (relatado como 25–40% mais barato que a Nvidia para cargas de trabalho de inferência em hardware equivalente), mas o CUDA mantém uma liderança significativa em ferramentas, fluxos de trabalho de treinamento e amplitude de suporte a frameworks .
Os resultados do 2º trimestre de 2026 da AMD apoiam fortemente a direção estratégica da empresa:
| Métrica | 2º Tri 2026 | Variação Anual |
|---|---|---|
| Receita total | US$ 11,5 bilhões | Recorde histórico |
| Receita de data center | US$ 6,7 bilhões | Mais que dobrou |
| Data center como % do total | ~58% | Acima de 42% no ano anterior |
| Crescimento da receita de CPU servidor | >70% | Impulsionado por inferência/IA agêntica |
A administração observou na teleconferência de resultados que "a inferência e a IA agêntica estão aumentando a necessidade de computação de CPU de servidor" como o motor estrutural por trás do aumento do TAM . A AMD espera que a receita de IA em data centers atinja "dezenas de bilhões de dólares" até 2027, com a receita de CPU para servidores crescendo mais de 70% em 2027 .
Trajetória da margem bruta: À medida que a AMD passa de vender chips individuais para sistemas de rack integrados como o Helios — que agrupam GPUs, CPUs e rede em um único pacote — as margens combinadas podem enfrentar ventos contrários em comparação com as vendas de chips puros. O mercado está observando se a AMD conseguirá sustentar a expansão da margem ao se tornar mais uma provedora de sistemas, semelhante à Nvidia.
Concentração na cadeia de suprimentos da TSMC: A AMD depende da TSMC para a produção de CPU (N2) e GPU (N3/N4) de ponta . A Venice está em produção na TSMC de Taiwan e, embora a AMD tenha planejado a produção futura na fábrica da TSMC no Arizona, essa capacidade ainda não está online para os nós mais avançados . As tensões geopolíticas em torno de Taiwan e a competição por alocação de wafer da TSMC com Apple, Nvidia e outros continuam sendo riscos materiais de curto prazo, especialmente com a AMD planejando enviar o Helios em escala de gigawatt a partir do final de 2026.
A AMD está executando uma estratégia clara e ambiciosa que depende de um ponto de inflexão nas cargas de trabalho de IA — do treinamento para a inferência, de modelos isolados para agentes autônomos. O roteiro de hardware (Helios e Venice) está em produção, seus maiores clientes estão comprometidos em escala sem precedentes e seus resultados financeiros refletem essa mudança. As principais questões em aberto são se o ROCm conseguirá fechar a lacuna restante com o CUDA rápido o suficiente e se as restrições da cadeia de suprimentos permitirão que a AMD cumpra seu agressivo cronograma de implantação.