A Microsoft está dividindo deliberadamente sua infraestrutura de IA de próxima geração entre AMD Helios e Nvidia Vera Rubin para reduzir riscos na cadeia de suprimentos e evitar a dependência de um único fornecedor . Isso reflete a abordagem da empresa, que já é agnóstica em relação a modelos de IA dentro do Azure e do Copilot . O CEO Satya Nadella confirmou que "seremos um dos primeiros provedores de nuvem a implantar infraestrutura de IA de rack de próxima geração baseada em AMD Helios e Nvidia Vera Rubin", dando à Microsoft poder de negociação e flexibilidade operacional caso um dos fornecedores enfrente restrições de alocação . A estratégia é amplamente descrita no setor como "apostar nos dois lados" na aquisição de infraestrutura de IA .
Nem a AMD nem a Microsoft divulgaram preços exatos, mas as estimativas de analistas do grupo Futurum fornecem uma comparação clara:
Isso torna o Helios cerca de 40% mais caro em uma comparação rack a rack . O prêmio reflete a maior capacidade de memória do Helios, sua arquitetura aberta e o portfólio integrado de CPU-GPU-rede da AMD .
A AMD argumenta que o custo inicial mais alto do Helios é justificado por uma eficiência de desempenho superior. De acordo com dados de laboratório da própria AMD, o Helios oferece :
A CEO da AMD, Lisa Su, apresentou esses números no evento Advancing AI 2026, afirmando que o Helios oferece "15% ou mais desempenho que a concorrência nos maiores modelos, 50% mais capacidade de HBM e até 30% mais tokens por dólar" .
No entanto, analistas alertam que estas são estimativas de pré-produção. O grupo Futurum observou que "as alegações de vantagem de desempenho de 15% e de 30% mais tokens por dólar da AMD continuam sendo cálculos internos contra um concorrente que ainda não foi enviado e serão testados em produção dentro de dois trimestres" .
O AMD Helios é um sistema de rack de escala, construído sob medida e refrigerado a líquido, que representa a oferta de hardware de IA mais abrangente da empresa até o momento :
| Componente | Especificação |
|---|---|
| GPUs | 72x AMD Instinct MI455X |
| Arquitetura GPU | CDNA 5 (híbrido de chiplet 2nm/3nm na TSMC) |
| Transistores por GPU | 320 bilhões |
| CPU | 18x AMD EPYC "Venice" de 6ª geração (um por bandeja de computação, até 256 núcleos por CPU) |
| Rede | NICs de IA AMD Pensando "Vulcano" 800 (Ethernet de 800 Gbps, até 2,4 Tbps de largura de banda de expansão por GPU) |
| Interconexão de expansão interna | UALink (Ultra Accelerator Link tunelado sobre Ethernet) |
| Interconexão de expansão externa | Alinhada ao Ultra Ethernet Consortium (UEC) |
| Memória HBM4 total | 31 TB por rack |
| Memória por GPU | 432 GB (12 pilhas de HBM4 de 36 GB cada) |
| Largura de banda de memória por GPU | 19,6 TB/s |
| Largura de banda de memória agregada | 1,7 PB/s por rack |
| Desempenho FP4 | 2,9 exaFLOPS por rack |
| Desempenho FP8 | 1,4 exaFLOPS por rack |
| Largura de banda de expansão interna | 260 TB/s |
| Largura de banda de expansão externa | 43 TB/s |
| Fator de forma | 18 bandejas de computação refrigeradas a líquido (4 GPUs cada) + 6 bandejas de switch, compatível com OCP Open Rack Wide |
| Desempenho por GPU | 40 PFLOPS FP4, 20 PFLOPS FP8 |
Cada bandeja de computação contém quatro GPUs MI455X emparelhadas com uma única CPU EPYC Venice e rede Pensando, todas conectadas via protocolo UALink para permitir que as 72 GPUs funcionem como uma única unidade de computação .
A AMD garantiu os seguintes primeiros clientes confirmados para o Helios :
Uma ausência notável: Anthropic não foi nomeado publicamente como um cliente inicial do Helios em nenhum grande anúncio até julho de 2026 .
A decisão da Microsoft de implantar tanto o AMD Helios quanto o Nvidia Vera Rubin sinaliza que o mercado de hardware de IA entrou em uma nova fase. Em vez de uma dependência de um único fornecedor, as grandes empresas de nuvem estão investindo em diversificação de plataformas para garantir suprimento, melhorar o poder de negociação e acessar características de desempenho diferenciadas .
O AMD Helios, com seus massivos 31 TB de memória HBM4 e interconexão aberta baseada em Ethernet, é particularmente adequado para cargas de trabalho de inferência em larga escala, onde a capacidade e a largura de banda da memória impulsionam diretamente o rendimento e o custo por token . Com remessas esperadas para o segundo semestre de 2026, o verdadeiro teste virá quando os benchmarks de produção forem publicados e as alegações concorrentes puderem ser verificadas em escala .