AMD e Cerebras anunciaram uma parceria técnica para construir uma plataforma de inferência de IA 'disaggregated' (separada), combinando a infraestrutura do rack Helios da AMD com o chip Wafer Scale Engine (WSE) da Cer... A arquitetura divide as tarefas: CPUs EPYC da AMD processam a etapa inicial (preparação do promp...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What did AMD and Cerebras announce at AMD's Advancing AI 2026 event regarding a joint AI inferenc. Article summary: Here is a comprehensive, sourced breakdown of what was announced at AMD's Advancing AI 2026 event on July 23, 2026 in San Francisco.. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it usefu
No evento Advancing AI 2026, realizado em 23 de julho em São Francisco, a AMD e a Cerebras anunciaram uma parceria técnica para construir uma nova plataforma de inferência de inteligência artificial . Em vez de depender de uma única arquitetura de GPU para todo o processo, a solução conjunta combina o recém-lançado sistema de rack Helios da AMD com o Wafer-Scale Engine (WSE) da Cerebras em um design 'disaggregated', otimizado para diferentes cargas de trabalho
.
A plataforma utiliza uma abordagem em camadas para a inferência. As CPUs EPYC e as GPUs Instinct da AMD (dentro dos racks Helios) cuidam das etapas iniciais: pré-processamento do prompt, tokenização e processamento de grandes janelas de contexto. O WSE da Cerebras assume então a fase mais intensiva em computação — a geração rápida de tokens, que exige enorme largura de banda de memória e capacidade de processamento paralelo .
Este design 'disaggregated' permite que cada subtarefa de inferência seja executada no chip mais adequado para ela. A AMD fornece a lógica de CPU/GPU de baixa latência para as etapas de propósito geral, enquanto o chip wafer-scale da Cerebras oferece o poder de fogo paralelo massivo para a execução do núcleo do modelo . A CEO da AMD, Lisa Su, descreveu a parceria como parte de uma mudança mais ampla em direção ao uso de diferentes chips para diferentes estágios do pipeline de inferência
.
As empresas afirmam que a plataforma conjunta oferece tempos de resposta significativamente mais baixos para aplicações complexas de IA em comparação com a inferência baseada em GPU monolítica. A linguagem oficial descreve a solução como capaz de entregar 'inferência de IA com latência ultrabaixa e alta taxa de transferência líder do setor' . Números de benchmark específicos — como tokens por segundo ou latência em milissegundos — não foram publicados em detalhes no evento. As ações da Cerebras subiram aproximadamente 6% no dia do anúncio
.
Espera-se que a oferta conjunta esteja disponível através do Cerebras Cloud ainda em 2026. A Cerebras planeja implantar sistemas AMD Helios em seus próprios data centers para hospedar o serviço .
A AMD também lançou oficialmente o Helios, seu primeiro sistema de IA em escala de rack, no evento. A CEO Lisa Su o chamou de 'o rack de IA mais poderoso do mundo' e confirmou que está em produção total . As principais especificações incluem:
O Helios é posicionado como um concorrente direto dos sistemas de rack DGX e HGX da Nvidia, com a AMD alegando desempenho superior em cargas de trabalho de treinamento e inferência de IA .
A mensagem central do Advancing AI 2026 foi que o mercado de inferência de IA está se afastando da dependência de um único tipo de GPU para cada estágio de uma carga de trabalho. Em vez disso, a indústria está migrando para arquiteturas 'disaggregated', otimizadas para cargas de trabalho, que dividem a pré-execução, a execução da inferência e o pós-processamento entre chips especializados de diferentes fornecedores. A AMD enquadrou o Helios e a parceria com a Cerebras como uma alternativa multi-vendor e de ecossistema aberto à abordagem verticalmente integrada da Nvidia .
Além da parceria com a Cerebras e do lançamento do Helios, a AMD fez vários outros anúncios significativos:
A AMD revelou que fechou um acordo de cliente com a Anthropic no início da mesma semana, antes do evento Advancing AI. A Anthropic se juntou à lista dos principais laboratórios de IA que se comprometeram a implantar hardware da AMD (incluindo sistemas Helios) em escala, parte de uma tendência mais ampla de empresas de IA de ponta se diversificando do monopólio de GPU da Nvidia .
A Cerebras teve um ano importante, independentemente de sua parceria com a AMD. A empresa abriu seu capital em 14 de maio de 2026, na Nasdaq sob o ticker CBRS. Ela precificou 30 milhões de ações a US$ 185,00 cada, bem acima da faixa inicialmente esperada de US$ 115 a US$ 125, levantando US$ 5,55 bilhões no maior IPO de tecnologia dos EUA em 2026. As ações dispararam 68% no primeiro dia de negociação, fechando a US$ 311,07 .
Em janeiro de 2026, a OpenAI e a Cerebras anunciaram um acordo plurianual de até 750 megawatts de capacidade de computação. O compromisso inicial foi relatado em aproximadamente US$ 10 bilhões, depois expandido para mais de US$ 20 bilhões (com um potencial teto de US$ 30 bilhões). A OpenAI também teria recebido uma participação acionária de até 10% na Cerebras como parte do acordo .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
AMD e Cerebras anunciaram uma parceria técnica para construir uma plataforma de inferência de IA 'disaggregated' (separada), combinando a infraestrutura do rack Helios da AMD com o chip Wafer Scale Engine (WSE) da Cer...
AMD e Cerebras anunciaram uma parceria técnica para construir uma plataforma de inferência de IA 'disaggregated' (separada), combinando a infraestrutura do rack Helios da AMD com o chip Wafer Scale Engine (WSE) da Cer... A arquitetura divide as tarefas: CPUs EPYC da AMD processam a etapa inicial (preparação do prompt e janelas de contexto longas), enquanto o WSE da Cerebras acelera a geração de tokens, a fase mais intensiva em computa...
O objetivo é oferecer latência ultrabaixa e alta taxa de transferência para aplicações de IA complexas, como agentes virtuais ao vivo e assistentes automatizados.