Desenvolvido em parceria por AMD, Supermicro e Spectro Cloud, a plataforma foi anunciada em 5 de agosto de 2026 durante a conferência Ai4 2026 em Las Vegas . Veja como funciona, quanto custa e para quem é indicada.
O AMD Instinct Coder usa roteamento inteligente de modelos baseado em políticas como seu principal diferencial . Solicitações rotineiras de código — geração, sumarização, refatoração — são atendidas localmente por um modelo GLM-5.2 mixture-of-experts otimizado pela AMD (744 bilhões de parâmetros totais, com aproximadamente 40 bilhões ativados por token) . Consultas complexas de raciocínio podem ser encaminhadas para modelos de fronteira como OpenAI GPT, Anthropic Claude ou Google Gemini quando o modelo local não dá conta . Esse design de inferência em camadas é o mecanismo por trás da economia de custos reivindicada .
O sistema de referência é um appliance pré-validado e integrado em rack que é vendido como um único SKU :
| Componente | Especificação |
|---|---|
| CPUs | 2x processadores AMD EPYC 9575F (64 núcleos cada, 3,3 GHz) |
| GPUs | 8x aceleradores AMD Instinct MI325X (256 GB de memória HBM3E cada, 6 TB/s de pico de largura de banda), disponíveis em versões refrigeradas a ar ou líquido |
| Rede | 2x SmartNICs AMD Pensando Pollara de 400 Gb/s |
| Chassi | Supermicro AS-8126GS-TNMR, totalmente validado e integrado em rack |
O sistema foi projetado como um appliance do tipo "plugou, ligou e funcionou", disponível como um único SKU até o final do trimestre de lançamento .
O PaletteAI Inference Launchpad da Spectro Cloud é a camada de software que torna o hardware útil. Ele oferece :
AMD e Spectro Cloud afirmam que a plataforma pode reduzir os custos com tokens de IA para código em até 70% em comparação com o envio de todas as solicitações para APIs de modelos de fronteira na nuvem . Os materiais da própria AMD citam um período de retorno do investimento (payback) de apenas seis meses . Essas alegações não foram verificadas de forma independente, e a economia real dependerá da carga de trabalho, dos padrões de uso e dos preços das APIs na nuvem de cada organização .
Dan McNamara (SVP e GM, Compute & Enterprise AI, AMD):
"As organizações precisam de controle sobre onde o código é processado, quais modelos são usados e quanto esse uso custa. O AMD Instinct Coder combina a computação de alto desempenho da AMD e um ecossistema de software aberto com as tecnologias da Supermicro e da Spectro Cloud, dando aos clientes uma maneira simples de executar mais cargas de trabalho localmente, usar modelos de fronteira seletivamente e operar a própria infraestrutura."
Tenry Fu (Co-fundador e CEO, Spectro Cloud):
"As organizações não deveriam ter que escolher entre as capacidades dos modelos de fronteira e a economia e o controle da inferência local."
Vik Malyala (SVP, AI and Enterprise, Supermicro):
O papel da Supermicro inclui pré-validação, integração em rack e qualificação do sistema para reduzir a complexidade da implantação e encurtar o caminho do hardware entregue à inferência em produção .
A plataforma foi revelada na Ai4 2026 (4 a 6 de agosto em Las Vegas) . O lançamento responde a um problema empresarial claro: à medida que as organizações escalam agentes de IA para código entre equipes de desenvolvimento e fluxos de trabalho automatizados, os custos com tokens estão subindo rapidamente. A BMC, uma das primeiras a adotar a solução, já implantou a plataforma para seu trabalho de Engenharia Agêntica Helix .
O AMD Instinct Coder se posiciona como uma alternativa governada e local (on-premises) aos assistentes de código puramente baseados em nuvem, equilibrando capacidade, custo e controle para empresas que não podem ou não querem enviar código-fonte proprietário para APIs de terceiros.