O principal gargalo enfrentado pela maioria das GPUs convencionais, incluindo as da Nvidia, não está apenas nos cálculos. Grande parte do tempo e da energia é consumida no transporte contínuo dos pesos do modelo entre a HBM (High Bandwidth Memory, ou memória de alta largura de banda) e os núcleos de processamento. Esse problema é conhecido como “parede da memória” (memory wall) e limita o desempenho da inferência.
A solução da Taalas são os circuitos integrados específicos para modelos, ou MSICs (model-specific integrated circuits). Durante a fabricação, a empresa incorpora à lógica e às camadas metálicas do chip tanto os pesos numéricos do modelo quanto sua arquitetura de fluxo de dados. Assim, o chip não precisa carregar os pesos da memória a cada operação — o gargalo praticamente desaparece.
O resultado apresentado é expressivo. O chip de teste HC1, fabricado com o processo de 6 nanômetros da TSMC, processou o Llama 3.1 8B, da Meta, a 16.960 tokens por segundo em fevereiro de 2026. A Taalas descreveu o desempenho como até 48 vezes superior ao de uma inferência equivalente em uma GPU da Nvidia. Dependendo da GPU usada como referência, algumas fontes mencionam uma vantagem de até 73 vezes.
O ganho de desempenho vem acompanhado de uma limitação estrutural. Como os pesos são incorporados fisicamente ao silício na fábrica, cada chip da Taalas é capaz de executar apenas o modelo para o qual foi produzido. Não é possível simplesmente instalar outro modelo nele, como ocorre em uma GPU de uso geral.
A empresa, porém, criou uma ferramenta para reduzir o tempo necessário à fabricação de uma nova versão. Em uma pilha de aproximadamente 100 camadas, a Taalas finaliza apenas as duas camadas metálicas superiores. Com isso, consegue preparar o chamado tape-out — a etapa que envia o projeto final para fabricação — de um novo modelo em cerca de dois meses. A base do wafer permanece a mesma, tornando as novas versões mais rápidas do que o desenvolvimento tradicional de um ASIC.
A AMD pretende incorporar os MSICs da Taalas a uma arquitetura de computação heterogênea e desagregada, ao lado de suas GPUs Instinct e dos sistemas de escala de rack Helios.
Nesse arranjo, as GPUs Instinct ficariam responsáveis pelo treinamento e por tarefas de inferência que exigem flexibilidade. Já os chips da Taalas seriam usados como aceleradores dedicados para os modelos mais populares e demandados — aqueles que precisam responder a um grande volume de solicitações com baixa latência. A plataforma Helios conectaria esses componentes em uma infraestrutura integrada de escala de rack.
A estratégia permite à AMD oferecer uma solução em camadas: GPUs capazes de lidar com uma grande variedade de cargas e MSICs extremamente eficientes para modelos fixos executados em alto volume.
A AMD não divulgou o valor da operação. A compra ocorre depois de outras aquisições importantes da empresa, como a da ZT Systems por US$ 4,9 bilhões, em julho de 2024, e a da Silo AI por US$ 665 milhões, em agosto de 2024.
No cenário competitivo, o negócio também reforça a disputa da AMD com a Nvidia no mercado de inferência. A Nvidia teria fechado um acordo de licenciamento de US$ 20 bilhões com a Groq, anunciado anteriormente em 2026, dando acesso à arquitetura de inferência LPU da empresa.
A aposta da AMD é que a especialização extrema dos chips da Taalas possa entregar desempenho por watt ainda melhor em cargas de trabalho previsíveis, de alto volume e concentradas em modelos específicos.
A Taalas foi criada em 2023, em Toronto, por Ljubisa Bajic, ex-CEO da Tenstorrent, outra startup de chips para inteligência artificial, junto de uma equipe que incluía antigos engenheiros da AMD.
Antes da aquisição, a empresa havia captado US$ 219 milhões em investimentos de capital de risco, com participação de fundos como Eclipse Ventures, Makers Fund e Radical Ventures.
Em fevereiro de 2026, a Taalas apresentou o chip de teste HC1 executando o Llama 3.1 8B a 16.960 tokens por segundo — demonstração que colocou sua tecnologia no radar da AMD.
A compra da Taalas mostra que a AMD está apostando em um futuro no qual a inferência não dependerá apenas de GPUs cada vez mais rápidas. Para os modelos mais usados, pode fazer sentido trocar parte da flexibilidade por chips construídos sob medida, capazes de operar com maior velocidade e eficiência.
Ao combinar os MSICs da Taalas com as GPUs Instinct, a AMD tenta cobrir os dois extremos do mercado: a variedade de modelos e tarefas atendida por hardware programável e o tráfego intenso dos modelos mais populares atendido por aceleradores dedicados. É uma estratégia que desafia a predominância das GPUs no processamento de IA — sem abandonar completamente esse modelo.