Dans un GPU classique, y compris les accélérateurs Nvidia, une grande partie du temps et de l’énergie est consacrée au déplacement des poids du modèle entre la mémoire à haut débit — la HBM, pour High Bandwidth Memory — et les unités de calcul. Ce phénomène, souvent appelé « mur mémoire », limite le débit d’inférence bien davantage que les opérations mathématiques elles-mêmes.
Taalas contourne ce problème avec ses circuits intégrés spécifiques à un modèle, ou MSIC (model-specific integrated circuits). Lors de la fabrication, l’entreprise inscrit dans les couches logiques et métalliques de la puce à la fois le cheminement des données et les poids numériques du modèle. Il n’est donc plus nécessaire de recharger ces poids depuis la mémoire à chaque génération de token.
Le résultat annoncé est spectaculaire. Fabriquée avec un procédé de gravure en 6 nanomètres de TSMC, la puce expérimentale HC1 de Taalas a fait fonctionner le modèle Llama 3.1 8B de Meta à 16 960 tokens par seconde en février 2026. Taalas a présenté ce résultat comme pouvant atteindre 48 fois la vitesse d’une inférence équivalente sur GPU Nvidia. Selon la plateforme Nvidia retenue comme référence, certaines comparaisons avancent même un facteur de 73.
Cette architecture a toutefois une contrepartie difficile à ignorer : les poids étant physiquement intégrés à la puce, celle-ci ne peut exécuter que le modèle pour lequel elle a été fabriquée. Impossible de remplacer simplement le modèle par un autre, comme on installerait un nouveau logiciel sur un GPU généraliste.
Taalas cherche néanmoins à réduire le délai nécessaire pour produire une nouvelle version. Son outil de conception ne finalise que les deux couches métalliques supérieures d’un empilement qui en compte environ 100. La base de la tranche de silicium reste identique, ce qui permettrait de concevoir et de lancer une puce adaptée à un nouveau modèle en environ deux mois.
Le principe est donc clair : sacrifier la polyvalence pour obtenir un rendement maximal sur les modèles les plus utilisés et les plus sollicités.
AMD ne prévoit pas de remplacer ses GPU par les MSIC de Taalas. L’entreprise veut plutôt les intégrer à une architecture de calcul hétérogène et désagrégée, aux côtés de ses GPU Instinct et de ses systèmes en rack Helios.
Dans cette organisation :
AMD pourrait ainsi proposer une stratégie à deux niveaux : des GPU capables de s’adapter à une grande variété de modèles, et des MSIC extrêmement efficaces pour les services qui exécutent en permanence un nombre limité de modèles très demandés.
Les conditions financières de l’opération n’ont pas été dévoilées. Elle s’inscrit dans une série d’acquisitions destinées à renforcer la présence d’AMD dans l’écosystème de l’IA, après le rachat de ZT Systems pour 4,9 milliards de dollars en juillet 2024 et celui de Silo AI pour 665 millions de dollars en août 2024.
Sur le plan concurrentiel, l’opération intervient alors que Nvidia aurait conclu en 2026 un accord de licence de 20 milliards de dollars avec Groq, donnant au groupe un accès à l’architecture d’inférence LPU de cette entreprise. AMD fait ici un pari différent : pour les charges fixes et massives, une puce conçue autour d’un modèle précis pourrait offrir un meilleur rapport performances-énergie qu’un accélérateur généraliste.
Taalas a été créée à Toronto en 2023 par Ljubisa Bajic, ancien directeur général de la startup de puces d’IA Tenstorrent, avec une équipe comprenant d’anciens ingénieurs d’AMD.
Avant son acquisition, l’entreprise avait levé 219 millions de dollars auprès de fonds comme Eclipse Ventures, Makers Fund et Radical Ventures, entre autres investisseurs.
Sa démonstration de février 2026 a constitué son principal coup d’éclat public : la puce HC1 y exécutait Llama 3.1 8B à 16 960 tokens par seconde. C’est ce type de performance sur une tâche d’inférence précise qui a attiré l’attention d’AMD.
Avec Taalas, AMD parie que l’avenir de l’inférence ne reposera pas uniquement sur des GPU toujours plus puissants. Pour certains modèles dominants, le matériel pourrait être conçu directement autour du logiciel, au prix d’une flexibilité moindre.
L’association entre les MSIC de Taalas et les GPU Instinct permettrait à AMD de couvrir les deux extrémités du marché : la diversité des modèles d’un côté, et le traitement ultra-rapide de volumes massifs de requêtes de l’autre. C’est une nouvelle offensive contre la domination de Nvidia dans les infrastructures d’IA — non pas en reproduisant exactement son approche, mais en essayant de rendre les puces spécialisées incontournables pour l’inférence à grande échelle.