Dat maakt de hardware razendsnel voor het model waarvoor ze is ontworpen — maar ook opvallend gespecialiseerd.
Bij inferentie — het moment waarop een getraind AI-model antwoorden genereert — gaat veel tijd en energie niet naar de berekeningen zelf, maar naar het heen en weer verplaatsen van modelgewichten. Traditionele GPU’s, waaronder die van Nvidia, laden die gegevens voortdurend vanuit zogeheten High Bandwidth Memory (HBM) naar de rekenkernen. Die datastroom vormt een belangrijke snelheidsbeperking, ook wel de ‘memory wall’ genoemd.
Taalas probeert die muur volledig te omzeilen met model-specific integrated circuits (MSIC’s). De startup legt zowel de gegevensstroom van het model als de numerieke gewichten vast in de logica- en metaallagen van de chip. Het model hoeft daardoor tijdens het uitvoeren niet telkens uit geheugen te worden geladen.
De eerste resultaten zijn opvallend. Taalas’ HC1-testchip, geproduceerd met een 6nanometer-procedé van TSMC, draaide in februari 2026 Meta’s Llama 3.1 8B met 16.960 tokens per seconde. Dat werd omschreven als een snelheid tot 48 keer hoger dan die van een vergelijkbare Nvidia-GPU voor dezelfde inferentietaak. Afhankelijk van de gekozen Nvidia-baseline noemen sommige bronnen zelfs een factor van 73.
Een token is een klein stukje tekst dat een taalmodel verwerkt of genereert. Het precieze aantal tokens per seconde is daarom niet hetzelfde als de ervaren snelheid van een chatbot, maar het benchmarkcijfer laat wel zien hoe groot het verschil tussen gespecialiseerde en algemene hardware kan zijn.
De keerzijde zit ingebakken in het ontwerp. Omdat de gewichten fysiek in het silicium zijn verwerkt, kan een Taalas-chip alleen het model uitvoeren waarvoor hij is geproduceerd. Een ander model erop laden, zoals bij een algemene GPU, is niet mogelijk.
Taalas heeft die beperking gedeeltelijk proberen op te vangen met een eigen ontwerpproces. Op een chipstack van ongeveer honderd lagen worden alleen de bovenste twee metaallagen aangepast. Daardoor zou een nieuwe versie voor een ander model in ongeveer twee maanden kunnen worden ontworpen en klaargemaakt voor productie. De onderliggende waferarchitectuur blijft grotendeels hetzelfde, waardoor een nieuwe chipvariant sneller kan worden ontwikkeld dan een volledig nieuwe ASIC.
AMD wil Taalas’ MSIC’s niet simpelweg als vervanging voor zijn GPU’s inzetten. Het bedrijf wil ze onderdeel maken van een gedisaggregeerde, heterogene computerarchitectuur, naast zijn Instinct-GPU’s en Helios-systemen voor datacenter-racks.
In die opzet blijven Instinct-GPU’s geschikt voor het trainen van modellen en voor inferentie waarbij flexibiliteit belangrijk is. Taalas-chips kunnen ondertussen worden ingezet voor populaire modellen die voortdurend grote hoeveelheden verzoeken verwerken en waarbij een lage vertraging en hoge doorvoer centraal staan. Het Helios-platform moet de verschillende chips binnen één rackarchitectuur met elkaar verbinden.
Voor klanten ontstaat zo een gelaagde aanpak: algemene GPU’s voor uiteenlopende modellen en gespecialiseerde MSIC’s voor een beperkt aantal vaste modellen met een zeer hoge vraag.
De financiële voorwaarden van de transactie zijn niet bekendgemaakt. De deal past wel in een bredere reeks grote overnames waarmee AMD zijn positie in AI-hardware probeert uit te bouwen. In juli 2024 kocht het bedrijf ZT Systems voor 4,9 miljard dollar; een maand later volgde de overname van Silo AI voor 665 miljoen dollar.
Strategisch zet AMD zich met Taalas bovendien scherper af tegen Nvidia. Nvidia zou eerder in 2026 een licentieovereenkomst van 20 miljard dollar met Groq hebben gesloten, waarmee het toegang kreeg tot Groqs LPU-architectuur voor inferentie. AMD gokt erop dat het hardbedraden van modellen een nog betere verhouding tussen prestaties en energieverbruik kan bieden bij vaste, grootschalige inferentieworkloads.
Taalas werd in 2023 opgericht in Toronto door Ljubisa Bajic, voormalig topman van AI-chipbedrijf Tenstorrent, samen met een team waarin ook voormalige AMD-ingenieurs zaten.
Voor de overname haalde de startup 219 miljoen dollar aan durfkapitaal op bij onder meer Eclipse Ventures, Makers Fund en Radical Ventures. De demonstratie van de HC1-chip in februari 2026 — met Llama 3.1 8B en een gemeten snelheid van 16.960 tokens per seconde — vormde een belangrijk visitekaartje voor de technologie.
De overname is in essentie een weddenschap op een tweedeling in AI-inferentie. Algemene GPU’s blijven nodig voor de lange staart van modellen en toepassingen die vaak veranderen. Voor de populairste modellen kan het echter efficiënter zijn om de software vrijwel letterlijk in hardware om te zetten.
Door Taalas-chips naast Instinct-GPU’s te plaatsen, probeert AMD beide werelden te bedienen: flexibiliteit waar die nodig is en extreme snelheid voor vaste modellen met veel verkeer. Daarmee vormt Taalas niet alleen een nieuwe chiptechnologie, maar ook een directe poging om Nvidia’s dominante positie in AI-inferentie uit te dagen.