Das Ergebnis laut den ersten Tests: Taalas’ HC1-Chip verarbeitete Metas Sprachmodell Llama 3.1 8B im Februar 2026 mit 16.960 Tokens pro Sekunde. Das wurde als bis zu 48-mal schneller als eine vergleichbare Nvidia-GPU beschrieben. Je nach verwendeter Nvidia-Referenz nennen einzelne Berichte sogar einen Faktor von bis zu 73.
Bei herkömmlichen GPUs ist nicht allein die Rechenleistung der Engpass. Ein großer Teil der Zeit und Energie fließt dafür, die Gewichte eines KI-Modells aus dem High-Bandwidth Memory (HBM) zu den Rechenkernen zu transportieren. Diese wiederholten Speicherzugriffe begrenzen die Inferenzleistung – ein Problem, das in der Branche oft als „Memory Wall“ bezeichnet wird.
Taalas versucht, diese Grenze grundsätzlich zu umgehen. Die Technologie trägt den Namen Model-Specific Integrated Circuit (MSIC), also ein modellspezifischer integrierter Schaltkreis. Während der Chipfertigung werden sowohl die Datenflussarchitektur als auch die numerischen Gewichte eines konkreten Modells in Logik- und Metallschichten des Chips fest verdrahtet. Ein späteres Nachladen der Gewichte aus dem Speicher ist damit nicht mehr nötig.
Die Beschleunigung wird mit einem erheblichen Verlust an Flexibilität erkauft. Da die Modellgewichte physisch im Silizium verankert sind, kann ein Taalas-Chip nur das Modell ausführen, für das er gefertigt wurde. Ein anderes Modell lässt sich nicht einfach per Software aufspielen.
Taalas will diesen Nachteil mit einer eigenen Entwicklungs- und Fertigungskette abmildern. Bei einem Chipaufbau mit ungefähr 100 Metallschichten werden nur die obersten zwei Schichten für ein neues Modell angepasst. Dadurch soll der sogenannte Tape-out eines neuen Chips in etwa zwei Monaten möglich sein. Das grundlegende Wafer-Design bleibt unverändert, wodurch neue Modellvarianten schneller entstehen können als bei einer vollständig neuen ASIC-Entwicklung.
AMD will die MSICs von Taalas nicht als Ersatz für seine gesamten GPU-Produkte einsetzen. Stattdessen sollen sie Teil einer disaggregierten, heterogenen Rechenarchitektur werden – gemeinsam mit den Instinct-GPUs und den Helios-Systemen für Rechenzentrums-Racks.
Die Aufgaben wären dabei klar verteilt: Die vielseitigen Instinct-GPUs könnten Training und flexible Inferenz übernehmen. Taalas-Chips wären dagegen für besonders häufig nachgefragte Modelle gedacht, bei denen ein hoher Durchsatz und geringe Latenz wichtiger sind als Programmierbarkeit. Die Helios-Plattform soll die verschiedenen Komponenten innerhalb eines gemeinsamen Rack-Verbunds verbinden.
Für AMD entsteht so ein gestuftes Angebot: flexible GPUs für eine große Bandbreite an Anwendungen und hochspezialisierte MSICs für Modelle, die in großen Mengen und möglichst effizient betrieben werden müssen.
Die finanziellen Bedingungen der Übernahme wurden nicht veröffentlicht. Der Kauf folgt auf mehrere größere Zukäufe von AMD, darunter die Übernahme von ZT Systems für 4,9 Milliarden US-Dollar im Juli 2024 und der Kauf von Silo AI für 665 Millionen US-Dollar im August 2024.
Strategisch richtet sich der Schritt vor allem gegen Nvidias starke Stellung bei KI-Beschleunigern. Nvidia soll 2026 einen Lizenzdeal mit Groq im Wert von rund 20 Milliarden US-Dollar vereinbart haben, durch den Nvidia Zugriff auf Groqs LPU-Architektur für Inferenz erhält. AMD setzt dem die These entgegen, dass fest verdrahtete Taalas-Chips bei konstanten, besonders volumenstarken Anwendungen eine noch bessere Leistung pro Watt bieten können.
Taalas wurde 2023 in Toronto von Ljubisa Bajic, dem früheren CEO des KI-Chip-Unternehmens Tenstorrent, und einem Team gegründet, zu dem auch ehemalige AMD-Ingenieure gehörten.
Vor der Übernahme sammelte das Unternehmen 219 Millionen US-Dollar an Risikokapital ein. Zu den genannten Investoren zählen Eclipse Ventures, Makers Fund und Radical Ventures.
Im Februar 2026 präsentierte Taalas seinen ersten Testchip HC1. Bei der Demonstration lief Llama 3.1 8B mit einer Geschwindigkeit von 16.960 Tokens pro Sekunde – der Benchmark, der AMD auf das Unternehmen aufmerksam machte.
Mit Taalas setzt AMD auf eine klare Gegenposition zur Idee, dass immer leistungsfähigere Universal-GPUs die beste Antwort auf jede KI-Aufgabe sind. Der Ansatz lautet stattdessen: Für die meistgenutzten Modelle lohnt sich maßgeschneiderte Hardware, selbst wenn sie dafür ihre Vielseitigkeit verliert.
Ob dieses Konzept im großen Maßstab wirtschaftlich ist, hängt deshalb davon ab, wie stabil die Nachfrage nach einzelnen Modellen bleibt. AMDs Kombination aus Taalas-MSICs und Instinct-GPUs soll genau diesen Zielkonflikt auffangen: Spezialchips für das hohe Volumen, GPUs für den Rest.