Det är ett angrepp på en av AI-industrins största flaskhalsar. Men tekniken innebär också att flexibiliteten går förlorad: ett Taalas-chip kan i praktiken bara köra den modell som det tillverkats för.
I traditionella GPU-baserade AI-system, inklusive Nvidias, måste modellens vikter hela tiden flyttas mellan High Bandwidth Memory, HBM, och beräkningskärnorna. Denna dataflytt tar både tid och energi och har kommit att kallas minnesväggen. Problemet är alltså inte enbart själva matematiken – utan att få rätt data till rätt beräkningsenhet i tid.
Taalas lösning är så kallade model-specific integrated circuits, eller MSIC:er. Under tillverkningen byggs både modellens dataflöde och dess numeriska vikter in i chipets logik- och metallager. När modellen sedan körs behöver vikterna inte läsas in från minnet.
Taalas testchip HC1 tillverkades med TSMC:s 6-nanometersprocess. I februari 2026 körde det Meta:s Llama 3.1 8B med 16 960 token per sekund. Taalas beskrev resultatet som upp till 48 gånger snabbare än inferens på en jämförbar Nvidia-GPU. Andra jämförelser har angett upp till 73 gånger, beroende på vilken Nvidia-plattform som används som referens.
Den stora nackdelen är inbyggd i själva konstruktionen. Eftersom modellvikterna är fysiskt fastlagda i kislet kan ett chip inte laddas om för att köra en annan AI-modell. Vill man stödja en ny modell krävs därför i princip ett nytt chip.
Taalas har dock utvecklat en verktygskedja som ska göra förändringen snabbare än vid traditionell ASIC-utveckling. Företaget färdigställer bara de två översta metallagren i en chipstack på omkring 100 lager. Basdesignen för kiselskivan kan därmed behållas, medan den modell som ska köras byts ut.
Enligt uppgifterna kan det ge en så kallad tape-out – den färdiga designversion som skickas till tillverkning – på ungefär två månader för en ny modell.
AMD vill inte ersätta sina mer flexibla Instinct-GPU:er med Taalas-chip. I stället ska tekniken ingå i en disaggregerad och heterogen beräkningsarkitektur, tillsammans med Instinct och AMD:s rackskaliga Helios-system.
I en sådan uppdelning kan Instinct-GPU:erna hantera träning och inferens där flexibilitet är viktig. Taalas MSIC:er kan samtidigt användas som särskilda acceleratorer för modeller med mycket hög efterfrågan, där låg svarstid och hög genomströmning väger tyngre än möjligheten att byta modell.
Helios ska koppla samman komponenterna i en gemensam rackskalig infrastruktur. För AMD innebär det en mer skiktad produktstrategi: flexibla GPU:er för många olika arbetslaster och extremt effektiva specialchip för ett mindre antal modeller som körs i stor volym.
Villkoren för affären har inte offentliggjorts. Förvärvet följer flera större AMD-affärer, bland annat köpet av ZT Systems för 4,9 miljarder dollar i juli 2024 och förvärvet av Silo AI för 665 miljoner dollar i augusti samma år.
Affären placerar också AMD i direkt konkurrens med Nvidias satsning på inferens. Nvidia har enligt rapporter tecknat ett licensavtal värt 20 miljarder dollar med Groq, som ger tillgång till Groqs LPU-arkitektur för AI-inferens. AMD:s väg är en annan: att låsa in modellen i hårdvaran och därigenom försöka nå ännu bättre prestanda per watt i stora, stabila arbetslaster.
Taalas grundades i Toronto 2023 av Ljubisa Bajic, tidigare vd för AI-chipbolaget Tenstorrent, tillsammans med ett team där även tidigare AMD-ingenjörer ingick.
Före förvärvet tog startupen in 219 miljoner dollar i riskkapital från bland andra Eclipse Ventures, Makers Fund och Radical Ventures.
I februari 2026 demonstrerade företaget HC1 med Llama 3.1 8B. Det var testet på 16 960 token per sekund som bidrog till att sätta fokus på Taalas teknik.
AMD:s köp av Taalas är en satsning på att AI-inferens inte enbart kommer att handla om allt kraftfullare, generella GPU:er. För modeller som används i mycket stora volymer kan ett specialbyggt chip ge högre hastighet och lägre energiförbrukning – om man accepterar att hårdvaran inte kan användas lika fritt.
Genom att kombinera Taalas modellbundna MSIC:er med Instinct-GPU:er försöker AMD täcka båda behoven: flexibilitet för den stora mängden olika AI-modeller och specialiserad kapacitet för de mest efterfrågade. Det är ett försök att utmana Nvidias GPU-dominerade inferensstack med en mer uppdelad modell.