Når en vanlig GPU kjører en stor språkmodell, brukes mye av tiden og energien på å flytte modellvekter mellom High Bandwidth Memory (HBM) og beregningskjernene. Denne flaskehalsen omtales ofte som «minneveggen». Problemet er ikke nødvendigvis selve regneoperasjonene, men all datatrafikken som må til for å utføre dem.
Taalas forsøker å fjerne denne trafikken. Selskapets model-specific integrated circuits, eller MSIC-er, har både modellens dataflyt og numeriske vekter bygget inn i logikken og metallagene under produksjonen. Dermed trenger brikken ikke å laste modellvektene fra minnet mens den genererer svar.
Resultatet er høyt tempo i selskapets tidlige demonstrasjoner. Taalas' HC1-testbrikke, produsert med TSMCs 6-nanometersprosess, kjørte Meta-modellen Llama 3.1 8B med 16 960 tokens per sekund i februar 2026. Taalas' ytelse er omtalt som opptil 48 ganger raskere enn inferens på en tilsvarende Nvidia-GPU. Enkelte sammenligninger oppgir opptil 73 ganger, avhengig av hvilken Nvidia-brikke som brukes som referanse.
Et «token» er en liten tekstbit som en språkmodell behandler – ofte et ord eller deler av et ord. Tallet sier derfor noe om hvor raskt modellen kan produsere tekst, men er ikke alene et mål på kvalitet eller hvor godt en løsning fungerer i alle typer arbeidslaster.
Den samme egenskapen som gir Taalas høy hastighet, gjør brikkene lite fleksible. Når vektene er fysisk bygget inn i silisiumet, kan hver brikke bare kjøre modellen den ble produsert for. En annen modell kan ikke lastes inn senere på samme måte som på en generell GPU.
Taalas har likevel utviklet en metode for å gjøre nye versjoner raskere å lage. Selskapet ferdigstiller bare de to øverste metallagene i en brikkeoppbygning på rundt 100 lag. Resten av grunnutformingen kan beholdes, slik at et nytt modelloppsett ifølge kildene kan sendes til produksjon på omtrent to måneder.
Det betyr at løsningen passer best for modeller med svært høy og stabil etterspørsel – for eksempel en bestemt språkmodell som brukes av mange kunder – og dårligere for miljøer som stadig bytter mellom mange modeller.
AMD planlegger å integrere Taalas' MSIC-er i en disaggregert, heterogen arkitektur sammen med Instinct-GPU-er og Helios-systemer for rackskala databehandling.
I praksis innebærer det at ulike typer brikker får ulike oppgaver:
AMD forsøker dermed å tilby en trinnvis løsning: generelle GPU-er for det brede spekteret av AI-arbeidslaster, og spesialiserte MSIC-er for de mest brukte modellene.
Kjøpesummen er ikke offentliggjort. Oppkjøpet kommer etter flere større AMD-transaksjoner, blant annet kjøpet av ZT Systems for 4,9 milliarder dollar i juli 2024 og Silo AI for 665 millioner dollar i august samme år.
Strategisk plasserer avtalen AMD i en enda tydeligere konkurranse med Nvidia i markedet for AI-inferens. Nvidia skal tidligere i 2026 ha inngått en lisensavtale på 20 milliarder dollar med Groq, som gir tilgang til Groqs LPU-arkitektur for inferens.
AMD satser i stedet på at Taalas' modellspesifikke maskinvare kan gi bedre ytelse per watt når arbeidslasten er stor, stabil og knyttet til én bestemt modell.
Taalas ble grunnlagt i Toronto i 2023 av Ljubisa Bajic, tidligere toppsjef i AI-brikkeselskapet Tenstorrent, sammen med et team som også inkluderte tidligere AMD-ingeniører.
Før oppkjøpet hentet selskapet inn 219 millioner dollar i risikokapital fra blant andre Eclipse Ventures, Makers Fund og Radical Ventures.
I februar 2026 viste Taalas frem HC1-brikken med demonstrasjonen av Llama 3.1 8B i 16 960 tokens per sekund – en måling som bidro til å sette selskapets teknologi på kartet.
AMD kjøper ikke bare et nytt brikkeselskap, men en alternativ idé om hvordan AI skal kjøres i datasentre. I stedet for å gjøre generelle GPU-er stadig raskere, kan man bygge maskinvaren rundt modellene som brukes aller mest.
Taalas' teknologi ofrer fleksibilitet for høy ytelse og effektivitet. Ved å kombinere slike spesialbrikker med Instinct-GPU-er håper AMD å dekke begge behov: GPU-er for den lange halen av ulike modeller og Taalas-brikker for den tunge, forutsigbare trafikken fra de mest populære modellene.