Når en traditionel GPU – også Nvidias – kører en stor sprogmodel, bruger den betydelig tid og energi på at flytte modellens vægte fra High Bandwidth Memory, eller HBM, til chippenes beregningskerner. Denne såkaldte hukommelsesvæg begrænser, hvor hurtigt modellen kan generere svar, selv når selve beregningen er hurtig.
Taalas’ løsning er en model-specifik integreret kreds, forkortet MSIC. Her bygges både modellens dataflow og dens numeriske vægte ind i chippen under produktionen – i logikken og de øverste metallag. Dermed er der ikke behov for at indlæse vægtene fra hukommelsen, hver gang modellen genererer et nyt token.
Resultatet er markant. Taalas’ testchip HC1, der er fremstillet med en 6-nanometer-proces hos TSMC, kørte Meta’s Llama 3.1 8B med 16.960 tokens i sekundet i februar 2026. Det blev beskrevet som op til 48 gange hurtigere end inferens på en tilsvarende Nvidia-GPU. Andre sammenligninger angiver op til 73 gange, afhængigt af hvilken Nvidia-chip der bruges som reference.
Det er værd at understrege, at tallene stammer fra specifikke benchmark- og demonstrationssammenligninger – ikke fra en generel garanti om, at alle AI-modeller vil køre 48 gange hurtigere.
Den høje hastighed kommer med et grundlæggende kompromis. Fordi modellens vægte fysisk er indbygget i silicium, kan en Taalas-chip kun køre den model, den er produceret til. Man kan ikke bare indlæse en ny model, som man kan på en almindelig GPU.
Taalas har dog udviklet en værktøjskæde, der gør nye chipversioner hurtigere at fremstille. Startup’et færdiggør kun de øverste to metallag i en chipstruktur på omkring 100 lag. Det betyder ifølge beskrivelserne, at en ny model kan gå fra fastlagt design til såkaldt tape-out på cirka to måneder. Grunddesignet for selve waferen kan genbruges, mens de modelafhængige lag ændres.
Det gør tilgangen mere praktisk for modeller med meget stor og stabil efterspørgsel – for eksempel en bestemt sprogmodel, som et datacenter kører døgnet rundt. Til gengæld er den mindre oplagt til skiftende modeller, eksperimenter og arbejdsbelastninger, hvor fleksibilitet er vigtigere end maksimal gennemstrømning.
AMD planlægger at indarbejde Taalas’ MSIC’er i en opdelt og heterogen computerarkitektur sammen med virksomhedens Instinct-GPU’er og Helios-systemer til rack-skala.
Tanken er, at de forskellige chiptyper skal løse forskellige opgaver:
På den måde forsøger AMD at tilbyde en trinopdelt løsning: fleksible GPU’er til den brede vifte af AI-opgaver og ultr specialiserede MSIC’er til faste modeller med stor trafik.
AMD har ikke offentliggjort købsprisen for Taalas. Købet føjer sig til en række større opkøb, herunder ZT Systems for 4,9 milliarder dollar i juli 2024 og Silo AI for 665 millioner dollar i august 2024.
Strategisk placerer handlen AMD endnu tydeligere i konkurrencen med Nvidia på markedet for AI-inferens – altså den fase, hvor en allerede trænet model producerer svar. Nvidia har ifølge rapporter indgået en licensaftale på 20 milliarder dollar med Groq, som giver adgang til Groqs LPU-arkitektur til inferens.
AMD satser i stedet på, at Taalas’ model-specifikke hardwiring kan levere endnu bedre ydelse pr. watt i scenarier med store, stabile mængder forespørgsler til de samme modeller. Det er ikke et forsøg på at erstatte GPU’en i alle situationer, men på at supplere den med hardware, der er optimeret til bestemte modeller.
Taalas blev grundlagt i Toronto i 2023 af Ljubisa Bajic, der tidligere var administrerende direktør i AI-chipvirksomheden Tenstorrent, sammen med et hold, der blandt andet omfattede tidligere AMD-ingeniører.
Før opkøbet rejste virksomheden 219 millioner dollar i venturekapital fra blandt andre Eclipse Ventures, Makers Fund og Radical Ventures.
I februar 2026 demonstrerede Taalas HC1-chippen med Llama 3.1 8B. Målingen på 16.960 tokens i sekundet blev det benchmark, der for alvor satte fokus på virksomhedens tilgang.
AMD’s køb af Taalas er et væddemål på, at fremtidens AI-inferens ikke kun skal drives af stadig hurtigere GPU’er. For modeller med meget høj og forudsigelig efterspørgsel kan en chip, der ofrer fleksibilitet for ekstrem effektivitet, være et attraktivt alternativ.
Ved at kombinere Taalas’ MSIC’er med Instinct-GPU’er forsøger AMD at dække begge ender af markedet: GPU’er til den lange hale af forskellige modeller og specialchips til de få modeller, der håndterer den største trafik. Det giver AMD en mere nuanceret udfordring til Nvidias GPU-dominerede AI-infrastruktur – men Taalas’ succes vil i sidste ende afhænge af, hvor stabil efterspørgslen efter de enkelte modeller er.