To rozwiązanie może znacząco zwiększyć szybkość i efektywność energetyczną inferencji, czyli procesu generowania odpowiedzi przez wytrenowany model. Ceną jest jednak niemal całkowita utrata elastyczności: jeden chip jest projektowany pod jeden konkretny model.
W tradycyjnych akceleratorach, w tym w układach Nvidii, dużą część czasu i energii pochłania przesyłanie wag modelu z pamięci o wysokiej przepustowości — HBM (High Bandwidth Memory) — do rdzeni obliczeniowych. To ograniczenie często określa się mianem „ściany pamięci” (memory wall). Problemem nie jest więc wyłącznie samo wykonywanie obliczeń, ale także ciągłe przemieszczanie ogromnych ilości danych.
Taalas eliminuje ten etap za pomocą układów określanych jako model-specific integrated circuits (MSIC), czyli układów scalonych tworzonych dla konkretnego modelu. Podczas produkcji w krzemie zapisywane są zarówno wagi modelu, jak i jego architektura przepływu danych. Chip nie musi później ładować wag z pamięci — są one częścią jego logiki i warstw metalicznych.
Efekt był widoczny w demonstracji testowego układu HC1, wyprodukowanego w technologii 6 nm firmy TSMC. W lutym 2026 r. chip obsługiwał model Meta Llama 3.1 8B z szybkością 16 960 tokenów na sekundę. Według przywoływanych porównań oznaczało to nawet 48-krotnie wyższą wydajność niż w przypadku porównywalnej inferencji na GPU Nvidii. Niektóre źródła podają wynik sięgający 73 razy, zależnie od przyjętego układu referencyjnego.
To wynik z testu konkretnego modelu i konkretnej konfiguracji, a nie uniwersalna obietnica, że każdy model AI będzie działał 48 razy szybciej. Pokazuje jednak, jak wiele można zyskać, gdy sprzęt zostanie całkowicie podporządkowany jednemu zadaniu.
Wagi są fizycznie „wypalone” w krzemie podczas produkcji. Dlatego układ Taalas może uruchamiać tylko model, dla którego został przygotowany. Nie da się po prostu wgrać na niego innego modelu, tak jak robi się to na uniwersalnym GPU.
Startup opracował jednak narzędzia, które mają ograniczyć problem długiego projektowania nowych układów. Taalas finalizuje tylko dwie najwyższe warstwy metaliczne w stosie liczącym około 100 warstw. Dzięki temu przygotowanie układu dla nowego modelu ma zajmować mniej więcej dwa miesiące. Bazowy projekt wafla pozostaje bez zmian, co przyspiesza kolejne wersje w porównaniu z tradycyjnym procesem tworzenia układów ASIC.
AMD chce włączyć układy MSIC Taalas do heterogenicznej, rozdzielonej architektury obliczeniowej, działającej obok procesorów graficznych Instinct i systemów Helios przeznaczonych do budowy całych szaf serwerowych.
W takim układzie GPU Instincty zachowałyby rolę uniwersalnych akceleratorów do trenowania modeli oraz obsługi zróżnicowanych zadań inferencyjnych. Układy Taalas byłyby natomiast przeznaczone do modeli o bardzo dużym i stabilnym zapotrzebowaniu — tam, gdzie liczą się wysoka przepustowość, niskie opóźnienia i możliwie niski koszt obsługi. Platforma Helios ma łączyć oba typy sprzętu w ramach wspólnej infrastruktury na poziomie całej szafy.
Dla klientów oznaczałoby to bardziej warstwową ofertę: elastyczne GPU do szerokiego zakresu zastosowań oraz wyspecjalizowane MSIC do obsługi najpopularniejszych modeli w dużej skali.
Warunki finansowe transakcji nie zostały ujawnione. Przejęcie wpisuje się jednak w serię dużych inwestycji AMD w infrastrukturę i oprogramowanie dla sztucznej inteligencji. W lipcu 2024 r. firma kupiła ZT Systems za 4,9 mld dolarów, a w sierpniu 2024 r. przejęła Silo AI za 665 mln dolarów.
Transakcja wzmacnia też rywalizację AMD z Nvidią na rynku inferencji. Nvidia miała wcześniej zawrzeć, według doniesień, umowę licencyjną z Groq o wartości 20 mld dolarów, uzyskując dostęp do architektury akceleratorów LPU tej firmy. AMD stawia na to, że bezpośrednie zapisanie modelu w krzemie zapewni jeszcze lepszą wydajność na wat w przypadku stałych, masowych obciążeń inferencyjnych.
Taalas powstał w 2023 r. w Toronto. Założył go Ljubisa Bajic, były dyrektor generalny Tenstorrent, wraz z zespołem, w którym znaleźli się także byli inżynierowie AMD.
Przed przejęciem firma zebrała 219 mln dolarów finansowania venture capital. Wśród inwestorów znalazły się m.in. Eclipse Ventures, Makers Fund i Radical Ventures.
W lutym 2026 r. startup zaprezentował układ HC1 działający z modelem Llama 3.1 8B. To właśnie wynik 16 960 tokenów na sekundę zwrócił uwagę AMD.
AMD zakłada, że przyszłość inferencji nie będzie należeć wyłącznie do coraz szybszych, uniwersalnych GPU. Część zadań może trafiać do układów projektowanych od początku dla pojedynczych, szczególnie popularnych modeli.
Połączenie obu podejść ma pozwolić AMD obsługiwać zarówno długi ogon różnorodnych modeli, jak i ogromny ruch generowany przez kilka najczęściej używanych systemów. Taalas nie zastępuje więc GPU Instinct — ma uzupełniać je tam, gdzie elastyczność jest mniej ważna niż szybkość, koszt i efektywność energetyczna.