La strategia punta a risolvere uno dei principali colli di bottiglia dell'IA moderna. Ma impone anche una rinuncia importante: un chip progettato per un modello non può essere riconfigurato per eseguirne un altro.
Nei sistemi convenzionali, comprese le GPU Nvidia, una parte significativa del tempo e dell'energia viene spesa nello spostamento dei pesi del modello dalla memoria ad alta larghezza di banda — la HBM, High Bandwidth Memory — ai nuclei di calcolo. È il cosiddetto “memory wall”, il muro della memoria: la velocità dell'inferenza non dipende soltanto dalla capacità di calcolo, ma anche dalla rapidità con cui i dati possono essere trasferiti.
Taalas elimina alla radice questo passaggio. I suoi model-specific integrated circuits, o MSIC, incorporano nel chip sia l'architettura del flusso di dati sia i valori numerici dei pesi del modello, fissandoli nella logica e negli strati metallici durante la produzione. Non è quindi necessario caricare continuamente i pesi dalla memoria.
Il risultato dichiarato è particolarmente ambizioso. Nel febbraio 2026 il chip di prova HC1, realizzato con un processo produttivo a 6 nanometri di TSMC, ha eseguito Meta Llama 3.1 8B a 16.960 token al secondo. Secondo i confronti riportati, si tratta di una velocità fino a 48 volte superiore a quella di un'inferenza equivalente su una GPU Nvidia. Alcune fonti indicano un vantaggio massimo di 73 volte, a seconda della GPU usata come riferimento.
Il dato va letto come un benchmark relativo a un modello specifico e a una particolare configurazione, non come un'accelerazione generalizzata di ogni carico di lavoro IA. È proprio questa specializzazione, però, a permettere a Taalas di puntare a prestazioni elevate e a una maggiore efficienza energetica sui modelli più richiesti.
Il limite principale è insito nel progetto. Poiché i pesi vengono fisicamente integrati nel silicio, ogni chip Taalas può eseguire soltanto il modello per cui è stato fabbricato. Non è possibile installarvi in seguito un modello diverso, come si farebbe su una GPU programmabile.
La startup ha cercato di ridurre il problema con una procedura di produzione più agile. Il suo strumento finalizza soltanto i due strati metallici superiori di una struttura che ne comprende circa 100. Questo consentirebbe di preparare il tape-out — il passaggio finale verso la fabbricazione — di un nuovo modello in circa due mesi, mantenendo invariato il progetto di base del wafer.
In pratica, Taalas sacrifica la flessibilità per ottenere un'accelerazione dedicata. Il modello è meno adatto a scenari imprevedibili o a una grande varietà di modelli, ma può diventare interessante quando un singolo sistema viene interrogato milioni di volte.
AMD prevede di inserire gli MSIC di Taalas in un'architettura di calcolo disaggregata ed eterogenea, insieme alle GPU Instinct e ai sistemi rack-scale Helios.
L'idea è dividere i compiti in base alle loro esigenze:
Per AMD, il vantaggio sarebbe proporre una soluzione a più livelli: GPU general-purpose per la coda lunga di modelli e applicazioni, più chip MSIC estremamente efficienti per i carichi fissi e ad alto volume.
I termini economici dell'operazione non sono stati resi pubblici. L'acquisizione si inserisce nella serie di investimenti con cui AMD sta rafforzando la propria offerta per l'intelligenza artificiale, dopo l'acquisto di ZT Systems per 4,9 miliardi di dollari nel luglio 2024 e quello di Silo AI per 665 milioni di dollari nell'agosto dello stesso anno.
Sul fronte competitivo, l'operazione arriva mentre Nvidia avrebbe raggiunto un accordo di licenza da 20 miliardi di dollari con Groq, annunciato nel 2026, ottenendo accesso all'architettura LPU dell'azienda per l'inferenza.
La scommessa di AMD è diversa: invece di puntare soltanto su acceleratori flessibili, vuole offrire hardware costruito intorno ai modelli che generano più traffico. Se la tecnologia manterrà le promesse, potrebbe garantire un rapporto prestazioni-consumi superiore nei servizi IA caratterizzati da richieste numerose e ripetitive.
Taalas è stata fondata a Toronto nel 2023 da Ljubisa Bajic, già amministratore delegato di Tenstorrent, un'altra startup attiva nei chip per l'intelligenza artificiale, insieme a un gruppo che comprendeva anche ex ingegneri AMD.
Prima dell'acquisizione, la società aveva raccolto 219 milioni di dollari in finanziamenti da investitori tra cui Eclipse Ventures, Makers Fund e Radical Ventures.
Il chip HC1, presentato nel febbraio 2026, e il benchmark su Llama 3.1 8B a 16.960 token al secondo hanno rappresentato la dimostrazione tecnica che ha attirato l'attenzione di AMD.
L'acquisizione di Taalas mostra che la prossima fase della competizione sull'inferenza IA potrebbe non essere una semplice gara a chi costruisce la GPU più potente. Una parte del mercato potrebbe orientarsi verso chip specializzati, capaci di rinunciare alla versatilità per offrire velocità e consumi migliori sui modelli più utilizzati.
Affiancando gli MSIC alle GPU Instinct e alla piattaforma Helios, AMD cerca di coprire entrambi gli scenari: la flessibilità necessaria per addestrare ed eseguire modelli diversi e l'efficienza dei circuiti progettati per un singolo modello. È una sfida diretta alla centralità delle GPU nell'infrastruttura IA, ma il successo dipenderà dalla rapidità con cui cambiano i modelli e dalla reale domanda per acceleratori così specializzati.