GPU konvensional, termasuk GPU Nvidia, harus terus memindahkan bobot model AI dari High Bandwidth Memory (HBM) ke inti komputasi. Perpindahan data ini menciptakan apa yang dikenal sebagai memory wall: batas kinerja yang membuat banyak waktu dan energi terpakai bukan untuk menghitung, melainkan untuk memindahkan data.
Taalas mengatasi hambatan tersebut melalui model-specific integrated circuit (MSIC), atau sirkuit terpadu yang dirancang khusus untuk satu model. Arsitektur aliran data dan bobot numerik model ditanamkan langsung ke dalam logika serta lapisan logam chip ketika diproduksi. Dengan begitu, chip tidak perlu memuat bobot dari memori setiap kali menghasilkan token.
Hasil demonstrasinya cukup mencolok. Chip uji HC1, yang dibuat menggunakan proses manufaktur 6 nanometer milik TSMC, menjalankan Meta Llama 3.1 8B pada kecepatan 16.960 token per detik pada Februari 2026. Angka tersebut disebut hingga 48 kali lebih cepat daripada inferensi menggunakan GPU Nvidia yang setara. Beberapa sumber menyebut angka hingga 73 kali, bergantung pada GPU Nvidia yang dijadikan pembanding.
Keunggulan Taalas datang dengan kompromi besar. Karena bobot model sudah “dibakar” secara fisik ke dalam silikon, satu chip Taalas hanya dapat menjalankan model yang memang dirancang untuk chip tersebut. Model lain tidak bisa begitu saja dimuat ke dalamnya.
Taalas mencoba mengurangi kelemahan ini melalui perangkat pengembangan khusus. Perusahaan tersebut hanya memfinalisasi dua lapisan logam teratas dari tumpukan chip yang memiliki sekitar 100 lapisan. Metode ini memungkinkan desain untuk model baru dibuat dan dikirim ke tahap tape-out—tahap final sebelum produksi—dalam waktu sekitar dua bulan. Desain wafer dasarnya tetap sama sehingga pembuatan ulang dapat dilakukan lebih cepat dibandingkan pengembangan ASIC tradisional.
AMD berencana memasukkan MSIC Taalas ke dalam arsitektur komputasi heterogen dan terdisagregasi, bersama GPU Instinct serta sistem rack-scale Helios.
Dalam rancangan ini, GPU Instinct tetap menangani pelatihan model dan beban inferensi yang membutuhkan fleksibilitas. Sementara itu, chip Taalas digunakan sebagai akselerator khusus untuk model-model dengan permintaan sangat tinggi—misalnya model yang harus melayani volume pengguna besar dengan latensi rendah. Platform Helios akan menghubungkan berbagai jenis chip tersebut dalam satu fabric tingkat rak.
Strategi ini memungkinkan AMD menawarkan dua lapisan infrastruktur: GPU serbaguna untuk beragam model dan MSIC yang sangat efisien untuk model tertentu dengan lalu lintas tinggi.
AMD dan Taalas tidak mengungkapkan nilai akuisisi tersebut. Langkah ini melanjutkan serangkaian pembelian besar AMD, termasuk akuisisi ZT Systems senilai 4,9 miliar dolar AS pada Juli 2024 dan Silo AI senilai 665 juta dolar AS pada Agustus 2024.
Akuisisi Taalas juga memperkuat persaingan AMD dengan Nvidia di pasar inferensi AI. Nvidia dilaporkan memiliki kesepakatan lisensi senilai 20 miliar dolar AS dengan Groq, yang diumumkan lebih awal pada 2026 dan memberi Nvidia akses ke arsitektur inference processing unit (LPU) milik Groq. AMD bertaruh bahwa pendekatan Taalas dapat menawarkan kinerja per watt yang lebih baik untuk beban kerja inferensi yang tetap dan ber volume tinggi.
Taalas didirikan di Toronto pada 2023 oleh Ljubisa Bajic, mantan CEO startup chip AI Tenstorrent, bersama tim yang juga mencakup sejumlah mantan insinyur AMD.
Sebelum diakuisisi, perusahaan ini mengumpulkan pendanaan modal ventura sebesar 219 juta dolar AS dari investor seperti Eclipse Ventures, Makers Fund, Radical Ventures, dan sejumlah investor lainnya.
Pada Februari 2026, Taalas mendemonstrasikan chip HC1 yang menjalankan Llama 3.1 8B pada 16.960 token per detik. Demonstrasi inilah yang menjadi salah satu tolok ukur utama teknologi perusahaan tersebut.
Akuisisi Taalas menunjukkan bahwa AMD tidak hanya ingin mengejar GPU yang semakin cepat. Perusahaan ini juga melihat peluang pada chip khusus yang mengorbankan fleksibilitas demi efisiensi ekstrem.
Dengan memadukan MSIC Taalas dan GPU Instinct dalam satu arsitektur, AMD dapat melayani dua kebutuhan sekaligus: beragam model yang membutuhkan perangkat keras serbaguna, serta model populer dengan volume permintaan besar yang membutuhkan kecepatan dan efisiensi maksimal. Ini menjadi tantangan langsung terhadap dominasi GPU Nvidia dalam infrastruktur inferensi AI.