Vấn đề cốt lõi mà Taalas giải quyết là 'bức tường bộ nhớ' (memory wall) — mọi GPU thông thường, bao gồm cả của Nvidia, đều dành phần lớn thời gian và năng lượng để luân chuyển trọng số mô hình AI từ bộ nhớ băng thông cao (HBM) đến các lõi tính toán. Sự di chuyển dữ liệu này làm giới hạn thông lượng suy luận (inference) và lãng phí điện năng.
Giải pháp của Taalas là Mạch tích hợp chuyên biệt cho mô hình (MSIC). Công ty 'nối cứng' cả kiến trúc luồng dữ liệu và trọng số số của mô hình trực tiếp vào các lớp logic và kim loại của chip trong quá trình sản xuất. Không còn bất kỳ việc tải trọng số từ bộ nhớ nào diễn ra, loại bỏ hoàn toàn điểm nghẽn.
Kết quả về tốc độ là vô cùng ấn tượng. Chip thử nghiệm HC1 của Taalas, được sản xuất trên tiến trình 6nm của TSMC, phục vụ mô hình Llama 3.1 8B của Meta với tốc độ 16.960 token mỗi giây vào tháng 2 năm 2026 — được mô tả là nhanh hơn tới 48 lần so với GPU Nvidia tương đương. Một số nguồn tin còn dẫn ra con số lên tới 73 lần tùy thuộc vào GPU Nvidia cụ thể được so sánh.
Bởi vì trọng số được 'nướng' vật lý vào silicon ngay tại nhà máy, mỗi chip Taalas chỉ có thể chạy một mô hình duy nhất mà nó được sản xuất ra. Bạn không thể tải một mô hình khác lên đó.
Tuy nhiên, Taalas đã phát triển một chuỗi công cụ giúp giảm thiểu sự cứng nhắc này. Nó chỉ hoàn thiện hai lớp kim loại trên cùng của một chồng chip khoảng 100 lớp, cho phép rút ngắn thời gian sản xuất một mẫu chip mới xuống còn khoảng hai tháng. Thiết kế đế wafer bên dưới vẫn không đổi, giúp việc sản xuất lại nhanh hơn nhiều so với phát triển ASIC truyền thống.
AMD có kế hoạch tích hợp các MSIC của Taalas vào một kiến trúc điện toán phân tán, không đồng nhất cùng với GPU Instinct và hệ thống rack-scale Helios.
Trong thiết kế này, GPU Instinct đa năng sẽ đảm nhận việc huấn luyện và các khối lượng công việc suy luận linh hoạt, trong khi các chip Taalas được triển khai như những bộ tăng tốc suy luận chuyên dụng có thông lượng cao, độ trễ thấp cho các mô hình được yêu cầu nhiều nhất. Nền tảng Helios kết nối chúng trong một kiến trúc rack-scale thống nhất.
Cách tiếp cận này cho phép AMD cung cấp cho khách hàng một giải pháp suy luận phân tầng: GPU linh hoạt cho các khối lượng công việc đa dạng và MSIC siêu hiệu quả cho các mô hình cố định, lưu lượng cao.
Các điều khoản của thương vụ không được tiết lộ. Thương vụ mua lại này là một phần trong chuỗi các thương vụ mua lại lớn của AMD: thương vụ mua lại ZT Systems trị giá 4,9 tỷ USD (tháng 7/2024) và thương vụ mua lại Silo AI trị giá 665 triệu USD (tháng 8/2024).
Về mặt cạnh tranh, thương vụ này đặt AMD vào thế đối đầu với thỏa thuận cấp phép trị giá 20 tỷ USD được báo cáo giữa Nvidia và Groq (được công bố hồi đầu năm 2026), cho phép Nvidia tiếp cận kiến trúc suy luận LPU của Groq. AMD đặt cược rằng phương pháp 'nối cứng' dành riêng cho mô hình của Taalas có thể mang lại hiệu suất trên mỗi watt thậm chí còn tốt hơn cho các khối lượng công việc suy luận cố định, lưu lượng cao.
Taalas được thành lập vào năm 2023 tại Toronto bởi Ljubisa Bajic (cựu CEO của Tenstorrent, một startup AI chip khác) và một nhóm bao gồm các cựu kỹ sư của AMD.
Công ty đã huy động được 219 triệu đô la Mỹ tài trợ từ các nhà đầu tư mạo hiểm bao gồm Eclipse Ventures, Makers Fund, Radical Ventures, và những quỹ khác trước khi được mua lại.
Taalas đã trình diễn chip HC1 vào tháng 2 năm 2026, chạy Llama 3.1 8B với điểm chuẩn 16.960 token/giây, thu hút sự chú ý của AMD.
Thương vụ mua lại Taalas của AMD là một canh bạc rằng tương lai của suy luận AI không nằm ở những GPU đa năng ngày càng nhanh hơn, mà nằm ở những con chip được chế tạo có mục đích, hy sinh tính linh hoạt để đạt hiệu quả tối đa trên những mô hình quan trọng nhất. Bằng cách kết hợp MSIC của Taalas với GPU Instinct trong một kiến trúc phân tán, AMD đang xây dựng một hệ thống có thể xử lý cả những mô hình đa dạng và lưu lượng truy cập lớn của những mô hình phổ biến nhất — một thách thức trực tiếp đối với 'ngăn xếp' suy luận do GPU của Nvidia thống trị.