Taalas가 해결한 핵심 문제는 '메모리 벽(Memory Wall)'입니다. 기존의 모든 GPU(엔비디아 포함)는 AI 모델 가중치를 HBM(고대역폭 메모리)에서 연산 코어로 전송하는 데 대부분의 시간과 에너지를 소비합니다. 이 데이터 이동이 추론 처리량의 한계를 결정짓고 전력을 낭비합니다.
Taalas의 해결책은 **모델 특화 집적 회로(MSIC)**입니다. 이 회사는 제조 공정 중에 모델의 데이터 흐름 아키텍처와 숫자 가중치를 칩의 로직 및 금속 레이어에 직접 하드와이어링합니다. 메모리에서 가중치를 로딩하는 과정이 완전히 사라지면서 병목 현상이 제거됩니다.
그 결과는 극적입니다. TSMC 6나노 공정으로 제작된 Taalas의 HC1 테스트 칩은 2026년 2월, Meta의 Llama 3.1 8B 모델을 초당 16,960토큰으로 처리했습니다. 이는 동급 엔비디아 GPU 추론 속도보다 최대 48배 빠른 수치이며, 일부 소식통은 엔비디아 기준에 따라 최대 73배까지 빠르다고 전하기도 합니다.
가중치가 공장에서 물리적으로 실리콘에 각인되기 때문에, 각 Taalas 칩은 제조된 그 단일 모델만 실행할 수 있습니다. 다른 모델을 로딩하는 것이 불가능합니다.
하지만 Taalas는 이러한 경직성을 완화하는 툴체인을 개발했습니다. 약 100개 층의 칩 스택 중 상위 2개의 금속 레이어만 최종 확정하면 되기 때문에, 새 모델을 테이프아웃하는 데 약 두 달밖에 걸리지 않습니다. 기본 웨이퍼 설계는 일정하게 유지되므로, 기존 ASIC(주문형 반도체) 개발에 비해 재설계 속도가 매우 빠릅니다.
AMD는 Taalas MSIC을 자사의 Instinct GPU 및 Helios 랙스케일 시스템과 함께 분산형 이기종 컴퓨팅 아키텍처에 통합할 계획입니다.
이 설계에서 범용 Instinct GPU는 학습(Training)과 유연한 추론 작업을 담당하고, Taalas 칩은 수요가 가장 높은 모델을 위한 초고처리량, 초저지연 전용 추론 가속기로 배치됩니다. Helios 플랫폼은 이들을 하나의 통합 랙스케일 패브릭으로 연결합니다.
이를 통해 AMD는 고객에게 다양한 워크로드를 처리하는 유연한 GPU와, 고정된 대량 트래픽 모델을 위한 초고효율 MSIC이라는 계층화된 추론 솔루션을 제공할 수 있게 됐습니다.
인수 조건은 공개되지 않았습니다. 이번 인수는 AMD의 일련의 주요 인수 중 하나입니다: ZT Systems(2024년 7월, 49억 달러)와 Silo AI(2024년 8월, 6억 6,500만 달러) 인수에 이은 결정입니다.
경쟁 측면에서, 이번 거래는 AMD를 엔비디아와의 정면 대결 구도로 이끕니다. 엔비디아는 2026년 초, Groq의 LPU 추론 아키텍처에 접근하기 위해 200억 달러 규모의 라이선스 계약을 체결한 바 있습니다. AMD는 Taalas의 모델 특화 하드와이어링 방식이 고정된 대량 추론 워크로드에서 더 나은 성능-전력 효율을 제공할 수 있다고 믿고 있습니다.
Taalas는 2023년 토론토에서 Ljubisa Bajic(전 Tenstorrent CEO)와 전 AMD 엔지니어들이 포함된 팀에 의해 설립되었습니다.
이 회사는 인수 전까지 Eclipse Ventures, Makers Fund, Radical Ventures 등으로부터 총 2억 1,900만 달러의 벤처 투자를 유치했습니다.
2026년 2월, HC1 칩을 공개하며 Llama 3.1 8B를 초당 16,960토큰 속도로 구동하는 벤치마크를 선보였고, 이것이 AMD의 이목을 끌었습니다.
AMD의 Taalas 인수는 AI 추론의 미래가 더 빠른 범용 GPU가 아니라, 가장 중요한 모델을 위해 유연성을 희생하고 극한의 효율성을 추구하는 특수 목적 칩에 달려 있다는 확신을 보여줍니다. Taalas MSIC을 Instinct GPU와 분산 아키텍처로 결합함으로써, AMD는 다양한 모델의 롱테일(Long Tail)과 인기 모델의 대량 트래픽을 모두 처리할 수 있는 시스템을 구축하고 있으며, 이는 엔비디아의 GPU 중심 추론 스택에 대한 직접적인 도전장입니다.