Для индустрии это важный поворот: вместо попытки сделать универсальный ускоритель ещё мощнее AMD получает технологию, которая жертвует гибкостью ради максимальной скорости на самых востребованных моделях.
При работе большой языковой модели графический процессор должен постоянно перемещать её веса из высокоскоростной памяти HBM (High Bandwidth Memory) к вычислительным ядрам. Именно это перемещение данных, а не сами математические операции, создаёт так называемую «стену памяти»: оно ограничивает пропускную способность и расходует значительную часть энергии.
Taalas предлагает убрать этот этап. Компания называет свою разработку model-specific integrated circuits, или MSIC, — специализированными интегральными схемами для конкретной модели. Во время производства в логику чипа и его металлические слои встраиваются как структура прохождения данных, так и числовые веса нейросети. Поэтому загружать веса из памяти при генерации каждого нового токена уже не требуется.
В феврале 2026 года тестовый чип Taalas HC1, изготовленный по 6-нм техпроцессу TSMC, обеспечил работу Meta Llama 3.1 8B со скоростью 16 960 токенов в секунду. Этот показатель был представлен как результат до 48 раз выше, чем у сопоставимого GPU Nvidia на той же задаче. В зависимости от выбранной конфигурации Nvidia некоторые источники приводят оценку до 73 раз.
Важно, что речь идёт о специализированном тестовом чипе и сравнении для конкретной модели. Это не означает, что любой чип Taalas будет быстрее любого GPU Nvidia во всех задачах.
У подхода Taalas есть принципиальное ограничение. Поскольку веса модели физически «запечены» в кремнии на этапе производства, каждый чип рассчитан только на одну модель. Установить на него другую нейросеть обычной загрузкой программного обеспечения нельзя — для этого потребуется изготовить новый вариант чипа.
Стартап, однако, разработал технологический процесс, который сокращает срок такой адаптации. В конструкции примерно со 100 слоями финализируются только два верхних металлических слоя. Базовая структура пластины при этом сохраняется, поэтому перенос новой модели от готового дизайна к выпуску кремния может занимать около двух месяцев — заметно меньше, чем полноценная разработка нового ASIC с нуля.
AMD планирует использовать MSIC не вместо универсальных ускорителей, а вместе с ними — в разделённой гетерогенной архитектуре. В такой системе разные типы чипов получают разные задачи.
Для клиентов это означает своего рода многоуровневую инфраструктуру: универсальные GPU для широкого спектра задач и фиксированные MSIC для сервисов, которым требуется постоянно обслуживать огромный поток запросов к одной или нескольким конкретным моделям.
Финансовые условия приобретения Taalas не раскрыты. Сделка продолжает серию крупных приобретений AMD, включая покупку ZT Systems за 4,9 млрд долларов в июле 2024 года и Silo AI за 665 млн долларов в августе того же года.
Одновременно AMD усиливает позиции в борьбе с Nvidia за рынок ИИ-инференса — то есть за запуск уже обученных моделей и генерацию ответов для пользователей. По сообщениям, ранее в 2026 году Nvidia заключила лицензионное соглашение с Groq на сумму 20 млрд долларов, получив доступ к архитектуре процессоров Groq для инференса.
Ставка AMD отличается: компания рассчитывает, что физическое встраивание весов даст ещё более высокую производительность на ватт в сценариях с большим объёмом запросов к фиксированным моделям.
Taalas появилась в Торонто в 2023 году. Компанию основал Любиша Баич, ранее занимавший пост генерального директора другой ИИ-чиповой компании, Tenstorrent, вместе с командой, в которую вошли бывшие инженеры AMD.
До приобретения стартап привлёк 219 млн долларов венчурного финансирования. Среди инвесторов назывались Eclipse Ventures, Makers Fund, Radical Ventures и другие фонды.
Первой заметной демонстрацией компании стал чип HC1, показанный в феврале 2026 года на задаче с Llama 3.1 8B. Именно результат в 16 960 токенов в секунду привлёк внимание AMD.
Приобретение Taalas показывает, что борьба за инференс постепенно выходит за рамки гонки универсальных GPU. Для обучения и постоянно меняющегося набора моделей гибкость по-прежнему критически важна. Но в крупных сервисах значительная доля запросов может приходиться на несколько наиболее популярных моделей — и здесь специализированный кремний способен оказаться эффективнее универсального ускорителя.
AMD пытается объединить оба подхода: Instinct GPU должны закрыть длинный хвост разнообразных задач, а MSIC Taalas — обслуживать массовые потоки запросов к заранее известным моделям. Успех стратегии будет зависеть от того, насколько быстро Taalas сможет адаптировать чипы к новым версиям моделей и насколько стабильно крупные заказчики смогут использовать такую менее гибкую инфраструктуру.