El resultado es un acelerador extremadamente rápido para modelos concretos, aunque mucho menos flexible que una GPU convencional.
En la inferencia —la fase en la que un modelo ya entrenado produce texto, imágenes u otras respuestas— las GPU deben mover constantemente los pesos del modelo desde la memoria de alto ancho de banda, conocida como HBM, hasta los núcleos de cálculo. Ese desplazamiento consume tiempo y energía, y puede convertirse en el principal límite de rendimiento.
Taalas aborda el problema con sus circuitos integrados específicos para modelos, o MSIC por sus siglas en inglés. Estos chips incorporan tanto el flujo de datos del modelo como sus valores numéricos directamente en la lógica y en las capas metálicas del circuito. Al no tener que leer los pesos desde la memoria durante la ejecución, desaparece buena parte del cuello de botella.
El chip de prueba HC1, fabricado con un proceso de 6 nanómetros de TSMC, ejecutó el modelo Llama 3.1 8B, de Meta, a 16.960 tokens por segundo en una demostración realizada en febrero de 2026. Taalas describió ese resultado como hasta 48 veces más rápido que una inferencia equivalente en una GPU de Nvidia. Algunas comparaciones citan una ventaja de hasta 73 veces, dependiendo del sistema de Nvidia utilizado como referencia.
La cifra es especialmente relevante para servicios que atienden un volumen muy elevado de solicitudes con el mismo modelo, donde cada milisegundo y cada vatio cuentan. No implica, sin embargo, que el chip sea más rápido para cualquier modelo o tarea: su diseño está atado al modelo que se grabó en él.
La principal limitación está integrada en el propio concepto. Como los pesos quedan físicamente incorporados al silicio, cada chip de Taalas solo puede ejecutar el modelo para el que fue fabricado. No es posible cargar en él otro modelo como se haría en una GPU de propósito general.
Taalas ha desarrollado una herramienta para reducir el tiempo y el coste de crear nuevas versiones. La empresa finaliza únicamente las dos capas metálicas superiores de una pila que tiene aproximadamente 100 capas. De este modo, mantiene el diseño base de la oblea y puede preparar el circuito para otro modelo en alrededor de dos meses, según las fuentes disponibles.
Ese proceso no elimina la falta de flexibilidad, pero sí podría hacer más viable fabricar aceleradores diferentes para los modelos que concentran la mayor demanda.
AMD prevé integrar los MSIC de Taalas en una arquitectura de cómputo desagregada y heterogénea, junto con sus GPU Instinct y sus sistemas para centros de datos Helios.
La división de tareas sería clara:
La apuesta permite a AMD ofrecer dos niveles de infraestructura: GPU capaces de adaptarse a una gran variedad de modelos y chips especializados para los modelos estables que reciben un flujo masivo de peticiones.
AMD no ha revelado los términos económicos de la operación. La compra se suma a otras adquisiciones relevantes de la compañía, como la de ZT Systems por 4.900 millones de dólares en julio de 2024 y la de Silo AI por 665 millones de dólares en agosto de 2024.
El movimiento también intensifica la competencia con Nvidia en el mercado de la inferencia. Según los informes citados, Nvidia cerró anteriormente en 2026 un acuerdo de licencia valorado en 20.000 millones de dólares con Groq, que le daría acceso a la arquitectura de inferencia LPU de esa empresa.
AMD apuesta por una alternativa distinta: convertir modelos concretos en hardware dedicado para lograr un mejor rendimiento por vatio en cargas de trabajo de gran volumen y relativamente estables.
Taalas se fundó en Toronto en 2023 de la mano de Ljubisa Bajic, antiguo director ejecutivo de Tenstorrent, otra startup de chips de IA, junto con un equipo que incluía a antiguos ingenieros de AMD.
Antes de su adquisición, la empresa había recaudado 219 millones de dólares en financiación de capital riesgo de inversores como Eclipse Ventures, Makers Fund y Radical Ventures, entre otros.
La demostración del HC1 en febrero de 2026 —con Llama 3.1 8B funcionando a 16.960 tokens por segundo— fue la prueba pública que puso el enfoque de Taalas en el radar del sector.
La compra refleja una apuesta de AMD por un futuro en el que la inferencia no dependa únicamente de GPU cada vez más potentes. Para los modelos más populares, un chip diseñado específicamente puede sacrificar versatilidad a cambio de una eficiencia y una velocidad mucho mayores.
Al combinar los MSIC de Taalas con sus GPU Instinct, AMD busca cubrir ambos extremos: la diversidad de modelos que exige una GPU programable y el tráfico masivo de los modelos que justifican un acelerador hecho a medida. Es una estrategia que desafía el dominio de Nvidia sin intentar reemplazar por completo el papel de las GPU.