Nvidia y d Matrix preparan un sistema de inferencia híbrido: las GPU asumirían el prefill, más intensivo en cómputo, y las XPU Raptor de d Matrix se centrarían en el decode, que genera tokens uno a uno. NVLink Fusion, los diseños de referencia MGX y las redes de Nvidia buscan reducir la complejidad de desplegar un p...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
La rapidez con la que un servicio de IA empieza a responder —y mantiene el ritmo mientras genera texto— se ha convertido en un factor decisivo. La colaboración anunciada en septiembre de 2026 entre Nvidia y d-Matrix apunta precisamente a ese problema: integrar las futuras XPU de inferencia Raptor de d-Matrix en infraestructura diseñada por Nvidia para repartir las distintas partes de una petición a un modelo de lenguaje entre los procesadores más adecuados. 1
3
4
La idea central es la complementariedad, no el reemplazo. El plan no propone que Raptor sustituya a las GPU de Nvidia, sino un sistema heterogéneo: las GPU ejecutarían el prefill, la fase intensiva de cálculo que procesa el prompt y su contexto; las aceleradoras de d-Matrix se enfocarían en el decode, la etapa repetitiva y sensible a la latencia que produce los tokens de salida uno a uno. 4
5
Una solicitud a un modelo de lenguaje grande (LLM) combina exigencias de rendimiento distintas. El prefill procesa el texto de entrada y el contexto; el decode genera repetidamente el siguiente token. d-Matrix presenta su arquitectura de inferencia —incluido su producto actual, Corsair— como una solución para el decode que trabaja junto a GPU, especialmente eficaces en cargas de cómputo intensivo. 26
Esta división puede ser útil en productos interactivos donde importa el tiempo hasta el siguiente token: asistentes de programación, chats y experiencias de voz, por ejemplo. La plataforma Raptor se orienta a lo que d-Matrix denomina servicios prémium de tokens con latencia ultrabaja. 4
8
Pero especializar cada fase también plantea un reto de sistemas: los procesadores deben intercambiar datos con suficiente rapidez para que la comunicación no anule la ventaja obtenida. La infraestructura prevista en la alianza busca resolver esa limitación.
Raptor está previsto para usar NVLink Fusion y conectarse al dominio de escalado vertical de NVLink de Nvidia; Spectrum-X aportaría la red de escalado horizontal entre sistemas. Según Nvidia, esto ofrece a d-Matrix una vía para conectar silicio propio con su plataforma más amplia de infraestructura de IA. 3
El rack proyectado de d-Matrix se basará en la arquitectura de referencia MGX de Nvidia e incorporaría CPU Nvidia Vera, conmutadores NVLink, DPU BlueField-4, SuperNIC ConnectX-9 y Ethernet Spectrum-X. 4
8
Para d-Matrix, el valor no se limita a la interconexión. En vez de validar por su cuenta todos los componentes de servidores, red, alimentación, refrigeración y cadena de suministro alrededor de un procesador nuevo, la compañía puede avanzar sobre un ecosistema de racks ya validado. Nvidia describe MGX y su plataforma como una vía más rápida y de menor riesgo para pasar de silicio personalizado a despliegues a gran escala. 3
En la práctica, la alianza busca que Raptor pueda instalarse dentro de una «fábrica de IA» al estilo de Nvidia, no como un equipo de inferencia aislado.
d-Matrix ha detallado una configuración ambiciosa para Raptor a escala de rack: hasta 144 XPU por rack, 2,3 TB de DRAM apilada en 3D y 7,2 PB/s de ancho de banda de memoria agregado. La empresa sostiene que el diseño permitiría manejar modelos de más de cuatro billones de parámetros a precisión de 4 bits. Son especificaciones previstas, no resultados de producto comercial validados de forma independiente. 4
La arquitectura refleja la tesis de la compañía: el decode de los LLM depende en gran medida del movimiento de datos y del ancho de banda disponible. El empaquetado 3D propuesto para Raptor combina un chip de memoria DRAM y un chip de cómputo SRAM, ampliando el enfoque de d-Matrix centrado en la memoria. 4
d-Matrix espera completar el tape-out —la entrega final del diseño a fabricación— de Raptor antes de terminar 2026. La disponibilidad inicial en un rack MGX se prevé para el cuarto trimestre de 2027. Por tanto, todavía queda una ejecución importante: fabricación, empaquetado, validación de sistemas y despliegue a escala de rack deberán funcionar antes de que los clientes puedan evaluar el rendimiento real. 4
8
El papel de Nvidia es estratégicamente relevante. La empresa permite que una XPU externa especializada se conecte a su arquitectura de racks y a su red, en lugar de exigir que todas las fases de inferencia se ejecuten en una GPU de Nvidia.
Nvidia define su plataforma de IA como «integrada verticalmente y abierta horizontalmente»: puede conservar el valor de su tejido de interconexión, sus redes, diseños de racks y ecosistema, al tiempo que permite participar a otros procesadores. 3
Esto amplía la variedad de cargas que la plataforma puede atender. Las empresas que busquen un acelerador centrado en decode podrían tener más incentivos para continuar en infraestructura compatible con Nvidia si ese dispositivo utiliza NVLink Fusion, MGX y Spectrum-X. Es una complementariedad controlada, no una retirada de las GPU: estas seguirían siendo fundamentales para entrenamiento, inferencia de propósito general y el prefill intensivo en cómputo, mientras el dispositivo especializado se posiciona para decode. 1
4
5
Raptor sucede al acelerador de inferencia Corsair de d-Matrix. La compañía afirma que Corsair fue creado específicamente para decode en inferencia desagregada y para trabajar con GPU, no para sustituirlas. 26
d-Matrix ha divulgado afirmaciones sobre rendimiento, costes y consumo energético de sistemas híbridos basados en Corsair. Sin embargo, esas cifras deben considerarse afirmaciones de la empresa mientras no existan detalles de pruebas comparativas que puedan reproducirse de forma independiente. La evidencia disponible para este anuncio no demuestra una mejora universal para todos los modelos, tamaños de lote o configuraciones de despliegue. 25
28
La compañía recaudó 275 millones de dólares en una ronda Serie C con una valoración reportada de 2.000 millones de dólares, lo que elevó el total de financiación comunicado a 450 millones de dólares. Entre los participantes estuvo M12, el fondo de capital riesgo de Microsoft. 21
30 Reuters también informó de que Microsoft respaldó a d-Matrix en una ronda de financiación de 2023 y de que la compañía envió su primer chip de IA en noviembre de 2024.
1
Estos hitos sugieren que d-Matrix intenta pasar de una propuesta basada en un único producto de inferencia a una hoja de ruta más amplia, a escala de rack. La integración con Nvidia puede reforzar esa transición ante clientes que ya compran u operan infraestructura basada en Nvidia.
Los términos financieros del acuerdo con Nvidia no se hicieron públicos. 1 Por ello, el anuncio no permite establecer si el acuerdo incluye pagos por licencias, compromisos de ingeniería conjunta, compras por volumen, reparto de ingresos o una inversión de Nvidia.
La conclusión más clara está en la arquitectura: ambas empresas se preparan para un mercado de inferencia en el que un único tipo de procesador no tiene por qué ejecutar todos los pasos de una petición a un LLM. d-Matrix obtiene una vía de entrada a fábricas de IA compatibles con Nvidia; Nvidia suma una opción especializada para decode que puede integrarse con su red y su plataforma de racks. Que esta estrategia se traduzca en menor latencia o mejores costes a escala dependerá del hardware final de Raptor, de la orquestación de software y de las pruebas de clientes después de la disponibilidad prevista para 2027. 3
4
8
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Nvidia y d Matrix preparan un sistema de inferencia híbrido: las GPU asumirían el prefill, más intensivo en cómputo, y las XPU Raptor de d Matrix se centrarían en el decode, que genera tokens uno a uno.
Nvidia y d Matrix preparan un sistema de inferencia híbrido: las GPU asumirían el prefill, más intensivo en cómputo, y las XPU Raptor de d Matrix se centrarían en el decode, que genera tokens uno a uno. NVLink Fusion, los diseños de referencia MGX y las redes de Nvidia buscan reducir la complejidad de desplegar un procesador especializado a escala de rack; no sustituyen a las GPU de Nvidia.
La alianza muestra que Nvidia quiere abrir su infraestructura de «fábrica de IA» a silicio especializado de terceros, manteniendo como elementos centrales su interconexión, sus redes y sus sistemas a escala de rack.