ZAYA1‑8B‑Diffusion‑Preview: el experimento de Zyphra para acelerar la generación de texto en IA
Zyphra presentó ZAYA1‑8B‑Diffusion‑Preview, una conversión del modelo autoregresivo ZAYA1‑8B que usa difusión para generar bloques de 16 tokens en paralelo y acelerar la inferencia hasta 4,6× o 7,7× según el método de... El enfoque reduce los cuellos de botella de memoria típicos de los LLM tradicionales al mover má...
Publicado porEditado con GPT-5.5Imágenes generadas con GPT Image 2
Zyphra presentó ZAYA1‑8B‑Diffusion‑Preview, una conversión del modelo autoregresivo ZAYA1‑8B que usa difusión para generar bloques de 16 tokens en paralelo y acelerar la inferencia hasta 4,6× o 7,7× según el método de...
El enfoque reduce los cuellos de botella de memoria típicos de los LLM tradicionales al mover más trabajo hacia procesamiento paralelo intensivo en GPU.
Si funciona a escala, podría abaratar la inferencia y acelerar entrenamientos con aprendizaje por refuerzo que requieren generar enormes cantidades de texto.
What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion lDiffusion-style language models can draft multiple tokens simultaneously instead of generating them sequentially.
Prompt de IA
Create a landscape editorial hero image for this Studio Global article: What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l. Article summary: Zyphra’s ZAYA1-8B-Diffusion-Preview is an experimental diffusion-language version of its ZAYA1-8B MoE model, designed to decode blocks of text in parallel rather than strictly one token at a time. Zyphra claims it can ge. Topic tags: general, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class. Zyphra AI has released ZAYA1-8B, a small Mixture of Experts (MoE) langu" source context "Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class
openai.com
Un enfoque de difusión para acelerar la generación de texto
Zyphra presentó ZAYA1‑8B‑Diffusion‑Preview, una versión experimental de su modelo de lenguaje ZAYA1‑8B que reemplaza el método clásico de generación autoregresiva por un proceso inspirado en modelos de difusión.
En lugar de generar texto token por token, como hacen la mayoría de los modelos actuales, este sistema crea bloques de 16 tokens al mismo tiempo. Según la empresa, esto puede acelerar la decodificación hasta 4,6× usando un “lossless sampler” y hasta 7,7× con un sampler de mezcla de logits, con degradaciones de calidad limitadas dependiendo de la configuración.
Un aspecto interesante es que el modelo no se entrenó desde cero como difusión. En cambio, Zyphra convirtió un checkpoint existente de su modelo autoregresivo en un decodificador de difusión, lo que sugiere que otros LLM convencionales podrían adaptarse de forma similar.
Studio Global AI
Continúe su investigación
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
¿Cuál es la respuesta corta a "ZAYA1‑8B‑Diffusion‑Preview: el experimento de Zyphra para acelerar la generación de texto en IA"?
Zyphra presentó ZAYA1‑8B‑Diffusion‑Preview, una conversión del modelo autoregresivo ZAYA1‑8B que usa difusión para generar bloques de 16 tokens en paralelo y acelerar la inferencia hasta 4,6× o 7,7× según el método de...
¿Cuáles son los puntos clave a validar primero?
Zyphra presentó ZAYA1‑8B‑Diffusion‑Preview, una conversión del modelo autoregresivo ZAYA1‑8B que usa difusión para generar bloques de 16 tokens en paralelo y acelerar la inferencia hasta 4,6× o 7,7× según el método de... El enfoque reduce los cuellos de botella de memoria típicos de los LLM tradicionales al mover más trabajo hacia procesamiento paralelo intensivo en GPU.
¿Qué debo hacer a continuación en la práctica?
Si funciona a escala, podría abaratar la inferencia y acelerar entrenamientos con aprendizaje por refuerzo que requieren generar enormes cantidades de texto.
El sistema se construye sobre ZAYA1‑8B, un modelo de razonamiento con arquitectura Mixture‑of‑Experts (MoE). Aunque tiene algo más de 8.000 millones de parámetros totales, solo unos 760 millones se activan durante la inferencia, lo que reduce los requisitos computacionales frente a modelos densos del mismo tamaño.
En este tipo de arquitectura, cada token se procesa solo por algunos submodelos especializados llamados “expertos”. Eso permite mantener buen rendimiento mientras se controla el costo de cálculo.
Por qué la generación autoregresiva es lenta
La mayoría de los modelos de lenguaje actuales usan generación autoregresiva. El proceso es estrictamente secuencial:
el modelo predice el siguiente token
actualiza la memoria intermedia (KV cache)
repite el proceso para el siguiente token
Como cada paso depende del anterior, la generación no puede paralelizarse fácilmente. Además, el acceso constante a la KV cache suele crear cuellos de botella de ancho de banda de memoria, especialmente en GPU.
Cómo el modelo genera 16 tokens a la vez
La versión de difusión cambia la forma de decodificar texto.
En lugar de producir un token cada vez, el modelo propone simultáneamente un bloque de tokens candidatos. En esta versión preliminar, cada paso de difusión trabaja con bloques de 16 tokens.
El flujo simplificado sería:
El modelo genera varios borradores candidatos para un bloque de tokens.
Un algoritmo de muestreo evalúa cuáles pueden aceptarse.
Los tokens aceptados se agregan a la salida y el proceso se repite con el siguiente bloque.
Como todos esos candidatos comparten el mismo prefijo y estado de la KV cache, el modelo puede procesarlos en paralelo dentro de una sola pasada de red. Esto transforma parte del trabajo de inferencia —tradicionalmente limitado por memoria— en cálculo paralelo intensivo, algo que las GPU manejan mucho mejor.
Dos estrategias de muestreo y sus velocidades
Las mejoras de rendimiento dependen del método de muestreo usado para aceptar los tokens generados.
Lossless sampler
Usa reglas de aceptación similares al speculative decoding.
Zyphra reporta aproximadamente 4,6× más velocidad que la generación autoregresiva tradicional.
Está diseñado para evitar pérdidas sistemáticas de calidad en evaluaciones.
Logit‑mixing sampler
Combina probabilidades del modelo de difusión con las del modelo autoregresivo.
Mejora la tasa de aceptación de tokens.
Zyphra reporta hasta 7,7× de aceleración, aunque con cierto riesgo de degradación de calidad.
Por ahora, estas cifras provienen principalmente de los propios reportes técnicos de la empresa, por lo que serán necesarias pruebas independientes para confirmar el rendimiento en aplicaciones reales.
El detalle poco común: entrenamiento con GPUs AMD
Otro elemento llamativo es el hardware utilizado. Zyphra afirma que se trata del primer modelo de lenguaje por difusión entrenado en GPUs AMD, en lugar de la infraestructura basada en Nvidia que domina el entrenamiento de IA a gran escala.
Si otros equipos logran reproducir estos resultados, podría significar que el desarrollo de LLM avanzados no depende exclusivamente del ecosistema de Nvidia, lo que ampliaría la competencia en hardware de IA.
Compressed Convolutional Attention (CCA)
El modelo ZAYA1‑8B también incorpora un mecanismo llamado Compressed Convolutional Attention (CCA). Su objetivo es reducir el costo computacional de la atención, especialmente durante operaciones paralelas grandes.
Esto es relevante porque la decodificación por difusión se parece a una operación de prefill grande: se procesan muchos tokens simultáneamente. Si el cálculo de atención es más eficiente, el modelo puede ejecutar esos pasos paralelos con menor costo.
Qué significa para el costo de inferencia
Si las mejoras de velocidad se mantienen en producción, podrían tener efectos importantes en la economía de los sistemas de IA:
más tokens generados por GPU cada segundo
menor costo por token
menor latencia en respuestas largas
Aun así, Zyphra advierte que las implementaciones de inferencia para modelos de difusión todavía están menos optimizadas que las de modelos autoregresivos, por lo que los resultados reales podrían variar.
Impacto en el entrenamiento con aprendizaje por refuerzo
Los modelos de razonamiento modernos suelen entrenarse usando aprendizaje por refuerzo con rollouts on‑policy, lo que implica generar enormes cantidades de respuestas candidatas.
Si la generación de texto se vuelve mucho más rápida, eso podría:
reducir el costo del entrenamiento por refuerzo
permitir más experimentos de test‑time compute
aumentar el número de trayectorias de razonamiento exploradas por prompt
En muchos pipelines de entrenamiento, la velocidad de inferencia es uno de los mayores costos operativos.
Una nueva carrera por la eficiencia en IA
El ZAYA1‑8B‑Diffusion‑Preview refleja una tendencia creciente en el desarrollo de IA: en lugar de aumentar solo el tamaño de los modelos, muchos equipos buscan mejorar la eficiencia —la llamada “inteligencia por dólar”.
Este proyecto combina varias estrategias:
arquitectura mixture‑of‑experts
decodificación basada en difusión
mecanismos alternativos de atención
entrenamiento fuera del ecosistema dominante de Nvidia
Si estos enfoques se confirman a gran escala, podrían redefinir cómo se optimizan los futuros modelos de lenguaje: no solo por capacidad, sino también por rendimiento, costo y eficiencia del hardware. Por ahora, el modelo funciona como una demostración temprana de que convertir LLM autoregresivos en decodificadores de difusión podría ser un camino prometedor hacia una generación de IA mucho más rápida.