Zyphra a converti son modèle ZAYA1‑8B en une version à diffusion capable de générer des blocs de 16 tokens simultanément, avec des gains de vitesse annoncés entre 4,6× et 7,7× selon le sampler utilisé. Cette approche remplace la génération séquentielle token par token par un décodage parallèle, ce qui réduit les gou...

Create a landscape editorial hero image for this Studio Global article: What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l. Article summary: Zyphra’s ZAYA1-8B-Diffusion-Preview is an experimental diffusion-language version of its ZAYA1-8B MoE model, designed to decode blocks of text in parallel rather than strictly one token at a time. Zyphra claims it can ge. Topic tags: general, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class. Zyphra AI has released ZAYA1-8B, a small Mixture of Experts (MoE) langu" source context "Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class
La startup d’IA Zyphra a dévoilé ZAYA1‑8B‑Diffusion‑Preview, une version expérimentale de son modèle de langage ZAYA1‑8B qui remplace la génération autoregressive classique par un processus de diffusion. L’objectif : accélérer fortement la génération de texte.
Dans la plupart des grands modèles de langage actuels, chaque mot ou fragment de mot (appelé token) est généré un par un. Le modèle de Zyphra adopte une stratégie différente : il propose un bloc de 16 tokens à la fois, ce qui permet d’exécuter davantage de calculs en parallèle sur GPU. Selon l’entreprise, cela peut entraîner un gain de vitesse d’inférence allant d’environ 4,6× à 7,7× selon la méthode d’échantillonnage utilisée.
Particularité importante : ce modèle n’a pas été entraîné comme un modèle de diffusion dès le départ. Zyphra indique avoir converti un modèle autoregressif existant en modèle de diffusion, démontrant qu’il est possible d’adapter des LLM traditionnels à cette nouvelle méthode de décodage.
La version diffusion repose sur ZAYA1‑8B, un modèle de raisonnement open source basé sur une architecture Mixture‑of‑Experts (MoE). Cette architecture comporte un peu plus de 8 milliards de paramètres au total, mais n’en active qu’environ 760 millions lors de l’inférence.
Dans un modèle MoE, plusieurs sous‑réseaux spécialisés — appelés « experts » — existent, mais seulement une partie d’entre eux est utilisée pour chaque token. Cette technique permet de conserver de bonnes performances tout en réduisant les besoins en calcul par rapport à des modèles denses de taille similaire.
La génération classique des LLM suit un processus strictement séquentiel :
Chaque étape dépend de la précédente. Résultat : la génération ne peut pas être facilement parallélisée.
Ce mécanisme entraîne souvent un autre problème : la bande passante mémoire devient le facteur limitant lorsque le modèle doit lire et écrire continuellement dans le KV cache pendant la génération.
Dans ZAYA1‑8B‑Diffusion‑Preview, le processus change.
Au lieu de prédire un token unique, le modèle propose simultanément plusieurs candidats pour un bloc de 16 tokens.
Le fonctionnement général est le suivant :
Comme ces tokens partagent le même préfixe et le même état de cache, le modèle peut effectuer un calcul parallèle dans un seul passage du réseau. Le travail passe alors d’une opération limitée par la mémoire à une tâche davantage limitée par la puissance de calcul, un scénario dans lequel les GPU sont généralement plus efficaces.
Les gains de performance dépendent de la stratégie d’échantillonnage utilisée.
Sampler « lossless »
Sampler par mélange de logits
Ces résultats proviennent principalement des rapports techniques de Zyphra. Des benchmarks indépendants seront nécessaires pour vérifier les performances dans des conditions réelles.
Autre aspect notable : l’infrastructure matérielle utilisée. Zyphra affirme que ZAYA1‑8B‑Diffusion‑Preview est le premier modèle de langage à diffusion entraîné sur des GPU AMD.
Aujourd’hui, la plupart des grands projets d’IA sont développés sur l’écosystème Nvidia. Montrer qu’un modèle avancé peut être entraîné et expérimenté sur une pile logicielle et matérielle AMD pourrait ouvrir davantage de concurrence dans l’infrastructure d’IA.
Le modèle ZAYA1‑8B inclut également un mécanisme appelé Compressed Convolutional Attention (CCA). Cette technique vise à réduire le coût du calcul d’attention, particulièrement lors d’opérations parallèles importantes.
C’est utile dans le contexte de la diffusion, car générer plusieurs tokens en parallèle ressemble à une opération dite de prefill — une phase où le calcul d’attention peut devenir coûteux. Réduire ce coût rend la génération multi‑tokens plus efficace.
Si les gains de vitesse annoncés se confirment dans des systèmes de production, plusieurs effets sont possibles :
Zyphra souligne toutefois que les pipelines d’inférence pour les modèles de diffusion restent moins optimisés que ceux des LLM autoregressifs, ce qui signifie que les gains réels peuvent varier selon les déploiements.
Les modèles de raisonnement modernes utilisent souvent le reinforcement learning avec des rollouts : le modèle génère de nombreuses réponses candidates afin d’explorer différentes stratégies de résolution.
Dans ces systèmes, la génération de texte constitue une grande partie du coût. Une inférence plus rapide pourrait :
Autrement dit, la vitesse de génération influence directement la vitesse de recherche et d’entraînement des modèles.
ZAYA1‑8B‑Diffusion‑Preview illustre une tendance croissante dans l’IA : améliorer l’efficacité économique des modèles plutôt que simplement augmenter leur taille.
Dans ce projet, plusieurs approches se combinent :
Si ces techniques se révèlent robustes à grande échelle, elles pourraient modifier la manière dont les futurs modèles de langage sont optimisés — non seulement pour leurs capacités, mais aussi pour leur coût, leur débit et leur efficacité matérielle. Pour l’instant, ZAYA1‑8B‑Diffusion‑Preview reste surtout une démonstration prometteuse d’une nouvelle direction possible pour l’inférence des LLM.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Zyphra a converti son modèle ZAYA1‑8B en une version à diffusion capable de générer des blocs de 16 tokens simultanément, avec des gains de vitesse annoncés entre 4,6× et 7,7× selon le sampler utilisé.
Zyphra a converti son modèle ZAYA1‑8B en une version à diffusion capable de générer des blocs de 16 tokens simultanément, avec des gains de vitesse annoncés entre 4,6× et 7,7× selon le sampler utilisé. Cette approche remplace la génération séquentielle token par token par un décodage parallèle, ce qui réduit les goulots d’étranglement liés à la bande passante mémoire des GPU.
Si ces gains se confirment, ils pourraient diminuer le coût d’inférence et accélérer des processus coûteux comme les rollouts de reinforcement learning.