ZAYA1‑8B‑Diffusion‑Preview : la nouvelle approche de Zyphra pour accélérer l’inférence des modèles de langage
Zyphra a converti son modèle ZAYA1‑8B en une version à diffusion capable de générer des blocs de 16 tokens simultanément, avec des gains de vitesse annoncés entre 4,6× et 7,7× selon le sampler utilisé. Cette approche remplace la génération séquentielle token par token par un décodage parallèle, ce qui réduit les gou...
Publié parModifié avec GPT-5.5Images générées avec GPT Image 2
Zyphra a converti son modèle ZAYA1‑8B en une version à diffusion capable de générer des blocs de 16 tokens simultanément, avec des gains de vitesse annoncés entre 4,6× et 7,7× selon le sampler utilisé.
Cette approche remplace la génération séquentielle token par token par un décodage parallèle, ce qui réduit les goulots d’étranglement liés à la bande passante mémoire des GPU.
Si ces gains se confirment, ils pourraient diminuer le coût d’inférence et accélérer des processus coûteux comme les rollouts de reinforcement learning.
What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion lDiffusion-style language models can draft multiple tokens simultaneously instead of generating them sequentially.
Prompt IA
Create a landscape editorial hero image for this Studio Global article: What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l. Article summary: Zyphra’s ZAYA1-8B-Diffusion-Preview is an experimental diffusion-language version of its ZAYA1-8B MoE model, designed to decode blocks of text in parallel rather than strictly one token at a time. Zyphra claims it can ge. Topic tags: general, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class. Zyphra AI has released ZAYA1-8B, a small Mixture of Experts (MoE) langu" source context "Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class
openai.com
Une nouvelle approche pour accélérer la génération de texte
La startup d’IA Zyphra a dévoilé ZAYA1‑8B‑Diffusion‑Preview, une version expérimentale de son modèle de langage ZAYA1‑8B qui remplace la génération autoregressive classique par un processus de diffusion. L’objectif : accélérer fortement la génération de texte.
Dans la plupart des grands modèles de langage actuels, chaque mot ou fragment de mot (appelé token) est généré un par un. Le modèle de Zyphra adopte une stratégie différente : il propose un bloc de 16 tokens à la fois, ce qui permet d’exécuter davantage de calculs en parallèle sur GPU. Selon l’entreprise, cela peut entraîner un gain de vitesse d’inférence allant d’environ 4,6× à 7,7× selon la méthode d’échantillonnage utilisée.
Particularité importante : ce modèle n’a pas été entraîné comme un modèle de diffusion dès le départ. Zyphra indique avoir converti un modèle autoregressif existant en modèle de diffusion, démontrant qu’il est possible d’adapter des LLM traditionnels à cette nouvelle méthode de décodage.
Studio Global AI
Continuez vos recherches
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Quelle est la réponse courte à « ZAYA1‑8B‑Diffusion‑Preview : la nouvelle approche de Zyphra pour accélérer l’inférence des modèles de langage » ?
Zyphra a converti son modèle ZAYA1‑8B en une version à diffusion capable de générer des blocs de 16 tokens simultanément, avec des gains de vitesse annoncés entre 4,6× et 7,7× selon le sampler utilisé.
Quels sont les points clés à valider en premier ?
Zyphra a converti son modèle ZAYA1‑8B en une version à diffusion capable de générer des blocs de 16 tokens simultanément, avec des gains de vitesse annoncés entre 4,6× et 7,7× selon le sampler utilisé. Cette approche remplace la génération séquentielle token par token par un décodage parallèle, ce qui réduit les goulots d’étranglement liés à la bande passante mémoire des GPU.
Que dois-je faire ensuite en pratique ?
Si ces gains se confirment, ils pourraient diminuer le coût d’inférence et accélérer des processus coûteux comme les rollouts de reinforcement learning.
La version diffusion repose sur ZAYA1‑8B, un modèle de raisonnement open source basé sur une architecture Mixture‑of‑Experts (MoE). Cette architecture comporte un peu plus de 8 milliards de paramètres au total, mais n’en active qu’environ 760 millions lors de l’inférence.
Dans un modèle MoE, plusieurs sous‑réseaux spécialisés — appelés « experts » — existent, mais seulement une partie d’entre eux est utilisée pour chaque token. Cette technique permet de conserver de bonnes performances tout en réduisant les besoins en calcul par rapport à des modèles denses de taille similaire.
Pourquoi la génération autoregressive est lente
La génération classique des LLM suit un processus strictement séquentiel :
le modèle produit le prochain token ;
il met à jour la mémoire interne (KV cache) avec ce token ;
puis il répète l’opération pour le suivant.
Chaque étape dépend de la précédente. Résultat : la génération ne peut pas être facilement parallélisée.
Ce mécanisme entraîne souvent un autre problème : la bande passante mémoire devient le facteur limitant lorsque le modèle doit lire et écrire continuellement dans le KV cache pendant la génération.
Générer 16 tokens en une seule étape
Dans ZAYA1‑8B‑Diffusion‑Preview, le processus change.
Au lieu de prédire un token unique, le modèle propose simultanément plusieurs candidats pour un bloc de 16 tokens.
Le fonctionnement général est le suivant :
Le modèle génère plusieurs brouillons pour un bloc de tokens.
Un sampler décide quels tokens peuvent être acceptés.
Les tokens validés sont ajoutés à la sortie.
Le processus recommence pour le bloc suivant.
Comme ces tokens partagent le même préfixe et le même état de cache, le modèle peut effectuer un calcul parallèle dans un seul passage du réseau. Le travail passe alors d’une opération limitée par la mémoire à une tâche davantage limitée par la puissance de calcul, un scénario dans lequel les GPU sont généralement plus efficaces.
Deux méthodes d’échantillonnage, deux compromis vitesse‑qualité
Les gains de performance dépendent de la stratégie d’échantillonnage utilisée.
Sampler « lossless »
applique des règles d’acceptation proches du speculative decoding ;
environ 4,6× plus rapide que le décodage autoregressif classique ;
conçu pour éviter une baisse systématique de qualité sur les évaluations.
Sampler par mélange de logits
combine les probabilités du modèle de diffusion et du modèle autoregressif ;
augmente le taux d’acceptation des tokens ;
peut atteindre jusqu’à 7,7× d’accélération, mais avec un risque de légère dégradation de qualité.
Ces résultats proviennent principalement des rapports techniques de Zyphra. Des benchmarks indépendants seront nécessaires pour vérifier les performances dans des conditions réelles.
Un entraînement sur GPU AMD
Autre aspect notable : l’infrastructure matérielle utilisée. Zyphra affirme que ZAYA1‑8B‑Diffusion‑Preview est le premier modèle de langage à diffusion entraîné sur des GPU AMD.
Aujourd’hui, la plupart des grands projets d’IA sont développés sur l’écosystème Nvidia. Montrer qu’un modèle avancé peut être entraîné et expérimenté sur une pile logicielle et matérielle AMD pourrait ouvrir davantage de concurrence dans l’infrastructure d’IA.
L’attention CCA pour réduire les coûts de calcul
Le modèle ZAYA1‑8B inclut également un mécanisme appelé Compressed Convolutional Attention (CCA). Cette technique vise à réduire le coût du calcul d’attention, particulièrement lors d’opérations parallèles importantes.
C’est utile dans le contexte de la diffusion, car générer plusieurs tokens en parallèle ressemble à une opération dite de prefill — une phase où le calcul d’attention peut devenir coûteux. Réduire ce coût rend la génération multi‑tokens plus efficace.
Impact potentiel sur le coût d’inférence
Si les gains de vitesse annoncés se confirment dans des systèmes de production, plusieurs effets sont possibles :
plus de tokens générés par GPU et par seconde ;
réduction du coût par token généré ;
latence plus faible pour les réponses longues.
Zyphra souligne toutefois que les pipelines d’inférence pour les modèles de diffusion restent moins optimisés que ceux des LLM autoregressifs, ce qui signifie que les gains réels peuvent varier selon les déploiements.
Pourquoi cela compte pour le reinforcement learning
Les modèles de raisonnement modernes utilisent souvent le reinforcement learning avec des rollouts : le modèle génère de nombreuses réponses candidates afin d’explorer différentes stratégies de résolution.
Dans ces systèmes, la génération de texte constitue une grande partie du coût. Une inférence plus rapide pourrait :
réduire le coût des entraînements RL ;
permettre d’échantillonner davantage de trajectoires de raisonnement ;
accélérer les expérimentations basées sur le test‑time compute.
Autrement dit, la vitesse de génération influence directement la vitesse de recherche et d’entraînement des modèles.
Vers des modèles d’IA plus efficaces
ZAYA1‑8B‑Diffusion‑Preview illustre une tendance croissante dans l’IA : améliorer l’efficacité économique des modèles plutôt que simplement augmenter leur taille.
Dans ce projet, plusieurs approches se combinent :
architecture Mixture‑of‑Experts ;
décodage par diffusion ;
mécanisme d’attention optimisé ;
entraînement sur infrastructure AMD.
Si ces techniques se révèlent robustes à grande échelle, elles pourraient modifier la manière dont les futurs modèles de langage sont optimisés — non seulement pour leurs capacités, mais aussi pour leur coût, leur débit et leur efficacité matérielle. Pour l’instant, ZAYA1‑8B‑Diffusion‑Preview reste surtout une démonstration prometteuse d’une nouvelle direction possible pour l’inférence des LLM.