Luna TTS est la famille de modèles de synthèse vocale multilingue de VUI Labs. Elle a brièvement atteint la première place du TTS Arena de Hugging Face en août 2026, mais figurait cinquième dans une capture d’Artifici...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS est la famille de modèles de synthèse vocale multilingue développée par la start-up chinoise VUI Labs. Elle comprend une version standard, conçue pour privilégier la qualité audio, et une déclinaison Luna-TTS Realtime, adaptée aux conversations et à la diffusion en continu.
VUI Labs aurait été créée au début de 2025 par Qian Yanmin, professeur à l’université Jiao Tong de Shanghai, et Mei Jie, entrepreneur en série. Si le modèle fait parler de lui, ce n’est pas uniquement grâce à un classement flatteur : son approche tente de modifier la manière dont une machine fabrique la parole, en passant d’une prédiction séquentielle des tokens audio à une génération largement parallèle, plus proche des modèles de diffusion.1
3
Il faut éviter de résumer la situation par « Luna-TTS est le meilleur modèle vocal au monde ». Les classements de synthèse vocale dépendent de la version évaluée, des langues, des voix, des consignes, du nombre d’échantillons et de la période de vote.
La conclusion la plus solide est donc la suivante : Luna-TTS a rejoint le groupe de tête des modèles TTS et a atteint, selon les périodes et les tableaux consultés, la première ou la troisième place. Les sources disponibles ne suffisent pas à établir une supériorité permanente sur Cartesia, ElevenLabs, Qwen ou l’ensemble des modèles de ByteDance Seed et de Zhipu.
Elles ne permettent pas non plus de déterminer avec précision son rang face à ByteDance Seed ou aux modèles de Zhipu dans un même test contrôlé. Les comparaisons directes doivent donc rester prudentes.
Luna-TTS part d’un modèle de langage Qwen3-0.6B, adapté pour traiter des tokens de parole.2 Dans un système TTS autorégressif classique, le modèle prédit généralement le token audio suivant, puis le suivant, et ainsi de suite. Cette dépendance en chaîne peut allonger le temps de génération et propager les erreurs au fil de la séquence.
Luna-TTS encode au contraire la parole sous forme d’une grille de tokens issue d’une quantification vectorielle résiduelle, ou RVQ. Une partie de cette grille est masquée, puis le modèle restaure plusieurs positions en parallèle au cours de plusieurs étapes de raffinement.1
4
La différence est importante : l’ordre de génération n’est plus entièrement imposé par le préfixe déjà produit. Le système peut travailler simultanément sur de nombreuses positions, ce qui vise à réduire la latence et à limiter l’accumulation d’erreurs séquentielles.1
3
Luna-TTS s’appuie sur un codec audio maison, Luna-Codec. Les informations publiques décrivent une sortie à 24 kHz, une fréquence de 25 images audio par seconde et huit codebooks, c’est-à-dire huit sous-ensembles de tokens décrivant différents aspects du signal vocal.8
9
Le codec n’est pas un simple accessoire de compression. Il détermine la quantité d’information que le modèle doit prédire, le nombre de trames à traiter chaque seconde et le compromis possible entre fidélité sonore et vitesse d’inférence. Dans Luna-TTS, le langage, le codec discret et l’échantillonnage par diffusion sont pensés comme un seul système.
La version standard peut générer une phrase complète selon une logique entièrement non autorégressive. Un assistant vocal, lui, doit commencer à parler avant même que l’utilisateur ait fini sa phrase. Luna-TTS Realtime adopte donc un compromis pratique : la génération est séquentielle entre les blocs, mais parallèle à l’intérieur de chaque bloc.1
4
Chaque bloc contient 32 trames de codec, soit 1,28 seconde de son. Le système conserve le contexte grâce à un KV Cache, puis transmet progressivement les blocs suivants après validation du premier.1
Dire que Luna-TTS Realtime est « totalement non autorégressif » serait donc inexact. La description correcte est plus nuancée : il existe une dépendance autorégressive au niveau des blocs, tandis que le débruitage de chaque bloc s’effectue en parallèle.
Le rapport technique décrit également un post-entraînement par renforcement de type GRPO, adapté au processus de diffusion discrète, ainsi qu’un contrôle des émotions et des vocalisations non verbales.1
5 L’objectif n’est pas seulement de produire une phrase compréhensible, mais aussi d’améliorer le naturel, l’expressivité et l’adéquation aux préférences d’écoute.
Le rapport présente par ailleurs le clonage vocal zéro-shot et l’édition de parole comme des opérations d’insertion ou de réécriture dans la grille de tokens audio.1
4 Cela explique pourquoi ces fonctions peuvent découler naturellement de l’architecture. En revanche, la qualité réelle du clonage, la durée d’enregistrement de référence nécessaire et la stabilité selon les langues doivent être vérifiées par des essais concrets, et non déduites de la seule architecture.
Le rapport de Luna-TTS Realtime cite un facteur de temps réel, ou RTF, de 0,024 et la validation du premier bloc audio de 1,28 seconde en 41,6 millisecondes, dans un environnement local préchauffé.1
5 Un RTF de 0,024 signifie que, dans ce protocole, une seconde de parole est générée en environ 24 millisecondes : le moteur fonctionne donc à plus de 40 fois la vitesse réelle au niveau mesuré.
Des articles indiquent aussi un fonctionnement avec huit à seize étapes de débruitage et deux GPU H20.7 Ces résultats suggèrent un débit élevé, mais ils ne correspondent pas nécessairement à l’attente ressentie par un utilisateur d’API dans le cloud.
Le protocole comprend du matériel déterminé, une configuration parallèle, un service préchauffé et une mesure à la frontière du moteur. Le réseau, la file d’attente, le prétraitement du texte, le décodage audio et la charge de production peuvent tous ajouter du délai. Les 41,6 millisecondes doivent donc être comprises comme un temps de remise du premier bloc dans des conditions contrôlées, et non comme une garantie universelle de latence de bout en bout.
Les auteurs indiquent avoir préentraîné Luna-TTS sur environ un million d’heures de parole en chinois, en anglais, en japonais et en coréen.1
2 Une telle couverture peut aider le modèle à apprendre des régularités de prononciation, de prosodie et de timbre dans plusieurs langues.
Les informations publiques ne détaillent toutefois pas suffisamment l’origine des données, les méthodes de filtrage, la répartition entre langues ou les conditions de respect des droits. Le chiffre d’un million d’heures peut donc être cité comme une déclaration de volume d’entraînement, mais il ne permet pas de conclure que Luna-TTS domine dans chaque langue, chaque accent ou chaque contexte professionnel.
Les informations disponibles suggèrent que VUI Labs ne cherche pas seulement à commercialiser un moteur TTS isolé. L’entreprise semble développer simultanément une couche modèle et API, des outils vocaux destinés aux créateurs et des applications d’agents vocaux.
Cette approche fait de la qualité de la voix une seule pièce du puzzle. La valeur commerciale dépend aussi du clonage, du contrôle émotionnel, de l’orchestration des dialogues, de la latence, du coût d’inférence, du déploiement et de l’intégration dans les outils des entreprises.
Des articles sectoriels affirment que VUI Labs a déployé ses technologies dans la logistique, l’assurance en ligne et les logiciels liés au voyage et à l’hôtellerie, avec plus d’un million de conversations professionnelles cumulées chez plusieurs clients.6 Ce chiffre reste une déclaration relayée par la presse ou les acteurs du déploiement, et non un indicateur vérifié par un audit indépendant. Les sources publiques ne précisent pas non plus la liste complète des clients, la définition exacte d’une conversation ni la période de mesure.
Le profil des fondateurs associe une direction scientifique issue de l’université et une direction orientée produit et commercialisation : Qian Yanmin est présenté comme le responsable des travaux sur la parole et l’intelligence artificielle, tandis que Mei Jie apporte une expérience d’entrepreneur en série. Cette combinaison peut faciliter le passage rapide du prototype de recherche à l’API, aux solutions sectorielles et aux agents vocaux. Sa solidité à long terme dépendra néanmoins de la qualité des données en boucle fermée, de la fidélisation des clients, du coût par inférence et de la capacité de déploiement international.
À la lumière du rapport technique et des classements publiés, quatre points ressortent :
Ces choix peuvent expliquer la progression rapide du modèle dans certains tests d’écoute à l’aveugle. Ils ne prouvent pas pour autant une supériorité globale en matière de prix, de stabilité sur les textes longs, de cohérence du timbre, de sécurité juridique des voix, de disponibilité de l’API ou de qualité dans toutes les langues.
Le cœur technique de l’histoire est solide : VUI Labs a combiné un modèle dérivé de Qwen3, un codec vocal discret, une diffusion masquée, un post-entraînement par renforcement et une génération en blocs pour le streaming.1
Luna-TTS a été présenté comme numéro un du TTS Arena de Hugging Face en août 2026 et comme troisième du Speech Arena d’Artificial Analysis à la même période. Mais une capture d’Artificial Analysis au 1er septembre le plaçait cinquième.8 Les classements reflètent donc des instantanés, pas un verdict définitif.
La formulation la plus juste est que Luna-TTS est devenu un modèle important dans la compétition mondiale de la synthèse vocale, avec une approche particulièrement intéressante sur la génération parallèle et le streaming par blocs. Pour choisir une solution, les développeurs devraient aller au-delà du rang général et tester directement les langues ciblées, le clonage vocal, le contrôle émotionnel, la latence du premier paquet, la cohérence sur les longs textes et le coût réel de l’API.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Luna TTS est la famille de modèles de synthèse vocale multilingue de VUI Labs. Elle a brièvement atteint la première place du TTS Arena de Hugging Face en août 2026, mais figurait cinquième dans une capture d’Artifici...
Luna TTS est la famille de modèles de synthèse vocale multilingue de VUI Labs. Elle a brièvement atteint la première place du TTS Arena de Hugging Face en août 2026, mais figurait cinquième dans une capture d’Artifici... Le modèle remplace la génération autorégressive, qui prédit les tokens audio un par un, par une diffusion discrète masquée capable de corriger plusieurs tokens en parallèle.
VUI Labs a été fondée par le professeur Qian Yanmin, de l’université Jiao Tong de Shanghai, et l’entrepreneur en série Mei Jie.