Luna TTS es la familia de modelos de texto a voz multilingüe de VUI Labs. En agosto de 2026 llegó al primer puesto de Hugging Face TTS Arena, pero el 1 de septiembre aparecía en quinta posición en el ranking de provee...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS es la familia de modelos de texto a voz (TTS, por sus siglas en inglés) desarrollada por VUI Labs, una startup china de inteligencia artificial especializada en tecnología de voz. La familia incluye un modelo estándar orientado a la calidad y una variante Realtime diseñada para conversaciones con baja latencia.
VUI Labs se fundó a comienzos de 2025. Según los reportes públicos disponibles, sus fundadores son Qian Yanmin, profesor de la Universidad Jiao Tong de Shanghái, y Mei Jie, emprendedor en serie.
El interés por Luna-TTS no se explica únicamente por una posición en una tabla. Su propuesta cambia la forma habitual de generar voz: en lugar de predecir cada token de códec de manera secuencial, convierte el audio en tokens discretos y los completa mediante varias rondas de reparación en paralelo, en una arquitectura más cercana a los modelos de difusión.1
3
La respuesta depende del ranking, la versión evaluada y la fecha de consulta. Por eso, no es preciso describirlo como el modelo número uno de forma permanente.
Estas cifras no necesariamente se contradicen. Los rankings de escucha a ciegas pueden cambiar según la versión del modelo, los idiomas, las voces, las instrucciones, el número de muestras y el momento en que se registran los votos.
La conclusión más prudente es que Luna-TTS ha entrado en la primera línea de los modelos TTS y alcanzó el primer o tercer puesto en determinados periodos. Sin embargo, las fuentes disponibles no demuestran que mantenga una ventaja estable sobre Cartesia, ElevenLabs, Qwen, Google, MiniMax o cualquier otro competidor. Tampoco permiten establecer una posición exacta y fiable frente a ByteDance Seed o Zhipu.
Luna-TTS parte de un modelo de lenguaje Qwen3-0.6B adaptado para trabajar con tokens de voz.2 En un sistema TTS autorregresivo tradicional, el modelo genera el siguiente token de códec a partir de los anteriores. Esto crea una dependencia secuencial larga: cada paso debe esperar al anterior.
Luna-TTS adopta otro enfoque. Organiza los tokens de cuantización vectorial residual (RVQ) de una locución en una cuadrícula completa, aplica máscaras aleatorias y, durante varias iteraciones, rellena en paralelo las posiciones ocultas.1
4
La ventaja potencial es doble. El modelo puede procesar muchos puntos de la secuencia al mismo tiempo y evita que un error inicial se propague necesariamente por todo el resto de la frase. La contrapartida es que la calidad final depende del diseño del proceso de refinamiento, del códec y del entrenamiento de la arquitectura completa.
El sistema utiliza un códec propio, Luna-Codec, que representa el audio como una cuadrícula de tokens discretos. La información pública describe una configuración de 24 kHz de frecuencia de muestreo, 25 Hz de frecuencia de cuadros y ocho códigos o codebooks.8
9
El códec no es un simple módulo de compresión. Determina cuánta información acústica debe predecir el modelo, cuántos cuadros se procesan por segundo y qué equilibrio puede lograrse entre fidelidad y velocidad. En Luna-TTS, el lenguaje, la representación discreta del audio y el muestreo por difusión se diseñan como un conjunto.
El modelo estándar puede generar una locución completa de forma no autorregresiva. Pero un sistema conversacional necesita comenzar a reproducir audio antes de que se haya terminado de procesar toda la respuesta.
Para resolverlo, Luna-TTS Realtime divide el audio en bloques de 32 cuadros de códec, equivalentes a 1,28 segundos. Los bloques se generan de forma secuencial, mientras que los tokens dentro de cada bloque se eliminan y refinan en paralelo. El sistema también utiliza KV Cache para conservar el contexto y entregar audio progresivamente.1
4
Por tanto, decir que Realtime es «completamente no autorregresivo» sería incorrecto. La descripción más exacta es que tiene dependencia autorregresiva entre bloques y generación paralela mediante difusión dentro de cada bloque.
Los reportes técnicos mencionan normalmente entre ocho y 16 pasos de eliminación de ruido. En una prueba local con dos GPU H20, el sistema presentó un primer bloque de 1,28 segundos en 41,6 milisegundos y un factor de tiempo real (RTF) de 0,024.1
5
7
Estas cifras son llamativas, pero deben interpretarse con cuidado. Se obtuvieron con un servicio previamente calentado, hardware concreto, una configuración paralela y un protocolo local. La latencia percibida por un usuario de una API en la nube también puede incluir la cola del servidor, la red, el procesamiento del texto, la decodificación y la carga de producción. Los 41,6 milisegundos describen el tiempo hasta la entrega del primer bloque bajo esas condiciones, no una promesa universal de latencia extremo a extremo.
El informe técnico describe una fase de ajuste posterior basada en GRPO, una técnica de optimización por refuerzo adaptada al proceso de difusión discreta enmascarada.1
5 El objetivo no es solo mejorar la inteligibilidad, sino también la naturalidad, la expresividad y la adecuación a las preferencias del usuario.
La documentación también menciona controles para emociones y vocalizaciones no verbales, como expresiones sonoras que no forman parte del texto convencional. Además, la clonación de voz sin ejemplos previos del hablante y la edición de audio pueden plantearse como tareas de relleno o reescritura de la cuadrícula de tokens.1
4
Eso no significa que el rendimiento sea idéntico en todos los idiomas o escenarios. La calidad de la clonación, la duración del audio de referencia y la consistencia de la voz deben comprobarse con pruebas de producto, no deducirse únicamente de la arquitectura.
Los autores afirman que Luna-TTS fue preentrenado con aproximadamente un millón de horas de voz en chino, inglés, japonés y coreano.1
2 Un corpus de ese tamaño puede ampliar la cobertura de pronunciación, prosodia y modelado de voces entre idiomas.
Aun así, los resúmenes públicos no ofrecen suficiente información para evaluar de forma independiente el origen de los datos, los procesos de limpieza, la proporción correspondiente a cada idioma o el cumplimiento de derechos y licencias. Por ello, «un millón de horas» debe entenderse como una descripción del volumen de entrenamiento reportado, no como una prueba de liderazgo en cada acento, idioma o caso de uso.
VUI Labs parece plantear Luna-TTS como algo más amplio que un modelo aislado. Su dirección pública combina capacidades de modelo y API, herramientas de voz para creadores y aplicaciones de agentes de voz. En este enfoque, la calidad de síntesis es solo una pieza: también importan la clonación, el control emocional, la coordinación de diálogos, la latencia, el coste de inferencia y la integración con los sistemas de cada empresa.
La prensa sectorial afirma que la compañía ha desplegado tecnología en logística, seguros digitales y software para viajes y hostelería, con varios clientes que acumularían más de un millón de conversaciones comerciales.6 Esa cifra procede de afirmaciones de la empresa o de los equipos de despliegue recogidas por medios; no es un indicador auditado de forma independiente. Tampoco se han divulgado públicamente todos los clientes, la definición exacta de «conversación» ni el periodo de medición.
La composición inicial del equipo refleja una combinación habitual en startups de inteligencia artificial: liderazgo académico y técnico junto con experiencia en producto y comercialización. Qian Yanmin aparece como responsable del eje de investigación en voz e IA, mientras que Mei Jie aporta experiencia como emprendedor en serie. El potencial de esta estructura dependerá a largo plazo de la calidad de los datos, la retención de clientes, el coste por inferencia y la capacidad de entregar el producto en distintos mercados.
A partir del informe técnico y de los rankings disponibles, las ventajas mejor respaldadas son cuatro:
Estas decisiones ayudan a explicar sus buenos resultados en algunas evaluaciones de escucha a ciegas. No prueban por sí solas que Luna-TTS sea superior en precio, textos largos, consistencia de timbre, seguridad de derechos, disponibilidad de API o cobertura de todas las lenguas.
La parte más sólida de la historia de Luna-TTS es técnica. VUI Labs ha combinado un modelo derivado de Qwen3, un códec de voz discreto, generación mediante difusión enmascarada, ajuste posterior con refuerzo y una estrategia de generación por bloques para streaming.1
El modelo llegó al primer puesto de Hugging Face TTS Arena en los reportes de agosto de 2026 y apareció tercero en los reportes contemporáneos de Artificial Analysis. Pero la fotografía de Artificial Analysis del 1 de septiembre lo situaba quinto.8 La lectura más fiable no es que Luna-TTS haya derrotado para siempre a todos sus rivales, sino que se ha convertido en un modelo destacado dentro de la competición global de TTS y que su enfoque de difusión paralela merece seguimiento.
Para elegir una solución, los desarrolladores harían bien en probar directamente los criterios que importan a su caso: idioma, clonación de voz, control emocional, tiempo hasta el primer audio, estabilidad en textos largos, consistencia del timbre y coste real de la API.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Luna TTS es la familia de modelos de texto a voz multilingüe de VUI Labs. En agosto de 2026 llegó al primer puesto de Hugging Face TTS Arena, pero el 1 de septiembre aparecía en quinta posición en el ranking de provee...
Luna TTS es la familia de modelos de texto a voz multilingüe de VUI Labs. En agosto de 2026 llegó al primer puesto de Hugging Face TTS Arena, pero el 1 de septiembre aparecía en quinta posición en el ranking de provee... Su principal apuesta técnica es sustituir la generación autorregresiva token a token por una difusión enmascarada discreta que puede reparar grandes bloques de tokens de voz en paralelo.
La variante Luna TTS Realtime genera bloques de 1,28 segundos: mantiene dependencia autorregresiva entre bloques, pero realiza el proceso de eliminación de ruido en paralelo dentro de cada uno.