Luna TTS je vícejazyčná rodina modelů pro převod textu na řeč od startupu VUI Labs. Model využívá neautoregresivní maskovanou difuzi založenou na Qwen3: hlasové tokeny negeneruje postupně jeden po druhém, ale v několika krocích je paralelně doplňuje.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS je rodina vícejazyčných modelů pro převod textu na řeč, kterou vyvíjí čínský startup VUI Labs. Nabízí standardní variantu zaměřenou na kvalitu hlasu a verzi Realtime určenou pro plynulé hlasové interakce. VUI Labs vznikl na začátku roku 2025; podle veřejně dostupných zpráv jej založili profesor Šanghajské univerzity Jiao Tong Čchien Jen-min a sériový podnikatel Mej Ťie.
Pozornost si Luna-TTS nezískala jen jedním pořadím v žebříčku. Zajímavá je především změna způsobu, jakým model řeč vytváří: místo postupného předpovídání jednotlivých hlasových tokenů používá generování blízké difuzním modelům. Zvuk nejprve převede do diskrétní reprezentace a poté v několika kolech současně doplňuje velké množství chybějících tokenů. Cílem je spojit přirozenější projev s nízkou latencí při konverzaci.1
3
Odpověď závisí na konkrétním testu a datu. Tvrzení, že Luna-TTS je dlouhodobě „nejlepší hlasový model na světě“, dostupné podklady nepotvrzují.
Rozdíly nemusí znamenat, že některý ze zdrojů nutně chybuje. Slepé poslechové testy se mění podle verze modelu, jazyka, použitého hlasu, promptu, počtu vzorků i okamžiku hlasování. Nejopatrnější závěr tedy zní: Luna-TTS se dostala mezi přední modely TTS a v některých časových úsecích byla první nebo třetí. Není však doloženo, že trvale poráží Cartesii, ElevenLabs, Qwen nebo všechny ostatní konkurenty.
Dostupné zdroje navíc neposkytují spolehlivé a přímo srovnatelné pořadí vůči modelům ByteDance Seed nebo Zhipu. Je proto předčasné popisovat vztah mezi těmito systémy jako jednoznačné celkové vítězství či porážku.
Luna-TTS vychází z předtrénovaného jazykového modelu Qwen3-0.6B, který byl dále upraven pro práci s hlasovými tokeny.2 Tradiční autoregresivní systémy generují codec tokeny postupně: každý další krok navazuje na předchozí. Luna-TTS místo toho náhodně maskuje části celé mřížky tokenů získaných reziduální vektorovou kvantizací (RVQ) a následně je v několika kolech paralelně opravuje.
1
4
Díky tomu není pořadí generování úplně svázané s již vytvořeným prefixem řeči. Model může v jednom kroku zpracovávat více pozic najednou. To může zkrátit čekání u dlouhých sekvencí a omezit hromadění chyb, které se u čistě sekvenčního generování mohou přenášet z jednoho kroku do dalšího.1
3
Součástí systému je vlastní kodek Luna-Codec, který převádí zvuk do diskrétní reprezentace. Veřejné materiály uvádějí vzorkovací frekvenci 24 kHz, snímkovou frekvenci 25 Hz a osm codebooků.8
9
Kodek zde není jen technický doplněk pro kompresi. Určuje, kolik akustické informace musí model předpovídat, kolik rámců připadá na sekundu a jak dobře lze vyvažovat kvalitu s rychlostí. Luna-TTS proto kombinuje jazykový model, diskrétní zvukovou reprezentaci a difuzní generování jako jeden provázaný systém.
Standardní Luna-TTS může vytvářet celou promluvu neautoregresivně. Pro živý dialog je však praktičtější začít přehrávat hlas ještě před dokončením celé věty. Realtime varianta proto používá kompromis: mezi jednotlivými bloky generuje postupně, uvnitř každého bloku ale provádí paralelní odšumování.1
4
Jeden blok obsahuje 32 codec rámců, tedy 1,28 sekundy zvuku. Realtime využívá KV cache pro uchování kontextu a po odevzdání prvního bloku postupně posílá další audio.1 Označení „zcela neautoregresivní Realtime“ by proto bylo nepřesné. Přesnější popis je: systém je autoregresivní na úrovni bloků, ale uvnitř jednotlivých bloků generuje paralelně pomocí difuze.
Technická zpráva popisuje také dodatečné trénování pomocí metody GRPO, upravené pro diskrétní maskovanou difuzi, a řízení emocí i neverbálních hlasových projevů.1
5 Smyslem není pouze srozumitelnost, ale také přirozenější intonace, výraznější podání a lepší přizpůsobení uživatelským preferencím.
Materiály uvádějí rovněž editaci řeči a klonování hlasu bez dalšího trénování konkrétního mluvčího. Z pohledu architektury jde o úlohy podobné doplňování nebo přepisování části tokenové mřížky.1
4 Konkrétní kvalitu klonování, potřebnou délku referenční nahrávky a stabilitu v jednotlivých jazycích však musí ověřit praktické testy, nikoli pouze popis modelu.
Technická zpráva Luna-TTS Realtime uvádí několik výrazných čísel. V lokálním testu se zahřátou službou dosáhl systém faktoru reálného času (RTF) 0,024 a první blok zvuku o délce 1,28 sekundy odevzdal za 41,6 milisekundy.1
5
Další zprávy uvádějí obvykle osm až 16 kroků odšumování a testování na dvou GPU H20.7 Z hlediska samotného měřeného inferenčního enginu to naznačuje vysokou propustnost.
Číslo 41,6 ms ale nelze automaticky chápat jako čekání, které zažije každý uživatel cloudového API. Test probíhal na konkrétním hardwaru, s předem zahřátou službou, paralelním nastavením a lokálním způsobem nasazení. Skutečnou odezvu mohou prodloužit síť, fronta požadavků, předzpracování textu, dekódování audia i zatížení produkčního provozu. Jde tedy spíše o čas odevzdání prvního bloku za kontrolovaných podmínek než o univerzální garanci koncové latence.
Autoři uvádějí, že Luna-TTS byla předtrénována na přibližně jednom milionu hodin čínské, anglické, japonské a korejské řeči.1
2 Takto rozsáhlá vícejazyčná data mohou zlepšit výslovnost, prozodii i modelování hlasu napříč jazyky.
Veřejně dostupný abstrakt ale neobsahuje dost podrobností, aby bylo možné nezávisle posoudit původ dat, způsob čištění, podíl jednotlivých jazyků nebo otázky autorských práv. Údaj o jednom milionu hodin proto můžeme uvádět jako deklarovaný rozsah tréninku, nikoli jako důkaz, že model stejně dobře zvládá každý jazyk, přízvuk nebo typ použití.
Z veřejných informací vyplývá, že VUI Labs nechce prodávat pouze samostatný převod textu na řeč. Současně rozvíjí modelové a API služby, nástroje pro tvůrce a aplikace hlasových agentů. Kvalita syntézy je v takovém modelu jen jednou částí výsledného produktu. Důležité jsou také klonování hlasu, řízení emocí, dialogová logika, latence, náklady na provoz a napojení na firemní systémy.
Průmyslové zprávy tvrdí, že firma své technologie nasadila například v logistickém dispečinku, internetovém pojištění a softwaru pro cestovní ruch a hotelnictví. Několik zákazníků mělo dohromady uskutečnit více než milion obchodních dialogů.6 Jde však o tvrzení firmy nebo jejích nasazujících partnerů citované v médiích, nikoli o nezávisle auditovaný ukazatel. Veřejné zdroje neuvádějí úplný seznam zákazníků, přesnou definici dialogu, sledované období ani srovnatelnou metodiku vůči jiným dodavatelům.
Zakladatelský tým spojuje akademické vedení výzkumu s produktovým a obchodním know-how: Čchien Jen-min má na starosti oblast řeči a umělé inteligence, zatímco Mej Ťie je popisován jako sériový podnikatel. Takové složení může usnadnit převod výzkumného modelu do API, oborových řešení a hlasových agentů. Dlouhodobou konkurenceschopnost však rozhodnou také data z reálného provozu, udržení zákazníků, náklady na inferenci a schopnost dodávat službu globálně.
Z technické zprávy a dostupných žebříčků lze jako nejlépe doložené přednosti vyzdvihnout čtyři oblasti:
Tyto volby vysvětlují, proč Luna-TTS dokázala v některých slepých testech rychle vystoupat do popředí. Samy o sobě ale nedokazují převahu v ceně, stabilitě dlouhých textů, konzistenci hlasu, právní bezpečnosti dat, dostupnosti API ani ve všech jazycích.
Nejpevnější část příběhu Luna-TTS je technická. VUI Labs spojil jazykový model odvozený od Qwen3, diskrétní hlasový kodek, maskovanou difuzi, dodatečné posilovací učení a blokové streamování do uceleného systému TTS.1
V srpnu 2026 se Luna-TTS podle veřejných zpráv dostala na první místo v Hugging Face TTS Arena a ve stejné době byla třetí v Artificial Analysis Speech Arena.8 Snapshot Artificial Analysis z 1. září ji však uváděl na pátém místě. Nejrozumnější interpretace proto není „Luna-TTS navždy porazila všechny soupeře“, ale spíše: jde o významný model z přední části globální soutěže TTS a jeho paralelní difuzní architektura i blokové generování v reálném čase stojí za pozornost.
Vývojáři, kteří vybírají technologii pro vlastní produkt, by proto neměli rozhodovat podle jediného celkového pořadí. Smysluplnější je otestovat konkrétní cílové jazyky, klonování hlasu, ovládání emocí, čas do prvního audia, konzistenci dlouhých textů a skutečné náklady API.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS je vícejazyčná rodina modelů pro převod textu na řeč od startupu VUI Labs.
Luna TTS je vícejazyčná rodina modelů pro převod textu na řeč od startupu VUI Labs. Model využívá neautoregresivní maskovanou difuzi založenou na Qwen3: hlasové tokeny negeneruje postupně jeden po druhém, ale v několika krocích je paralelně doplňuje.
VUI Labs založili profesor Šanghajské univerzity Jiao Tong Čchien Jen min a sériový podnikatel Mej Ťie.