Luna TTS to rodzina wielojęzycznych modeli zamiany tekstu na mowę rozwijana przez VUI Labs. Zamiast przewidywać tokeny audio po kolei, Luna TTS wykorzystuje opartą na Qwen3 dyskretną dyfuzję maskowaną i równolegle uzupełnia siatkę tokenów głosowych.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS to rodzina wielojęzycznych modeli tekst-na-mowę rozwijana przez chiński startup VUI Labs. Obejmuje standardową wersję nastawioną na jakość oraz wariant Realtime, zaprojektowany z myślą o rozmowach prowadzonych z niskim opóźnieniem. Firma powstała na początku 2025 roku. Jej współzałożycielami są profesor Shanghai Jiao Tong University Qian Yanmin oraz seryjny przedsiębiorca Mei Jie.
To, co przyciągnęło uwagę branży, nie sprowadza się do jednego miejsca w tabeli wyników. Luna-TTS zmienia sposób generowania mowy: zamiast przewidywać tokeny kodeka jeden po drugim, model najpierw kompresuje dźwięk do postaci dyskretnych tokenów, a następnie wielokrotnie i równolegle uzupełnia zamaskowane fragmenty całej siatki audio.1
3
Najważniejsza uwaga: pozycja modelu zależy od konkretnego rankingu, wersji systemu i momentu pomiaru. Nie ma podstaw, by przedstawiać Lunę jako stale najlepszy model TTS na świecie.
Takie różnice nie muszą oznaczać błędu. Rankingi oparte na ślepym odsłuchu reagują na zmianę wersji modelu, język testu, użyty głos, prompt, liczbę próbek i moment zakończenia głosowania. Najuczciwszy wniosek brzmi więc: Luna-TTS weszła do ścisłej czołówki międzynarodowych rankingów TTS i w wybranych okresach była pierwsza lub trzecia, ale dostępne dane nie potwierdzają trwałej przewagi nad Cartesią, ElevenLabs, Qwenem ani wszystkimi konkurentami.
Nie ma również wystarczająco wiarygodnych, bezpośrednio porównywalnych danych z jednego rankingu, aby określić dokładną pozycję Luny względem modeli ByteDance Seed czy Zhipu. Nie należy zatem opisywać tych relacji jako rozstrzygniętej, całościowej rywalizacji.
Luna-TTS powstała na bazie wstępnie wytrenowanego modelu językowego Qwen3-0.6B, który następnie dostosowano do pracy z tokenami mowy.2 W tradycyjnym autoregresyjnym TTS model przewiduje kolejny token kodeka na podstawie poprzednich. Luna-TTS operuje natomiast na całej siatce tokenów RVQ — czyli reprezentacji uzyskanej przez wielopoziomową kwantyzację wektorową — i w kolejnych iteracjach naprawia zamaskowane miejsca.
1
4
W praktyce oznacza to, że kolejność generowania nie jest całkowicie uzależniona od wcześniej utworzonego prefiksu. W jednej iteracji można przetwarzać wiele pozycji jednocześnie. Ma to ograniczać opóźnienie typowe dla długiego, sekwencyjnego generowania oraz zmniejszać ryzyko kumulowania się błędów wzdłuż całej wypowiedzi.1
3
System wykorzystuje opracowany przez VUI Labs kodek Luna-Codec. Publicznie opisane parametry obejmują częstotliwość próbkowania 24 kHz, 25 klatek na sekundę oraz osiem kodbooków.8
9
Kodek nie jest wyłącznie modułem kompresującym. Określa, ile informacji akustycznej model musi przewidzieć, ile ramek trzeba wygenerować w każdej sekundzie i czy równoległe przetwarzanie pozwoli zachować kompromis między jakością a szybkością. W przypadku Luny model, dyskretna reprezentacja audio i dyfuzyjny sposób próbkowania zostały zaprojektowane jako jeden system.
Wersja standardowa może generować całą wypowiedź w sposób w pełni nier autoregresyjny. Rozmowa na żywo wymaga jednak innego kompromisu: system powinien zacząć odtwarzać dźwięk, zanim użytkownik skończy mówić lub zanim zostanie wygenerowana cała odpowiedź.
Luna-TTS Realtime tworzy więc kolejne bloki sekwencyjnie, ale wewnątrz każdego bloku odszumia tokeny równolegle. Jeden blok obejmuje 32 klatki kodeka, czyli 1,28 sekundy audio. Wersja Realtime korzysta z KV Cache do zachowania kontekstu i stopniowo przekazuje kolejne fragmenty dźwięku po zatwierdzeniu pierwszego bloku.1
4
To ważne doprecyzowanie: określenie „w pełni nier autoregresyjny Realtime” byłoby mylące. Trafniejszy opis mówi o zależności autoregresyjnej między blokami i równoległej dyfuzji wewnątrz każdego z nich.
Raport techniczny opisuje również dostosowanie treningu wzmacniającego GRPO do dyskretnego procesu dyfuzji maskowanej. Wspomina także o kontroli emocji i niewerbalnych elementów wokalnych, takich jak dźwięki towarzyszące mowie.1
5
Celem nie jest wyłącznie poprawna wymowa słów. Tego rodzaju dostrajanie ma pomóc w uzyskaniu naturalniejszej intonacji, większej ekspresji i lepszego dopasowania do preferencji odbiorcy.
Z tej samej właściwości — uzupełniania brakujących fragmentów siatki tokenów — wynikają zadania takie jak edycja mowy czy klonowanie głosu w trybie zero-shot.1
4 Sama architektura nie przesądza jednak o jakości klonowania, długości potrzebnego nagrania referencyjnego ani stabilności w każdym języku. Te elementy wymagają osobnych testów produktu.
W raporcie Luna-TTS Realtime podano trzy często cytowane parametry: współczynnik czasu rzeczywistego RTF na poziomie 0,024, pierwszy blok audio o długości 1,28 sekundy przekazany po 41,6 ms oraz wykorzystanie 8–16 kroków odszumiania.1
5
7
Wyniki uzyskano w rozgrzanym, lokalnym środowisku serwerowym. W części opisów wskazano również testy na dwóch kartach H20.7 Z perspektywy samego silnika wnioskowanie jest więc bardzo szybkie.
Nie należy jednak utożsamiać 41,6 ms z opóźnieniem, którego zawsze doświadczy użytkownik korzystający z chmurowego API. Wynik zależy od sprzętu, konfiguracji równoległej, rozgrzania usługi i protokołu wdrożenia. W realnym środowisku dochodzą jeszcze sieć, kolejka żądań, przygotowanie tekstu, dekodowanie dźwięku i obciążenie produkcyjne. 41,6 ms najlepiej rozumieć jako czas przekazania pierwszego bloku w kontrolowanych warunkach, a nie uniwersalną obietnicę czasu odpowiedzi API.
Twórcy deklarują, że do treningu wykorzystano około miliona godzin nagrań w językach chińskim, angielskim, japońskim i koreańskim.1
2 Tak szeroki korpus może pomóc w modelowaniu wymowy, prozodii i różnic między językami.
Publiczne materiały nie zawierają jednak wystarczających informacji, aby niezależnie ocenić pochodzenie danych, procedury czyszczenia, udział poszczególnych języków czy kwestie praw do nagrań. Liczba miliona godzin jest więc deklarowanym rozmiarem zbioru treningowego, ale nie dowodzi automatycznie przewagi w każdym języku, akcencie i zastosowaniu.
Z publicznych doniesień wynika, że VUI Labs nie chce ograniczać Luny do pojedynczego modelu TTS. Firma rozwija jednocześnie możliwości modelu i API, narzędzia głosowe dla twórców oraz aplikacje oparte na agentach głosowych.
W takim układzie sama jakość głosu to tylko jeden element przewagi. Równie ważne są klonowanie głosu, sterowanie emocjami, prowadzenie dialogu, opóźnienie, koszt obliczeń, wdrożenie i integracja z procesami przedsiębiorstw.
Branżowe publikacje twierdzą, że VUI Labs wdrożyło rozwiązania w logistyce, ubezpieczeniach internetowych oraz oprogramowaniu dla sektora turystyczno-hotelarskiego, a kilku klientów przeprowadziło łącznie ponad milion rzeczywistych rozmów biznesowych.6 To jednak liczba pochodząca z relacji medialnych i deklaracji firmy lub podmiotów wdrażających, a nie niezależnie audytowany wskaźnik. Nie ujawniono pełnej listy klientów, definicji rozmowy, okresu pomiaru ani jednolitego porównania z innymi dostawcami.
Struktura założycielska łączy zaplecze akademickie z doświadczeniem produktowym i komercjalizacyjnym: Qian Yanmin odpowiada za kierunek badań nad głosem i sztuczną inteligencją, a Mei Jie jest opisywany jako seryjny przedsiębiorca. Taki podział może ułatwiać szybkie przejście od prototypu badawczego do API, rozwiązań branżowych i agentów głosowych. Długoterminowa pozycja firmy będzie jednak zależeć także od jakości danych zwrotnych, utrzymania klientów, kosztu inferencji i zdolności do obsługi rynków zagranicznych.
Na podstawie raportu technicznego i dostępnych rankingów można wskazać cztery wiarygodne atuty:
Te rozwiązania pomagają wyjaśnić, dlaczego Luna-TTS szybko pojawiła się wysoko w niektórych ślepych testach odsłuchowych. Nie dowodzą jednak przewagi pod względem ceny, stabilności długich tekstów, spójności barwy, bezpieczeństwa prawnego, dostępności API ani jakości we wszystkich językach.
Najbardziej przekonująca część historii Luny jest techniczna. VUI Labs połączyło model językowy wywodzący się z Qwen3, dyskretny kodek audio, generowanie dyfuzyjne, dostrajanie wzmacniające i blokowe przetwarzanie strumieniowe w kompletny system TTS.1
Luna-TTS była opisywana jako liderka Hugging Face TTS Arena w sierpniu 2026 roku, a w relacjach z tego samego okresu zajmowała trzecie miejsce w Artificial Analysis Speech Arena.8
10 Jednak zrzut Artificial Analysis z 1 września umieszczał ją już na piątej pozycji.
Najrozsądniejsza ocena nie brzmi więc: „Luna-TTS pokonała wszystkich”. Trafniej powiedzieć, że VUI Labs ma dziś jednego z istotnych konkurentów w globalnym wyścigu TTS, a połączenie równoległej dyfuzji i generowania blokowego zasługuje na dalszą obserwację.
Dla zespołu wybierającego technologię ważniejszy od jednego miejsca w rankingu będzie własny test: w docelowym języku, z wymaganym głosem, klonowaniem, kontrolą emocji, długimi tekstami, oczekiwanym czasem pierwszego dźwięku i rzeczywistym kosztem API.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS to rodzina wielojęzycznych modeli zamiany tekstu na mowę rozwijana przez VUI Labs.
Luna TTS to rodzina wielojęzycznych modeli zamiany tekstu na mowę rozwijana przez VUI Labs. Zamiast przewidywać tokeny audio po kolei, Luna TTS wykorzystuje opartą na Qwen3 dyskretną dyfuzję maskowaną i równolegle uzupełnia siatkę tokenów głosowych.
W kontrolowanych, lokalnych testach opisanych w raporcie technicznym pierwszy blok audio był zgłaszany po 41,6 ms, a współczynnik czasu rzeczywistego wyniósł 0,024.