Luna TTS är en flerspråkig text till tal familj från VUI Labs. Modellen rapporterades som etta i Hugging Face TTS Arena i augusti 2026, men placerades som femma i Artificial Analysis ögonblicksbild från den 1 september.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS är en flerspråkig text-till-tal-modell från den kinesiska röst-AI-startupen VUI Labs. Familjen består av en standardversion med fokus på ljudkvalitet och en Realtime-version för strömmande, lågfördröjd interaktion. VUI Labs grundades i början av 2025 av Shanghai Jiao Tong-professorn Qian Yanmin och serieentreprenören Mei Jie.
Det som väckt uppmärksamhet är dock inte bara enstaka topplaceringar. Luna-TTS försöker ändra själva sättet som syntetiskt tal genereras på: från sekventiell token-för-token-produktion till en metod som påminner mer om diffusion, där många rösttoken kan skapas eller korrigeras samtidigt.1
3
Det korta svaret är: högt, men inte stabilt som global etta. Resultatet beror på vilken lista, modellversion och tidpunkt man tittar på.
Det betyder inte nödvändigtvis att källorna motsäger varandra. Blindlyssning påverkas av bland annat modellversion, språk, röst, instruktioner, antal testexempel och när rösterna samlades in. Den mest rimliga slutsatsen är att Luna-TTS har etablerat sig bland de främsta TTS-modellerna och under vissa tidsperioder nått första- eller tredjeplats – men att underlaget inte visar att modellen varaktigt besegrar Cartesia, ElevenLabs, Qwen eller alla andra konkurrenter.
Det finns inte heller tillräckligt jämförbara data från samma rankning för att fastställa en exakt placering mot ByteDance Seed eller Zhipu. Därför bör man undvika att beskriva relationen mellan dessa modeller som en entydig total seger för någon av dem.
Luna-TTS bygger vidare på den förtränade språkmodellen Qwen3-0.6B, som har anpassats för att arbeta med talets diskreta token.2 I en traditionell autoregressiv TTS-modell förutsägs nästa codec-token steg för steg. Luna-TTS maskerar i stället delar av ett helt RVQ-tokenrutnät och förfinar de dolda delarna i flera parallella omgångar.
1
4
Det förändrar beroendekedjan i genereringen. Modellen behöver inte vara lika hårt bunden till början av den tidigare genererade ljudsekvensen, vilket kan minska fördröjningen vid långa sekvenser och begränsa risken för att ett tidigt fel följer med genom resten av uttalet.1
3
Till modellen hör den egenutvecklade Luna-Codec, som omvandlar ljud till en diskret representation. Den publikt beskrivna konstruktionen använder 24 kHz samplingsfrekvens, 25 Hz bildfrekvens och åtta codebooks.8
9
En codec är mer än ett komprimeringssteg. Den bestämmer hur mycket akustisk information modellen måste förutsäga, hur många ramar som behandlas varje sekund och hur väl systemet kan balansera ljudkvalitet mot hastighet. I Luna-TTS är språkmodell, codec och diffusionsbaserad sampling därför delar av samma systemdesign.
Standardversionen kan generera ett helt yttrande med icke-autoregressiv maskerad diffusion. För ett samtalssystem krävs däremot att ljud börjar spelas upp innan hela meningen är färdig. Realtime-versionen använder därför en kompromiss: blocken genereras sekventiellt, men innehållet i varje block brusreduceras parallellt.1
4
Ett block består av 32 codec-ramar, motsvarande 1,28 sekunders ljud. Realtime använder KV-cache för att bevara kontext och skickar ut efterföljande ljudblock när det första har fastställts.1 Det är alltså missvisande att kalla versionen helt icke-autoregressiv. Mer exakt är den autoregressiv mellan blocken och parallell genom diffusion inom varje block.
Teknikrapporten beskriver också efterträning med GRPO – en form av förstärkningsinlärning som anpassats till den diskreta maskerade diffusionsprocessen – samt kontroll över känslor och icke-verbala ljuduttryck.1
5 Målet är inte bara begripligt tal, utan också naturligare uttryck och bättre anpassning till användarpreferenser.
Röstredigering och nollskottskloning av röster kan enligt beskrivningen formuleras som uppgifter där delar av talets tokenrutnät fylls i eller skrivs om.1
4 Den faktiska kvaliteten på röstkloningen, mängden referensljud som krävs och stabiliteten mellan olika språk måste dock bedömas genom praktiska tester – inte enbart genom att läsa modellarkitekturen.
I Luna-TTS Realtime-rapporten anges ett realtidsförhållande, RTF, på 0,024 efter uppvärmning. Systemet ska dessutom ha skickat sitt första avkodade ljudblock på 1,28 sekunder efter 41,6 millisekunder i ett lokalt serveringstest.1
5
Rapporteringen anger vanligtvis 8–16 brusreduceringssteg och tester med två H20-GPU:er.7 Mätt innanför själva inferensmotorn innebär siffrorna mycket hög genomströmning.
Men 41,6 millisekunder är inte samma sak som den väntetid alla användare får i ett moln-API. Testet använde särskild hårdvara, parallell konfiguration, uppvärmd tjänst och lokal serveringsmiljö. Nätverk, köer, textförbehandling, ljudavkodning och belastning i produktion kan göra den upplevda fördröjningen längre. Siffran bör därför läsas som tiden till första blocket under kontrollerade testförhållanden – inte som ett generellt löfte om fördröjningen i varje API-anrop.
Författarna uppger att Luna-TTS förtränats på omkring en miljon timmar kinesiskt, engelskt, japanskt och koreanskt tal.1
2 Ett sådant flerspråkigt material kan ge bredare täckning av uttal, prosodi och röstmodellering över språkgränser.
De offentliga sammanfattningarna ger däremot inte tillräckligt med information för en oberoende bedömning av datakällor, rensningsmetoder, fördelningen mellan språken eller upphovsrättslig efterlevnad. Därför är ”en miljon timmar” en beskrivning av rapporterad träningsskala, inte ett bevis på att modellen är bäst för varje språk, dialekt eller användningsområde.
VUI Labs verkar inte positionera Luna-TTS som en fristående syntestjänst. Den publika bilden är snarare en kombination av modell- och API-funktioner, verktyg för kreatörer och tillämpningar med röststyrda AI-agenter.
Det innebär att modellens ljudkvalitet bara är en del av erbjudandet. För kommersiell användning spelar även röstkloning, känslokontroll, dialoglogik, fördröjning, kostnad för inferens och integration med kundernas system stor roll.
Branschrapportering hävdar att VUI Labs har använt tekniken inom bland annat logistikstyrning, internetförsäkring och programvara för resor och hotell, och att flera kunder tillsammans genomfört mer än en miljon affärssamtal.6 Det är dock ett påstående från företag eller rapporterade leveransparter, inte en oberoende reviderad kundmätning. Offentliga källor redovisar inte heller fullständiga kundlistor, definitionen av ett samtal, den aktiva mätperioden eller jämförelser med andra leverantörer.
Grundarteamet kombinerar akademiskt teknikansvar med produkt- och kommersiell erfarenhet: Qian Yanmin förknippas med forskning inom tal och artificiell intelligens, medan Mei Jie har beskrivits som serieentreprenör. Den kombinationen kan underlätta vägen från forskningsmodell till API, branschlösning och röstagent. Den långsiktiga konkurrenskraften avgörs däremot av faktorer som dataåterkoppling, kundlojalitet, kostnad per genererat ljud och förmågan att leverera globalt.
Sammanvägt pekar teknikrapporten och rankningsmaterialet på fyra tydliga styrkor:
Det förklarar varför Luna-TTS snabbt kunde nå höga placeringar i vissa blindlyssningstester. Det bevisar däremot inte automatiskt att modellen är bäst när pris, långa texter, röstkonsistens, rättighetshantering, API-drift eller alla språk vägs in samtidigt.
Den tekniska kärnan i Luna-TTS är trovärdig och intressant. VUI Labs har kombinerat en Qwen3-baserad språkmodell, en diskret talcodec, maskerad diffusion, förstärkningsinlärning och blockvis strömning till ett sammanhållet TTS-system.1
Modellen rapporterades som etta i Hugging Face TTS Arena i augusti 2026 och som trea i Artificial Analysis under samma period. I Artificial Analysis ögonblicksbild från den 1 september låg Luna TTS däremot på femte plats.8 Den försiktigaste och mest användbara beskrivningen är därför inte att Luna-TTS för alltid har besegrat alla konkurrenter, utan att modellen hör till den globala TTS-toppen och att dess parallella diffusion och blockvisa realtidsgenerering är värda att följa.
För utvecklare som ska välja modell är nästa steg inte att bara titta på en totalrankning. Testa i stället de språk som faktiskt ska användas, röstkloning, känslokontroll, tid till första ljud, stabilitet vid långa texter och den verkliga kostnaden för API-anrop.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS är en flerspråkig text till tal familj från VUI Labs. Modellen rapporterades som etta i Hugging Face TTS Arena i augusti 2026, men placerades som femma i Artificial Analysis ögonblicksbild från den 1 september.
Luna TTS är en flerspråkig text till tal familj från VUI Labs. Modellen rapporterades som etta i Hugging Face TTS Arena i augusti 2026, men placerades som femma i Artificial Analysis ögonblicksbild från den 1 september. I stället för att förutsäga rösttoken en i taget använder modellen Qwen3 baserad diskret maskerad diffusion, där delar av ett helt tokenrutnät kan förfinas parallellt.
VUI Labs grundades i början av 2025 av Shanghai Jiao Tong professorn Qian Yanmin och serieentreprenören Mei Jie.