Luna TTS, VUI Labs tarafından geliştirilen çok dilli bir metinden sese model ailesi. Modelin temel farkı, ses token’larını tek tek tahmin etmek yerine Qwen3 tabanlı maskeli difüzyon mimarisiyle çok sayıda token’ı paralel biçimde iyileştirmesi.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS, Çin merkezli ses yapay zekâ girişimi VUI Labs tarafından geliştirilen çok dilli metinden sese (TTS) model ailesi. Ailenin iki ana yönü bulunuyor: daha yüksek ses kalitesine odaklanan standart Luna-TTS ve gerçek zamanlı etkileşim için tasarlanan Luna-TTS Realtime.
VUI Labs’ın 2025’in başında Şanghay Jiao Tong Üniversitesi profesörü Qian Yanmin ile seri girişimci Mei Jie tarafından kurulduğu bildiriliyor. Modelin kısa sürede dikkat çekmesinin nedeni yalnızca bir sıralamada üst sıralara çıkması değil. Luna-TTS, konuşma üretiminde yaygın olan “token’ları sırayla tahmin etme” yaklaşımı yerine, difüzyon modellerine daha yakın paralel bir üretim düzeni kullanıyor.1
3
Luna-TTS’nin sıralamasını tek bir “dünyanın en iyi modeli” ifadesiyle özetlemek doğru olmaz. Ses modeli karşılaştırmaları; kullanılan sürüme, test dillerine, ses örneklerine, istemlere, oy sayısına ve ölçüm tarihine göre değişebiliyor.
Bu nedenle en sağlam sonuç şu: Luna-TTS, önde gelen TTS değerlendirmelerinde kısa sürede üst sıralara çıkan güçlü bir rakip. Bazı zaman aralıklarında birinci veya üçüncü oldu; ancak mevcut kaynaklar modelin Cartesia, ElevenLabs, Qwen, ByteDance Seed, Zhipu ve diğer tüm rakiplerini sürekli olarak geride bıraktığını göstermiyor.
Aynı veri seti ve aynı değerlendirme koşullarıyla doğrulanmış yeterli sonuç bulunmadığı için Luna-TTS’nin ByteDance Seed veya Zhipu modellerine karşı kesin sırasını söylemek de mümkün değil. Bu modeller arasında kapsamlı ve değişmez bir galibiyet ilan etmek, mevcut kanıtların ötesine geçer.
Luna-TTS, önceden eğitilmiş Qwen3-0.6B dil modeli temel alınarak ses token’ları üreten bir difüzyon dil modeli hâline getirildi.2 Geleneksel otoregresif TTS sistemleri, ses codec’i token’larını genellikle bir öncekinin devamı olacak şekilde adım adım tahmin eder.
Luna-TTS ise tüm bir konuşmaya ait artık vektör niceleme (RVQ) token ızgarasında rastgele maskeleme uyguluyor ve birden fazla iyileştirme turunda maskeli konumları paralel olarak dolduruyor.1
4 Böylece üretim sırası tamamen ses dizisinin ön ekine bağlı kalmıyor.
Bu yaklaşımın iki olası avantajı var: Uzun ses dizilerindeki ardışık gecikme azalabiliyor ve bir noktadaki hatanın tüm sonraki token’lara zincirleme biçimde yayılması sınırlanabiliyor.1
3 Bunun karşılığında modelin örnekleme adımları, codec tasarımı ve paralel donanım kullanımı birlikte optimize edilmeli.
Luna-TTS, sesi dil modelinin işleyebileceği ayrık bir gösterime dönüştürmek için şirketin geliştirdiği Luna-Codec’i kullanıyor. Açık kaynak teknik açıklamalarda codec’in 24 kHz örnekleme hızı, saniyede 25 kare ve 8 codebook içeren bir yapı kullandığı belirtiliyor.8
9
Codec burada basit bir sıkıştırma katmanı değil. Modelin saniyede kaç ses çerçevesi işleyeceğini, ne kadar ayrıntı tahmin edeceğini ve paralel üretimle ses kalitesi-hız dengesinin nasıl kurulacağını belirliyor. Bu nedenle Luna-TTS’nin yaklaşımı; dil modeli, ayrık codec ve difüzyon örneklemesini tek bir sistem olarak tasarlamaya dayanıyor.
Standart Luna-TTS, bir konuşmanın tamamını küresel ve tamamen ardışık olmayan biçimde üretmeye çalışıyor. Gerçek zamanlı diyaloglarda ise sistemin kullanıcı cümlesini tamamlamasını beklemeden ses vermesi gerekiyor. Luna-TTS Realtime bu noktada karma bir tasarım kullanıyor.
Realtime sürümü, bloklar arasında sırayla ilerlerken her bloğun içindeki token’ları paralel biçimde gürültüden arındırıyor. Her blok 32 codec karesinden oluşuyor ve 1,28 saniyelik sese karşılık geliyor. Sistem bağlamı korumak için KV Cache kullanıyor; ilk blok gönderildikten sonra sonraki ses parçalarını kademeli olarak iletiyor.1
4
Bu yüzden “Realtime tamamen otoregresif olmayan bir model” demek teknik olarak eksik kalır. Daha doğru tanım şudur: Model bloklar arasında otoregresif bağımlılığa sahip, ancak her blok içinde paralel difüzyon üretimi yapıyor.
Teknik rapor, ayrık maskeli difüzyon sürecine uyarlanan GRPO tabanlı bir pekiştirmeli öğrenme sonrası eğitim aşamasından söz ediyor. Ayrıca duygu ve konuşma dışı ses ifadeleri üzerinde kontrol sağlanması hedefleniyor.1
5
Bu tür bir eğitim yalnızca kelimelerin anlaşılır olmasını amaçlamıyor. Doğallık, vurgu, duygusal ifade ve kullanıcının tercih ettiği konuşma tarzına uyum da hedefleniyor. Ses düzenleme ve sıfır örnekli ses klonlama ise ses token’ı ızgarasının bir bölümünü doldurma veya yeniden yazma işlemi olarak ele alınabiliyor.1
4
Bununla birlikte klonlama kalitesi, gereken referans ses uzunluğu ve farklı dillerdeki kararlılık yalnızca mimariye bakılarak doğrulanamaz. Bu özelliklerin gerçek performansı, ürün testleriyle ayrıca ölçülmeli.
Luna-TTS Realtime teknik raporunda, ısınmış yerel servis protokolü altında uçtan uca gerçek zaman katsayısının (RTF) 0,024 olduğu ve ilk 1,28 saniyelik çözümlenmiş ses bloğunun 41,6 milisaniyede gönderildiği bildiriliyor.1
5
İlgili haberlerde Realtime sürümünün genellikle 8 ila 16 gürültü giderme adımı kullandığı ve testlerin iki H20 GPU üzerinde yapıldığı aktarılıyor.7 Bu rakamlar, ölçülen model motoru sınırları içinde yüksek üretim hızına işaret ediyor.
Ancak 41,6 milisaniye, her kullanıcının bulut API’sinde yaşayacağı gerçek bekleme süresi anlamına gelmez. Testlerde belirli donanım, paralel çalıştırma ayarları, ısınmış servis ve yerel dağıtım protokolü kullanıldı. Ağ aktarımı, istek kuyruğu, metin ön işleme, ses çözümleme ve üretim ortamındaki yoğunluk toplam gecikmeyi artırabilir.
Dolayısıyla bu değer, kontrollü koşullarda ilk ses bloğunun teslim süresi olarak okunmalı; genel geçer bir bulut API deneyimi taahhüdü olarak değerlendirilmemeli.
Yazarlar, Luna-TTS’nin Çince, İngilizce, Japonca ve Korece konuşmalardan oluşan yaklaşık 1 milyon saatlik veriyle önceden eğitildiğini bildiriyor.1
2 Dört dilli bu kapsam; telaffuz, ezgi ve diller arası ses modellemesi için daha geniş bir eğitim tabanı sağlayabilir.
Ancak kamuya açık özetler veri kaynaklarını, temizleme ölçütlerini, dillerin veri içindeki payını veya telif uyumluluğunu bağımsız biçimde değerlendirmek için yeterli ayrıntı sunmuyor. Bu nedenle “1 milyon saatlik veri” ifadesi bildirilen eğitim ölçeği olarak kullanılabilir; fakat modelin her dilde, her aksanda veya her kullanım senaryosunda aynı ölçüde üstün olduğu sonucu çıkarılamaz.
VUI Labs, Luna-TTS’yi yalnızca tek başına bir ses sentezleme modeli olarak konumlandırmıyor gibi görünüyor. Şirketin yaklaşımı; model ve API yetenekleri, içerik üreticilerine yönelik ses araçları ve sesli ajan uygulamalarını birlikte geliştirmeye dayanıyor.
Bu yaklaşımda model kalitesi ticari değerin yalnızca bir parçası. Ses klonlama, duygu kontrolü, diyalog akışı, gecikme, dağıtım maliyeti, API güvenilirliği ve sektörel entegrasyon da en az ses doğallığı kadar önemli hâle geliyor.
Sektör haberlerinde VUI Labs’ın lojistik planlama, çevrim içi sigorta ve seyahat-konaklama yazılımları gibi alanlarda kullanıma geçtiği; çeşitli müşterilerin toplamda 1 milyondan fazla iş görüşmesi gerçekleştirdiği ileri sürülüyor.6 Ancak bu rakam medya haberlerinde yer alan şirket veya uygulama tarafı beyanı niteliğinde. Bağımsız denetim verisi olarak kabul edilmemeli; müşteri listesi, görüşmelerin tanımı, aktif kullanım süresi ve rakiplerle karşılaştırma ölçütleri açık biçimde paylaşılmış değil.
Şirketin erken dönem kurucu yapısı, akademik teknik liderlik ile ürünleştirme ve ticarileştirme deneyimini bir araya getiriyor. Qian Yanmin’in ses ve yapay zekâ araştırmalarına, Mei Jie’nin ise girişimcilik ve ürünleşme tarafına liderlik ettiği bildiriliyor. Bu yapı, araştırma odaklı bir modeli API’ye, sektörel çözümlere ve sesli ajan ürünlerine dönüştürmeyi kolaylaştırabilir. Uzun vadeli rekabet gücü ise veri geri besleme döngüsüne, müşteri bağlılığına, istek başına çıkarma maliyetine ve küresel ölçekte hizmet sunma kapasitesine bağlı olacak.
Teknik raporlar ve sıralama verileri birlikte değerlendirildiğinde öne çıkan dört nokta var:
Bu tasarım kararları, Luna-TTS’nin bazı kör dinleme sıralamalarında neden hızla üst sıralara çıktığını açıklıyor. Ancak bunlar tek başına fiyat, uzun metin kararlılığı, ses tutarlılığı, telif ve güvenlik politikaları, API erişilebilirliği veya tüm dillerdeki genel performans açısından rakiplerinden üstün olduğunu kanıtlamıyor.
Luna-TTS’nin teknik hikâyesi kayda değer: VUI Labs, Qwen3 türevi bir dil modelini ayrık ses codec’i, maskeli difüzyon üretimi, GRPO tabanlı sonrası eğitim ve blok düzeyinde akışlı çıkarımla birleştiriyor.1
Model, Ağustos 2026’da yayımlanan haberlerde Hugging Face TTS Arena’da birinci, Artificial Analysis’ın aynı döneme ait haberlerinde üçüncü sırada gösterildi. Ancak 1 Eylül 2026 tarihli Artificial Analysis sıralama görüntüsünde beşinci sıraya geriledi.8 Bu tablo, TTS sıralamalarının sürüm ve oy örneklerine ne kadar duyarlı olduğunu gösteriyor.
En temkinli değerlendirme şu: Luna-TTS, küresel TTS rekabetinde üst sıralara çıkmış önemli bir model ve paralel difüzyon ile gerçek zamanlı blok üretimi yakından izlenmesi gereken bir teknik rota sunuyor. Ancak onu “tüm rakiplerini sürekli yenen kalıcı dünya birincisi” olarak tanımlamak için mevcut kanıtlar yeterli değil.
Bir model seçmek isteyen geliştiriciler için en sağlıklı yöntem tek bir genel sıralamaya bakmak yerine hedef dili, ses klonlamayı, duygu kontrolünü, ilk ses gecikmesini, uzun metin tutarlılığını ve gerçek API maliyetini kendi kullanım senaryolarında ayrı ayrı test etmek.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS, VUI Labs tarafından geliştirilen çok dilli bir metinden sese model ailesi.
Luna TTS, VUI Labs tarafından geliştirilen çok dilli bir metinden sese model ailesi. Modelin temel farkı, ses token’larını tek tek tahmin etmek yerine Qwen3 tabanlı maskeli difüzyon mimarisiyle çok sayıda token’ı paralel biçimde iyileştirmesi.
VUI Labs, Şanghay Jiao Tong Üniversitesi profesörü Qian Yanmin ve seri girişimci Mei Jie tarafından kuruldu.