Luna TTS ialah keluarga model teks ke pertuturan berbilang bahasa keluaran VUI Labs. Berbeza daripada model autoregresif yang menjana token suara satu demi satu, Luna TTS menggunakan masked diffusion berasaskan Qwen3 untuk memperbaiki banyak token suara secara serentak.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS ialah keluarga model teks-ke-pertuturan (TTS) berbilang bahasa yang dibangunkan oleh syarikat pemula kecerdasan buatan suara China, VUI Labs. Keluarga ini merangkumi versi standard yang menumpukan kualiti suara dan versi Realtime untuk interaksi pantas. VUI Labs diasaskan pada awal 2025 oleh profesor Universiti Jiao Tong Shanghai, Qian Yanmin, dan usahawan bersiri Mei Jie.
Apa yang membuatkan Luna-TTS menarik bukan sekadar satu keputusan ranking. Model ini cuba mengubah cara suara dijana: daripada meramal token audio satu demi satu kepada pendekatan yang lebih hampir dengan diffusion, iaitu menghasilkan dan memperbaiki banyak token secara selari. Matlamatnya adalah untuk mendapatkan gabungan suara yang lebih natural, ekspresif dan pantas untuk aplikasi masa nyata.1
3
Jawapannya bergantung pada papan ranking, versi model dan tarikh semakan. Jadi, kurang tepat jika Luna-TTS dilabel sebagai “model suara nombor satu dunia” secara kekal.
Perbezaan ini tidak semestinya bercanggah. Arena pendengaran buta dipengaruhi oleh versi model, bahasa ujian, suara, arahan teks, jumlah sampel dan masa pengundian. Kesimpulan yang lebih berhati-hati ialah Luna-TTS pernah berada dalam kelompok teratas TTS global dan mencapai tempat pertama atau ketiga dalam tetingkap masa tertentu, tetapi data yang ada belum membuktikan ia sentiasa mengatasi Cartesia, ElevenLabs, Qwen atau semua pesaing lain.
Sumber yang tersedia juga tidak memberikan perbandingan yang cukup kukuh untuk menentukan kedudukan tepat Luna-TTS berbanding model ByteDance Seed atau Zhipu. Maka, hubungan antara model-model tersebut tidak wajar digambarkan sebagai kemenangan mutlak satu pihak.
Luna-TTS dibangunkan daripada model bahasa Qwen3-0.6B yang dipra-latih, kemudian disesuaikan untuk memproses token suara.2 Dalam TTS autoregresif tradisional, model meramal codec token seterusnya secara berurutan. Luna-TTS pula menggunakan grid token RVQ (residual vector quantization), menutup sebahagian token secara rawak dan memperbaikinya melalui beberapa pusingan secara selari.
1
4
Perubahan ini penting kerana model tidak lagi bergantung sepenuhnya pada awalan urutan suara yang telah dijana. Beberapa kedudukan boleh diproses dalam pusingan yang sama. Secara teori, pendekatan itu mengurangkan kelewatan akibat penjanaan berurutan yang panjang dan mengurangkan risiko kesilapan terus terkumpul sepanjang urutan.1
3
Luna-TTS menggunakan Luna-Codec, codec audio proprietari yang menukar gelombang bunyi kepada perwakilan suara diskret. Maklumat yang diterbitkan menyatakan reka bentuknya menggunakan kadar pensampelan 24 kHz, kadar bingkai 25 Hz dan lapan codebook.8
9
Codec ini bukan sekadar modul pemampatan. Ia menentukan jumlah maklumat suara yang perlu diramal, bilangan bingkai sesaat dan sejauh mana model boleh menyeimbangkan kualiti dengan kelajuan. Dalam kes Luna-TTS, model bahasa, codec diskret dan proses pensampelan diffusion direka sebagai satu sistem yang saling berkait.
Versi standard Luna-TTS boleh menjana keseluruhan ujaran secara bukan autoregresif. Namun, sistem perbualan perlu mula memainkan suara sebelum pengguna atau ejen selesai menghasilkan seluruh ayat. Atas sebab itu, Luna-TTS Realtime menggunakan pendekatan kompromi: blok audio dijana secara berurutan, tetapi semua token dalam satu blok dinyahbising secara selari.1
4
Setiap blok mengandungi 32 bingkai codec, bersamaan 1.28 saat audio. Versi Realtime menggunakan KV Cache untuk menyimpan konteks dan mula menghantar audio selepas blok pertama siap.1 Oleh itu, tidak tepat untuk menyebutnya sebagai sistem “sepenuhnya bukan autoregresif”. Penerangan yang lebih tepat ialah: ia mempunyai pergantungan autoregresif antara blok, tetapi menggunakan penjanaan diffusion secara selari di dalam setiap blok.
Laporan teknikal turut menerangkan proses pascapelatihan pengukuhan berasaskan GRPO yang diubah suai untuk proses masked diffusion diskret, selain kawalan terhadap emosi dan vokalisasi bukan verbal.1
5 Ini bertujuan memperbaiki bukan sahaja kejelasan pertuturan, tetapi juga keaslian, ekspresi dan kesesuaian dengan keutamaan pendengar.
Penyuntingan suara dan pengklonan suara zero-shot pula boleh dianggap sebagai tugas mengisi atau menulis semula sebahagian grid token suara.1
4 Namun, kualiti klon, tempoh audio rujukan yang diperlukan dan kestabilan antara bahasa masih perlu dinilai melalui ujian produk sebenar, bukan disimpulkan hanya daripada seni bina model.
Laporan teknikal Luna-TTS Realtime menyatakan bahawa sistem mencapai faktor masa nyata (RTF) 0.024 dalam ujian perkhidmatan tempatan selepas pemanasan. Ia juga menyerahkan blok audio pertama sepanjang 1.28 saat dalam masa 41.6 milisaat.1
5
Laporan berkaitan menyebut penggunaan antara lapan hingga 16 langkah penyahbisingan, dengan ujian dijalankan pada dua GPU H20.7 Jika diukur pada sempadan enjin inferens, angka ini menunjukkan kadar penjanaan yang tinggi.
Bagaimanapun, 41.6 milisaat bukan jaminan bahawa setiap pengguna akan merasai latensi awan yang sama. Ujian tersebut menggunakan perkakasan, konfigurasi selari, perkhidmatan yang telah dipanaskan dan protokol penggunaan tempatan tertentu. Penghantaran rangkaian, giliran pelayan, prapemprosesan teks, penyahkodan audio dan beban operasi sebenar boleh menambah masa menunggu.
Jadi, angka 41.6 milisaat lebih wajar difahami sebagai masa penghantaran blok pertama dalam keadaan ujian terkawal, bukannya janji latensi hujung ke hujung untuk semua penggunaan API.
Penulis laporan menyatakan bahawa Luna-TTS dipra-latih menggunakan kira-kira satu juta jam data suara dalam bahasa Cina, Inggeris, Jepun dan Korea.1
2 Data berbilang bahasa sedemikian boleh membantu model mempelajari sebutan, intonasi dan ciri suara merentas bahasa.
Namun, ringkasan awam yang tersedia tidak memberikan perincian mencukupi untuk menilai secara bebas sumber data, kaedah pembersihan, pecahan jam mengikut bahasa atau pematuhan hak cipta. Maka, angka satu juta jam boleh disebut sebagai skala latihan yang dilaporkan, tetapi tidak sepatutnya digunakan untuk mendakwa Luna-TTS unggul dalam setiap bahasa, loghat atau senario penggunaan.
Berdasarkan laporan awam, VUI Labs tidak memposisikan Luna-TTS sebagai model sintesis suara semata-mata. Syarikat itu turut membangunkan keupayaan model dan API, alat suara untuk pencipta kandungan serta aplikasi ejen suara.
Pendekatan ini menunjukkan bahawa kualiti model hanyalah satu bahagian daripada nilai komersial. Faktor lain termasuk pengklonan suara, kawalan emosi, penyelarasan dialog, latensi, kos inferens dan integrasi dengan sistem perusahaan.
Laporan industri mendakwa teknologi VUI Labs telah digunakan dalam penjadualan logistik, insurans internet serta perisian pelancongan dan hospitaliti, dengan jumlah perbualan perniagaan pelanggan melebihi satu juta.6 Bagaimanapun, angka itu ialah dakwaan syarikat atau pihak yang melaporkan penggunaan tersebut, bukannya metrik yang diaudit secara bebas. Maklumat awam juga belum mendedahkan senarai pelanggan, takrif “perbualan”, tempoh penggunaan aktif atau kaedah perbandingan dengan pembekal lain.
Dari sudut organisasi, pasukan pengasas VUI Labs menggabungkan kepimpinan penyelidikan akademik dan pengalaman produk serta pengkomersialan. Qian Yanmin dilaporkan mengetuai bidang penyelidikan suara dan AI, manakala Mei Jie ialah usahawan bersiri. Gabungan ini boleh membantu menukar penyelidikan kepada API, penyelesaian industri dan produk ejen suara dengan lebih cepat. Namun, daya saing jangka panjang tetap bergantung pada kitaran data, pengekalan pelanggan, kos inferens seunit dan keupayaan penghantaran global.
Berdasarkan laporan teknikal dan data ranking, kelebihan Luna-TTS yang paling munasabah disokong oleh empat perkara:
Reka bentuk ini membantu menjelaskan mengapa Luna-TTS boleh mencapai kedudukan tinggi dalam sesetengah arena pendengaran buta. Tetapi ia tidak dengan sendirinya membuktikan bahawa Luna-TTS lebih baik dari segi harga, kestabilan teks panjang, konsistensi suara, keselamatan hak cipta, kebolehgunaan API atau semua bahasa berbanding pesaingnya.
Cerita teras Luna-TTS sememangnya mempunyai asas teknikal yang kukuh. VUI Labs menggabungkan model bahasa berasaskan Qwen3, codec suara diskret, masked diffusion, pascapelatihan pengukuhan dan inferens strim mengikut blok dalam satu sistem TTS lengkap.1
Model ini dilaporkan menduduki tempat pertama dalam Hugging Face TTS Arena pada Ogos 2026 dan tempat ketiga dalam laporan Artificial Analysis pada tempoh yang sama. Namun, paparan Artificial Analysis bertarikh 1 September 2026 meletakkannya di tempat kelima.8
Penilaian paling selamat ialah Luna-TTS sudah menjadi salah satu model penting dalam persaingan TTS global, manakala pendekatan penjanaan diffusion secara selari dan blok masa nyata menjadi aspek yang wajar diperhatikan. Ia belum boleh dianggap sebagai model yang kekal mengatasi semua pesaing.
Bagi pembangun yang sedang memilih platform, jangan bergantung pada satu nombor ranking. Uji sendiri bahasa sasaran, pengklonan suara, kawalan emosi, masa audio pertama, konsistensi teks panjang dan kos sebenar API.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS ialah keluarga model teks ke pertuturan berbilang bahasa keluaran VUI Labs.
Luna TTS ialah keluarga model teks ke pertuturan berbilang bahasa keluaran VUI Labs. Berbeza daripada model autoregresif yang menjana token suara satu demi satu, Luna TTS menggunakan masked diffusion berasaskan Qwen3 untuk memperbaiki banyak token suara secara serentak.
VUI Labs diasaskan oleh profesor Universiti Jiao Tong Shanghai, Qian Yanmin, bersama usahawan bersiri Mei Jie.