Luna TTS, VUI Labs का बहुभाषी टेक्स्ट टू स्पीच मॉडल परिवार है। अगस्त 2026 में यह Hugging Face TTS Arena की रिपोर्टेड रैंकिंग में पहले स्थान पर रहा, लेकिन 1 सितंबर 2026 के Artificial Analysis स्नैपशॉट में पांचवें स्थान... इसकी प्रमुख तकनीकी खासियत逐 Token ऑटोरिग्रेसिव जनरेशन के बजाय Qwen3 आधारित डिस्क्रीट मास्क्ड डिफ्...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS चीन की वॉइस-AI स्टार्टअप VUI Labs का बहुभाषी टेक्स्ट-टू-स्पीच मॉडल परिवार है। इसमें बेहतर ऑडियो गुणवत्ता पर केंद्रित मानक संस्करण और लाइव बातचीत के लिए बनाया गया Luna-TTS Realtime शामिल है। सार्वजनिक रिपोर्टों के अनुसार VUI Labs की स्थापना 2025 की शुरुआत में शंघाई जिआओतोंग यूनिवर्सिटी के प्रोफेसर च्येन यानमिन और सीरियल उद्यमी मेई जिए ने की थी।
Luna-TTS को चर्चा में लाने वाली बात केवल इसकी किसी एक लीडरबोर्ड रैंकिंग नहीं है। इसका बड़ा दावा तकनीकी है: यह पारंपरिक “एक-एक Token क्रम से अनुमान लगाने” के बजाय डिफ्यूजन-जैसी प्रक्रिया में कई स्पीच Token को समानांतर रूप से तैयार करता है। लक्ष्य है—आवाज की स्वाभाविकता, भाव-अभिव्यक्ति और रियल-टाइम प्रतिक्रिया के बीच बेहतर संतुलन।1
3
इस मॉडल की रैंकिंग को तारीख और लीडरबोर्ड के संदर्भ में देखना जरूरी है। इसे स्थायी रूप से “दुनिया का नंबर एक” कहना उपलब्ध प्रमाणों से सही नहीं होगा।
इन परिणामों में जरूरी नहीं कि कोई विरोधाभास हो। ब्लाइंड-लिसनिंग टेस्ट मॉडल के संस्करण, भाषा, आवाज, प्रॉम्प्ट, नमूना संख्या और वोटिंग अवधि से प्रभावित होते हैं। सबसे संतुलित निष्कर्ष यह है कि Luna-TTS कुछ समय-खंडों में प्रमुख TTS लीडरबोर्ड के शीर्ष पर पहुंचा, लेकिन उपलब्ध आंकड़े यह साबित नहीं करते कि वह लगातार Cartesia, ElevenLabs, Qwen, Google या हर अन्य प्रतिस्पर्धी मॉडल को मात देता है।
ByteDance Seed और Zhipu के मुकाबले इसकी सटीक स्थिति बताने के लिए भी एक ही, समान शर्तों वाले विश्वसनीय लीडरबोर्ड का पर्याप्त डेटा उपलब्ध नहीं है। इसलिए इन मॉडलों के बीच पूर्ण और स्थायी जीत-हार का दावा करना उचित नहीं होगा।
Luna-TTS को प्री-ट्रेंड Qwen3-0.6B भाषा मॉडल से विकसित किया गया है। इसे स्पीच Token के लिए डिफ्यूजन लैंग्वेज मॉडल के रूप में आगे प्रशिक्षित किया गया।2
परंपरागत ऑटोरिग्रेसिव TTS मॉडल आम तौर पर अगले Codec Token का अनुमान लगाते हुए क्रमशः आगे बढ़ते हैं। Luna-TTS इसके बजाय पूरी Residual Vector Quantization यानी RVQ Token ग्रिड पर रैंडम मास्क लगाता है और कई चरणों में छिपे हुए हिस्सों को समानांतर रूप से भरता है।1
4
इस बदलाव का सीधा अर्थ है कि जनरेशन पूरी तरह पिछले Prefix पर निर्भर नहीं रहती। मॉडल एक ही चरण में कई स्थानों पर काम कर सकता है। इससे लंबे ऑडियो में क्रमिक जनरेशन की देरी घट सकती है और शुरुआती गलती के आगे के पूरे अनुक्रम में फैलने का जोखिम भी कम हो सकता है।1
3
Luna-TTS के साथ VUI Labs का अपना Luna-Codec इस्तेमाल होता है। सार्वजनिक तकनीकी विवरण के अनुसार यह 24 kHz सैंपलिंग रेट, 25 Hz फ्रेम रेट और आठ Codebook वाली डिस्क्रीट ऑडियो संरचना पर आधारित है।8
9
Codec केवल ऑडियो को छोटा करने वाला साधारण कंप्रेशन मॉड्यूल नहीं होता। यह तय करता है कि मॉडल को हर सेकंड कितनी ध्वनि-सूचना का अनुमान लगाना है, कितने फ्रेम जनरेट करने हैं और गति व गुणवत्ता के बीच संतुलन कैसे बनेगा। Luna-TTS में भाषा मॉडल, Codec और डिफ्यूजन सैंपलिंग को एक संयुक्त सिस्टम की तरह डिजाइन किया गया है।
पूरे वाक्य को एक साथ जनरेट करना गुणवत्ता के लिए उपयोगी हो सकता है, लेकिन लाइव बातचीत में सिस्टम को वक्ता की पूरी बात खत्म होने से पहले आवाज शुरू करनी होती है। इसी वजह से Luna-TTS Realtime एक समझौता अपनाता है।
यह ब्लॉक्स के बीच क्रमिक रूप से आगे बढ़ता है, लेकिन हर ब्लॉक के भीतर Token को समानांतर रूप से डिनॉइज करता है। प्रत्येक ब्लॉक में 32 Codec फ्रेम होते हैं, जो 1.28 सेकंड के ऑडियो के बराबर हैं। KV Cache संदर्भ को संभालता है और पहला ब्लॉक तैयार होने के बाद आगे का ऑडियो धीरे-धीरे भेजा जाता है।1
इसलिए “Realtime पूरी तरह गैर-ऑटोरिग्रेसिव है” कहना सटीक नहीं होगा। ज्यादा सही व्याख्या यह है कि ब्लॉक-स्तर पर इसमें ऑटोरिग्रेसिव निर्भरता है, जबकि ब्लॉक के भीतर डिफ्यूजन-आधारित समानांतर जनरेशन होती है।
तकनीकी रिपोर्ट में डिस्क्रीट मास्क्ड-डिफ्यूजन प्रक्रिया के लिए अनुकूलित GRPO-आधारित रीइन्फोर्समेंट लर्निंग पोस्ट-ट्रेनिंग का भी उल्लेख है। इसमें भावनाओं और गैर-भाषाई ध्वनियों—जैसे हंसी, सांस या अन्य वोकल एक्सप्रेशन—पर नियंत्रण शामिल है।1
5
इस तरह की पोस्ट-ट्रेनिंग का उद्देश्य केवल शब्दों को समझने योग्य बनाना नहीं, बल्कि आवाज को ज्यादा स्वाभाविक, अभिव्यक्तिपूर्ण और उपयोगकर्ता की पसंद के अनुरूप बनाना भी है।
रिपोर्ट के अनुसार जीरो-शॉट वॉइस क्लोनिंग और स्पीच एडिटिंग को स्पीच Token ग्रिड में हिस्से भरने या फिर से लिखने वाले कार्य की तरह देखा जा सकता है।1
4 हालांकि अलग-अलग भाषाओं में क्लोनिंग की स्थिरता, संदर्भ ऑडियो की वास्तविक जरूरत और आउटपुट गुणवत्ता का फैसला मॉडल की वास्तुकला देखकर नहीं, बल्कि उत्पाद परीक्षण से ही किया जा सकता है।
Luna-TTS Realtime की तकनीकी रिपोर्ट में कुछ प्रभावशाली आंकड़े दिए गए हैं। वार्म किए गए स्थानीय सर्विंग परीक्षण में एंड-टू-एंड रियल-टाइम फैक्टर यानी RTF 0.024 बताया गया। सिस्टम ने पहला 1.28 सेकंड का डिकोडेड ऑडियो ब्लॉक 41.6 मिलीसेकंड में सबमिट किया।1
5
अन्य रिपोर्टों में Realtime संस्करण के लिए 8 से 16 डिनॉइजिंग स्टेप और दो H20 GPU पर परीक्षण का उल्लेख है।7
फिर भी 41.6 मिलीसेकंड को हर उपयोगकर्ता के क्लाउड API अनुभव के बराबर नहीं मानना चाहिए। यह एक नियंत्रित स्थानीय परीक्षण और मापे गए इंजन की सीमा के भीतर का आंकड़ा है। नेटवर्क, कतार, टेक्स्ट प्री-प्रोसेसिंग, ऑडियो डिकोडिंग और सर्वर पर वास्तविक लोड से उपयोगकर्ता को महसूस होने वाली देरी बढ़ सकती है। इसलिए इसे सार्वभौमिक API लेटेंसी का वादा नहीं, बल्कि नियंत्रित परिस्थितियों में पहले ऑडियो ब्लॉक के सबमिशन समय के रूप में समझना बेहतर है।
लेखकों के अनुसार Luna-TTS को चीनी, अंग्रेजी, जापानी और कोरियाई भाषाओं के लगभग 10 लाख घंटे के स्पीच डेटा पर प्री-ट्रेन किया गया है।1
2
इतना बड़ा बहुभाषी कॉर्पस उच्चारण, लय और अलग-अलग भाषाओं में आवाज के मॉडलिंग के लिए व्यापक प्रशिक्षण आधार दे सकता है। लेकिन सार्वजनिक सारांश डेटा के स्रोत, सफाई प्रक्रिया, भाषावार हिस्सेदारी और कॉपीराइट अनुपालन का स्वतंत्र आकलन करने के लिए पर्याप्त विवरण नहीं देते।
इसलिए “10 लाख घंटे का डेटा” एक रिपोर्टेड प्रशिक्षण-स्केल विवरण है। इससे यह निष्कर्ष नहीं निकाला जा सकता कि मॉडल हर भाषा, हर उच्चारण या हर उपयोग-स्थिति में समान रूप से सबसे बेहतर है।
सार्वजनिक रिपोर्टों से संकेत मिलता है कि VUI Labs Luna-TTS को केवल एक स्टैंडअलोन सिंथेसिस मॉडल के रूप में नहीं देखता। कंपनी मॉडल और API क्षमता के साथ क्रिएटर-फेसिंग वॉइस टूल और वॉइस-एजेंट एप्लिकेशन पर भी काम कर रही है।
इस रणनीति में मॉडल की गुणवत्ता पूरी कहानी नहीं है। व्यावसायिक सफलता के लिए वॉइस क्लोनिंग, भावनात्मक नियंत्रण, संवाद-प्रबंधन, कम लेटेंसी, इंफ्रास्ट्रक्चर लागत और उद्योगों के साथ एकीकरण भी उतने ही महत्वपूर्ण होंगे।
उद्योग रिपोर्टों में दावा किया गया है कि VUI Labs ने लॉजिस्टिक्स डिस्पैच, ऑनलाइन इंश्योरेंस और ट्रैवल-हॉस्पिटैलिटी SaaS जैसे क्षेत्रों में तैनाती की है और कई ग्राहकों के साथ कुल बिजनेस बातचीत की संख्या 10 लाख से अधिक रही है।6 हालांकि यह कंपनी या तैनाती पक्ष का मीडिया में रिपोर्ट किया गया दावा है, स्वतंत्र रूप से ऑडिट किया गया ग्राहक-मेट्रिक नहीं। सार्वजनिक जानकारी में ग्राहकों की पूरी सूची, बातचीत की परिभाषा, सक्रिय अवधि और प्रतिस्पर्धी तुलना की समान शर्तें भी स्पष्ट नहीं हैं।
कंपनी की शुरुआती नेतृत्व संरचना में अकादमिक तकनीकी नेतृत्व और उत्पाद-व्यावसायीकरण का संयोजन दिखाई देता है। च्येन यानमिन को वॉइस और AI शोध दिशा से जोड़ा जाता है, जबकि मेई जिए को सीरियल उद्यमी बताया गया है। यह ढांचा शोध-केंद्रित मॉडल को API, उद्योग समाधान और वॉइस-एजेंट उत्पादों में बदलने में मदद कर सकता है। इसकी दीर्घकालिक ताकत, हालांकि, डेटा फीडबैक लूप, ग्राहक बनाए रखने की क्षमता, प्रति-इन्फरेंस लागत और वैश्विक डिलीवरी पर निर्भर करेगी।
तकनीकी रिपोर्ट और उपलब्ध रैंकिंग को साथ देखने पर इसकी संभावित विश्वसनीय बढ़त चार क्षेत्रों में दिखती है:
यही बातें समझाती हैं कि Luna-TTS कुछ ब्लाइंड-लिसनिंग लीडरबोर्ड में तेजी से ऊपर क्यों पहुंचा। लेकिन इससे कीमत, लंबे टेक्स्ट की स्थिरता, आवाज की निरंतरता, कॉपीराइट सुरक्षा, API उपलब्धता या हर भाषा में बेहतर प्रदर्शन अपने-आप सिद्ध नहीं होता।
Luna-TTS की मूल तकनीकी कहानी विश्वसनीय और महत्वपूर्ण है। VUI Labs ने Qwen3 से विकसित भाषा मॉडल, डिस्क्रीट स्पीच Codec, मास्क्ड-डिफ्यूजन जनरेशन, रीइन्फोर्समेंट-लर्निंग पोस्ट-ट्रेनिंग और ब्लॉक-स्तरीय स्ट्रीमिंग को एक ही TTS सिस्टम में जोड़ा है।1
अगस्त 2026 की सार्वजनिक रिपोर्टों में यह Hugging Face TTS Arena में पहले और Artificial Analysis की同期 रिपोर्टिंग में तीसरे स्थान पर दिखाई दिया। लेकिन 1 सितंबर 2026 के Artificial Analysis स्नैपशॉट में यह पांचवें स्थान पर था।8
इसलिए सबसे सावधान निष्कर्ष यह है: Luna-TTS वैश्विक TTS प्रतिस्पर्धा का एक महत्वपूर्ण शीर्ष-स्तरीय मॉडल बन चुका है, लेकिन इसे स्थायी रूप से सभी प्रतिद्वंद्वियों को हराने वाला मॉडल कहना जल्दबाजी होगी। इसकी समानांतर डिफ्यूजन और रियल-टाइम ब्लॉक जनरेशन वाली दिशा आगे भी नजर रखने लायक है।
डेवलपर्स के लिए किसी एक कुल रैंकिंग पर निर्भर रहने के बजाय अपनी जरूरत के अनुसार परीक्षण करना बेहतर होगा—खासकर लक्षित भाषा, वॉइस क्लोनिंग, भावनात्मक नियंत्रण, पहला ऑडियो पैकेट, लंबे टेक्स्ट में आवाज की स्थिरता और वास्तविक API लागत पर।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Luna TTS, VUI Labs का बहुभाषी टेक्स्ट टू स्पीच मॉडल परिवार है। अगस्त 2026 में यह Hugging Face TTS Arena की रिपोर्टेड रैंकिंग में पहले स्थान पर रहा, लेकिन 1 सितंबर 2026 के Artificial Analysis स्नैपशॉट में पांचवें स्थान...
Luna TTS, VUI Labs का बहुभाषी टेक्स्ट टू स्पीच मॉडल परिवार है। अगस्त 2026 में यह Hugging Face TTS Arena की रिपोर्टेड रैंकिंग में पहले स्थान पर रहा, लेकिन 1 सितंबर 2026 के Artificial Analysis स्नैपशॉट में पांचवें स्थान... इसकी प्रमुख तकनीकी खासियत逐 Token ऑटोरिग्रेसिव जनरेशन के बजाय Qwen3 आधारित डिस्क्रीट मास्क्ड डिफ्यूजन है, जो एक साथ कई वॉइस Token को रिफाइन करता है। Realtime संस्करण 1.28 सेकंड के ब्लॉक्स में काम करता है और रिपोर्टेड स...
VUI Labs की स्थापना 2025 की शुरुआत में शंघाई जिआओतोंग यूनिवर्सिटी के प्रोफेसर च्येन यानमिन और सीरियल उद्यमी मेई जिए ने की थी। उपलब्ध स्रोत इसकी तकनीकी दिशा और शुरुआती रैंकिंग को समर्थन देते हैं, लेकिन यह साबित नहीं कर...