Google ने 23 सितंबर 2026 को Gemini 3.8 Flash TTS और Gemini 3.8 Flash-Lite TTS पेश किए। TTS यानी टेक्स्ट-टू-स्पीच: लिखे हुए शब्दों से बोली गई ऑडियो तैयार करना। दोनों मॉडल इस काम के लिए हैं, लेकिन चुनाव इस बात पर निर्भर करता है कि आपको आवाज़ पर कितना रचनात्मक नियंत्रण चाहिए और कितनी मात्रा में ऑडियो बनाना है।
4
27
Flash या Flash-Lite: किस काम के लिए कौन-सा?
Flash TTS तब अधिक उपयुक्त है जब किसी किरदार की विशिष्ट आवाज़ या संवाद बोलने का खास अंदाज़ ज़रूरी हो। Google के मुताबिक, साधारण भाषा में किरदार की भूमिका, उच्चारण और आवाज़ की विशेषताएँ बताकर नई आवाज़ बनाई जा सकती है। स्क्रिप्ट के संवाद कैसे बोले जाएँ, इसके निर्देश भी दिए जा सकते हैं।
4
30
Flash-Lite TTS कम लागत पर बड़ी मात्रा में ऑडियो तैयार करने के लिए बनाया गया है—जैसे डबिंग, ऑडियो सामग्री और बोलकर जवाब देने वाले वॉइस एजेंट। इसका मतलब यह नहीं कि इसमें अभिव्यक्ति पर नियंत्रण नहीं है: Google इसके लिए भी लहजे और बोलने की गति तय करने की सुविधा बताता है।
27
30
कितनी आवाज़ें और भाषाएँ मिलती हैं?
Google ने 2,000 से अधिक तैयार आवाज़ों का विकल्प बताया है। नई आवाज़ बनाने के अलावा, बातचीत में वक्ताओं के बीच संवाद और हर पंक्ति के बोलने का ढंग निर्देशित किया जा सकता है—मसलन उसका लहजा, उच्चारण या गति।
4
28
29
Google के अनुसार, आवाज़ बनाने की सुविधा 100 से अधिक भाषाओं और बोलियों में है। तीसरे पक्ष की मॉडल सूचियों में Flash TTS के लिए 130 और Flash-Lite TTS के लिए 101 भाषाएँ दर्ज हैं। इन संख्याओं का अर्थ यह नहीं मानना चाहिए कि हर भाषा में हर आवाज़ और हर सुविधा एक जैसी उपलब्ध है।
27
17
18
नई आवाज़ बनाना और किसी व्यक्ति की आवाज़ की नकल करना अलग बातें हैं। नकल के लिए मौजूदा वक्ता की रिकॉर्डिंग इस्तेमाल होती है। लॉन्च से जुड़ी रिपोर्टों में लगभग 30 सेकंड के नमूने और आवाज़ के मालिक की सहमति जाँच का ज़िक्र है।
22
23
आवाज़ की नकल पर क्या सुरक्षा उपाय हैं?
Google का कहना है कि आवाज़ की नकल से पहले सहमति सत्यापित की जाती है। लॉन्च रिपोर्टों के अनुसार, तैयार ऑडियो में SynthID वॉटरमार्क जोड़ा जाता है और नकल की गई आवाज़ों के साथ C2PA प्रमाण-पत्र भी होते हैं। ये सुरक्षा उपाय हैं, हर संभावित दुरुपयोग रुक जाने की गारंटी नहीं।
23
34
भारतीय पाठकों के लिए उपलब्धता की एक अहम सीमा भी है: लॉन्च रिपोर्ट के मुताबिक, Google AI Studio में आवाज़ की नकल भारत में उपलब्ध नहीं है। इसे बाकी TTS सुविधाओं की उपलब्धता पर लागू प्रतिबंध नहीं समझना चाहिए।
19
प्रदर्शन के दावों को कैसे पढ़ें?
लॉन्च के समय बताए गए नतीजों में Flash TTS ने Hume AI के Voice Design Benchmark पर 71.4 अंक लेकर पहला स्थान पाया। एक अन्य रिपोर्ट में उच्चारण को मॉडल करने वाले परीक्षण के लिए 60.8 अंक दर्ज हैं। Google ने यह भी कहा कि Flash TTS और Flash-Lite TTS ने Hume AI के Overall Quality Index में शीर्ष दो स्थान हासिल किए। ये रिपोर्ट किए गए बेंचमार्क नतीजे हैं; किसी खास ऐप में प्रदर्शन की स्वतंत्र गारंटी नहीं।
19
21
इस्तेमाल कहाँ शुरू हुआ है?
Google के मुताबिक, 23 सितंबर से दोनों मॉडल Google AI Studio और Gemini API में रोलआउट होने लगे। Gemini API के रिलीज़ नोट्स TTS मॉडल और Voices endpoint को सामान्य उपलब्धता के तहत दर्ज करते हैं। उपभोक्ता उत्पादों में Google ने Gemini Notebook के लिए Flash TTS और Google Vids के लिए Flash-Lite TTS का नाम लिया; Gemini Enterprise के ज़रिये पहुँच को उसने ‘जल्द आने वाली’ बताया। किसी उत्पाद में मॉडल का पहुँचना यह साबित नहीं करता कि लॉन्च के दिन उसमें आवाज़ से जुड़ी हर सुविधा भी मौजूद थी।
29
32
शुरुआती इंटीग्रेशन की रिपोर्टों में Agora, LiveKit, Pipecat और Vercel जैसे प्लेटफ़ॉर्म तथा डबिंग, स्थानीयकरण या वॉइस एजेंट के उपयोग पर काम करने वाली Figma, HeyGen और Wondercraft जैसी कंपनियाँ शामिल हैं। ये उदाहरण डेवलपर रुचि दिखाते हैं, सभी इंटीग्रेशन में एक जैसी उपलब्धता नहीं।
37