Gemini 3.8 Live को कम विलंबता, बड़े पैमाने और लागत कुशल वॉइस संवाद के लिए बनाया गया है, जबकि Extended Thinking जटिल, कई चरणों वाले कामों के दौरान बैकग्राउंड में तर्क कर सकता है। Google का मुख्य दावा यह है कि Extended Thinking टूल का परिणाम आने का इंतजार करते हुए चुप नहीं रहेगा: वह बोलता रहेगा, योजना बनाएगा और असिंक्...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google ने रियल-टाइम वॉइस एजेंट और लाइव संवाद के लिए दो नए native audio-to-audio मॉडल पेश किए हैं: Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking। सामान्य Live मॉडल का लक्ष्य बड़े पैमाने पर, कम लागत में स्वाभाविक बातचीत और विज़ुअल संदर्भ के साथ काम करना है। वहीं Extended Thinking को उन मुश्किल कामों के लिए रखा गया है जिनमें कई चरणों की योजना और गहरे तर्क की जरूरत हो। 10
2
Gemini 3.8 Live Extended Thinking की सबसे अहम क्षमता बैकग्राउंड रीजनिंग है। Google के अनुसार, यह मॉडल बोलते हुए भी पीछे से योजना बना सकता है और असिंक्रोनस टूल कॉल कर सकता है। यदि कोई टूल जवाब देने में कुछ सेकंड ले रहा हो, तो मॉडल पूरी बातचीत रोकने के बजाय स्वाभाविक संवादात्मक वाक्यों के जरिए इंटरैक्शन सक्रिय रख सकता है। 1
2
मतलब इसे केवल तेज जवाब देने वाला फीचर नहीं समझना चाहिए। Google के डिज़ाइन में बोलना, बैकग्राउंड में सोचना और टूल की गतिविधि एक साथ चल सकती है। उदाहरण के लिए, कोई वॉइस एजेंट अगला कदम समझाते हुए डेटा आने की प्रतीक्षा कर सकता है या कई चरणों वाली प्रक्रिया पूरी कर सकता है। हालांकि अंतिम अनुभव इस बात पर निर्भर करेगा कि टूल कितने भरोसेमंद हैं, एजेंट का संवाद कैसे डिज़ाइन किया गया है और बीच की बातचीत सिर्फ खाली समय भरने के बजाय सचमुच उपयोगी रहती है या नहीं। 1
2
Google ने Gemini 3.8 Live को ऐसे लाइव संवाद अनुभवों के लिए पेश किया है जहाँ कम विलंबता और अधिक उपयोग जरूरी हो। इसमें बातचीत की क्षमता के साथ visual grounding भी है—अर्थात एजेंट बातचीत के साथ मिले विज़ुअल संदर्भ का उपयोग कर सकता है। यह कैमरा या साझा स्क्रीन से आए दृश्य को समझकर उस पर बातचीत करने वाले उपयोग-मामलों के लिए उपयोगी हो सकता है। 10
45
Google के एक प्रतिनिधि ने कहा है कि यह मॉडल 97 भाषाओं का समर्थन करता है और बातचीत के दौरान भाषाएँ बदल सकता है। फिर भी डेवलपर्स को अपने इस्तेमाल के लिए भाषा की गुणवत्ता, अलग-अलग उच्चारणों पर प्रदर्शन और क्षेत्रीय उपलब्धता की जाँच करनी चाहिए। 16
Extended Thinking उन स्थितियों के लिए है जहाँ एजेंट को जटिल डेटा देखना, कई कदमों की योजना बनाना या ऐसे टूल इस्तेमाल करने हों जिनका परिणाम आने में समय लगता है। मॉडल का दावा है कि वह इस प्रक्रिया के दौरान लगातार ऑडियो उत्तर स्ट्रीम करता रह सकता है। 1
2
लॉन्च कवरेज में Speech-to-Speech Quality Index पर Gemini 3.8 Live का स्कोर 76.0 और Gemini 3.8 Live Extended Thinking का स्कोर 82.6 बताया गया। उसी तुलना में OpenAI के GPT-Live-1, medium effort सेटिंग के साथ, का स्कोर 81.5 बताया गया। 25
इस तुलना में Extended Thinking का रिपोर्टेड स्कोर सबसे अधिक है, लेकिन इसे हर उत्पादन-स्तरीय जरूरत के लिए निर्णायक जीत नहीं मानना चाहिए। किसी संपर्क-केंद्र, ग्राहक-सहायता बॉट या वॉइस असिस्टेंट में रुकावट के बीच संभलना, अलग उच्चारणों और भाषाओं की समझ, टूल कॉल की शुद्धता, भारी लोड में विलंबता, सुरक्षा और किसी काम को सफलतापूर्वक पूरा करने की कुल लागत भी उतनी ही महत्वपूर्ण हैं। ये आँकड़े एक मूल्यांकन संकेत हैं, स्वतंत्र रूप से ऑडिट किया गया सार्वभौमिक निष्कर्ष नहीं। 25
Google की आधिकारिक प्राइसिंग तालिका में दोनों नए मॉडल Live API के अंतर्गत हैं। पेड स्टैंडर्ड टियर पर ऑडियो इनपुट की कीमत $3.00 प्रति 10 लाख टोकन, या $0.005 प्रति मिनट है। ऑडियो आउटपुट के लिए कीमत $12.00 प्रति 10 लाख टोकन, या $0.018 प्रति मिनट है। टेक्स्ट इनपुट के लिए $0.75 प्रति 10 लाख टोकन और टेक्स्ट आउटपुट—जिसमें thinking tokens शामिल हैं—के लिए $4.50 प्रति 10 लाख टोकन सूचीबद्ध हैं। 37
यह अंतर महत्वपूर्ण है: Gemini 3.8 Flash की सामान्य टोकन दरों को Live मॉडल की दर नहीं मानना चाहिए। वॉइस एजेंट का वास्तविक खर्च इनपुट और आउटपुट ऑडियो, टेक्स्ट, विज़ुअल संदर्भ तथा जुड़े हुए टूल के मिश्रण पर निर्भर करेगा। इसलिए बजट तय करने से पहले मौजूदा Live API प्राइसिंग और वास्तविक सेशन का परीक्षण जरूरी है। 37
Google DeepMind दोनों मॉडलों को general availability में सूचीबद्ध करता है। प्रकाशित उपलब्धता तालिका के अनुसार दोनों मॉडल Gemini ऐप, Google AI Studio, Gemini API और Google Enterprise Agent Platform पर उपलब्ध हैं। Google Search Live में Extended Thinking सूचीबद्ध है, जबकि Google Workspace में Gemini 3.8 Live सूचीबद्ध है। 54
डेवलपर्स के लिए यह एक ही native audio-to-audio मॉडल परिवार के भीतर चुनाव है: सामान्य लाइव संवाद के लिए 3.8 Live या अधिक तर्क-आधारित कार्यों के लिए Extended Thinking। एंटरप्राइज़ टीमों को केवल मॉडल की उपलब्धता नहीं, बल्कि इस्तेमाल किए जाने वाले उत्पाद, डेटा नियंत्रण, भौगोलिक क्षेत्र और इंटीग्रेशन पथ की भी पुष्टि करनी चाहिए। 54
Google की प्रतिस्पर्धी पेशकश एक अधिक एकीकृत रियल-टाइम स्टैक की है: बोली गई बातचीत, विज़ुअल संदर्भ, बैकग्राउंड तर्क और असिंक्रोनस टूल एक ही मॉडल परिवार में। सिद्धांत रूप में, इससे speech recognition, टेक्स्ट मॉडल, टूल ऑर्केस्ट्रेशन और speech synthesis को अलग-अलग जोड़ने की जरूरत घट सकती है। साथ ही, पृष्ठभूमि में काम चलते हुए भी बातचीत की निरंतरता बनी रह सकती है। 1
10
OpenAI का GPT-Live-1 अब भी उन टीमों के लिए अहम तुलना बना रहेगा जो full-duplex बातचीत का आकलन कर रही हैं। लेकिन केवल एक बेंचमार्क के आधार पर प्लेटफॉर्म नहीं चुनना चाहिए। बेहतर मूल्यांकन में प्रतिनिधि कॉल चलाकर interruption handling, टूल-कॉल की सटीकता, बहुभाषी प्रदर्शन, सुरक्षा नियंत्रण, खराबी से उबरने की क्षमता, विलंबता और प्रति सफल कार्य की लागत मापनी चाहिए। 25
उपलब्ध लॉन्च सामग्री में Gemini 3.8 Live या Extended Thinking के लिए SynthID ऑडियो वॉटरमार्किंग की सटीक नीति स्थापित नहीं होती। Google ने Gemini ऐप और वेब अनुभव से बने टेक्स्ट की वॉटरमार्किंग और पहचान तक SynthID के विस्तार की बात कही है, लेकिन इससे यह प्रमाणित नहीं होता कि इन Live मॉडलों की हर ऑडियो स्ट्रीम पर वॉटरमार्क होगा या उसकी पहचान व रोलआउट की शर्तें क्या होंगी। 59
इसी तरह, इंटीग्रेशन और पार्टनर समर्थन से जुड़े दावे जल्दी बदल सकते हैं। किसी प्रोडक्शन आर्किटेक्चर पर निर्णय लेने से पहले टीमों को मॉडल दस्तावेज़, मौजूदा कीमत, प्लेटफॉर्म उपलब्धता और लागू सेवा शर्तों की ताज़ा जाँच करनी चाहिए। 37
54
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Gemini 3.8 Live को कम विलंबता, बड़े पैमाने और लागत कुशल वॉइस संवाद के लिए बनाया गया है, जबकि Extended Thinking जटिल, कई चरणों वाले कामों के दौरान बैकग्राउंड में तर्क कर सकता है।
Gemini 3.8 Live को कम विलंबता, बड़े पैमाने और लागत कुशल वॉइस संवाद के लिए बनाया गया है, जबकि Extended Thinking जटिल, कई चरणों वाले कामों के दौरान बैकग्राउंड में तर्क कर सकता है। Google का मुख्य दावा यह है कि Extended Thinking टूल का परिणाम आने का इंतजार करते हुए चुप नहीं रहेगा: वह बोलता रहेगा, योजना बनाएगा और असिंक्रोनस टूल कॉल को समानांतर रूप से संभालेगा।