GPT Live 1, OpenAI का डेवलपर केंद्रित फुल डुप्लेक्स वॉइस मॉडल है, जो 10 सितंबर 2026 से API में फ्रंट एंड वॉइस लेयर के लिए $0.05 प्रति मिनट पर उपलब्ध है। मॉडल बोलते समय भी सुन सकता है, इसलिए रुकावट, छोटे ‘हां’ जैसे संकेत, चुप्पी और बैकग्राउंड आवाज़ को संभालने का लक्ष्य रखता है। OpenAI के अनुसार, इसने Full Duplex Benc...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
OpenAI का GPT-Live-1 डेवलपर्स के लिए बनाया गया वॉइस मॉडल है, जिसका उद्देश्य बातचीत को रिकॉर्ड किए गए सवाल-जवाबों की कतार जैसा नहीं, बल्कि आमने-सामने की लाइव बातचीत जैसा बनाना है। यह 10 सितंबर 2026 से API में उपलब्ध है और इसकी फ्रंट-एंड वॉइस लेयर की कीमत $0.05 प्रति मिनट है। हालांकि, इसके पीछे जो रीजनिंग मॉडल, टूल्स या अन्य सेवाएं जोड़ी जाएंगी, उनका शुल्क अलग होगा। 3
5
पारंपरिक वॉइस एजेंट आम तौर पर तीन चरणों में काम करते हैं: पहले स्पीच-टू-टेक्स्ट आवाज़ को लिखित टेक्स्ट में बदलता है, फिर भाषा मॉडल जवाब तैयार करता है, और अंत में टेक्स्ट-टू-स्पीच उसे आवाज़ में सुनाता है। यह तरीका उपयोगी है, लेकिन हर चरण के बीच तालमेल बैठाना पड़ता है—मसलन, उपयोगकर्ता के रुकने, बीच में बोल पड़ने या बात बदलने को कैसे समझा जाए। 3
GPT-Live-1 को एक ऐसे एकीकृत वॉइस मॉडल के रूप में पेश किया गया है जो आने वाली और बाहर जाने वाली ऑडियो के साथ काम करता है। इसका फुल-डुप्लेक्स डिज़ाइन इसे बोलते हुए भी सुनते रहने देता है। उद्देश्य यह है कि किसी रुकावट, संक्षिप्त सहमति—जैसे “हां”—या पास की बातचीत को हर बार नया प्रश्न मानकर एजेंट अपनी बात रोक न दे। 3
असल बात केवल तेज़ आवाज़ पैदा करने की नहीं है। यह बातचीत का संदर्भ और लय समझने की कोशिश है: सामने वाला अभी सोच रहा है, बीच में सुधार कर रहा है, या सिर्फ यह संकेत दे रहा है कि वह सुन रहा है। OpenAI इसे स्वाभाविक और अभिव्यक्तिपूर्ण वॉइस बातचीत के लिए अपना प्रमुख मॉडल बताता है, जिसमें रुकावटों को सहजता से संभालने पर जोर है। 2
3
GPT-Live-1 को हर बिज़नेस निर्णय या जटिल तर्क खुद ही नहीं करना पड़ता। यह लाइव वॉइस संवाद संभालते हुए गहरे रीजनिंग कार्य, टूल कॉल या कार्रवाइयों को चुने गए अलग बैकएंड मॉडल और एजेंट फ्रेमवर्क को सौंप सकता है। 3
इससे डेवलपर्स के पास एक व्यावहारिक विकल्प बनता है:
यानी सिस्टम के दो हिस्से हैं: GPT-Live-1 लाइव बातचीत की आवाज़ और टाइमिंग संभालता है, जबकि बैकएंड रीजनिंग, बिज़नेस डेटा और कार्रवाइयां देता है। इसलिए $0.05 प्रति मिनट को किसी पूरे वॉइस एजेंट की अंतिम लागत नहीं समझना चाहिए; बैकएंड इन्फरेंस, टूल्स, फोन सेवा और दूसरे खर्च इसमें जुड़ सकते हैं। 3
5
OpenAI के अनुसार, डेवलपर्स सिस्टम प्रॉम्प्ट के जरिए मॉडल के लहजे, बोलने की गति और बातचीत की शैली को दिशा दे सकते हैं। GPT-Live-1 ट्रांसक्रिप्ट और उत्तर का टेक्स्ट भी देता है, अक्षर-अंकीय जानकारी समझ सकता है, कीवर्ड बायसिंग का समर्थन करता है और उन उत्पादों के लिए टर्न डिटेक्शन उपलब्ध कराता है जिन्हें स्पष्ट बोलने की बारी चाहिए। 3
मॉडल को लंबे सत्रों और फोन-आधारित एजेंटों के लिए लक्षित किया गया है—जैसे ग्राहक सहायता या रिज़र्वेशन वर्कफ़्लो। OpenAI का कहना है कि यह चुप्पी और बैकग्राउंड शोर के बीच भी हर आंतरिक प्रक्रिया को बोलकर सुनाने के बजाय बातचीत को स्वाभाविक ढंग से आगे बढ़ा सकता है। 3
उपलब्ध दस्तावेज़ों में समर्थित भाषाओं की कोई निर्णायक सूची या किसी खास उच्चारण और बोली के लिए विस्तृत डेवलपर नियंत्रण स्थापित नहीं किया गया है। इसलिए प्रोडक्शन में उपयोग से पहले मौजूदा API दस्तावेज़ों में इन विवरणों की पुष्टि करनी चाहिए।
OpenAI का कहना है कि GPT-Live-1 ने Full Duplex Bench में GPT-Realtime-2.1 की तुलना में 30 प्रतिशत अंक बेहतर प्रदर्शन किया। यह मूल्यांकन बोलने की बारी, ठहराव, रुकावट, छोटे प्रतिक्रिया-संकेत और बैकग्राउंड स्पीच जैसे इंटरैक्टिव वॉइस व्यवहारों पर केंद्रित है। 3
कंपनी के मुताबिक, मध्यम रीजनिंग प्रयास पर GPT-6 Astra के साथ जोड़े जाने पर GPT-Live-1 ने Tau3 में पहला स्थान हासिल किया। Tau3 एक एंड-टू-एंड वॉइस-एजेंट बेंचमार्क है; इसके कस्टमर-सर्विस हिस्से में एयरलाइन, रिटेल और टेलीकॉम संदर्भों के बोले गए कार्य शामिल हैं। 3
कुछ द्वितीयक रिपोर्टों में टर्न-टेकिंग लेटेंसी और Tau3 स्कोर के सटीक आंकड़े दिए गए हैं, लेकिन उपलब्ध प्राथमिक-स्रोत सामग्री में ये विशिष्ट संख्याएं नहीं हैं। इसलिए अधिक सावधान निष्कर्ष यही है कि OpenAI ने इंटरैक्टिव वॉइस व्यवहार में बड़ी बढ़त और Astra के साथ Tau3 में शीर्ष स्थान की रिपोर्ट की है; हर तैनाती में वही नतीजे मिलेंगे, यह तय नहीं है। 3
7
OpenAI ने कुछ शुरुआती तैनातियों का उल्लेख किया है:
इन उदाहरणों से स्पष्ट है कि फुल-डुप्लेक्स डिज़ाइन उन परिस्थितियों में अधिक उपयोगी हो सकता है जहां कॉलर हिचकिचाए, अपनी बात सुधारे, एजेंट की बात के बीच छोटी सहमति दे या बातचीत दोबारा शुरू किए बिना बीच में बोलना चाहे।
GPT-Live-1 की फ्रंट-एंड वॉइस लेयर के लिए दर $0.05 प्रति मिनट है। डेवलपर्स इसे अपनी पसंद के बैकएंड मॉडल और एजेंट फ्रेमवर्क के साथ जोड़ सकते हैं, लेकिन वही विकल्प कुल परिचालन लागत तय करेंगे क्योंकि उनका बिल वॉइस लेयर से अलग है। 3
5
OpenAI ने OpenAI Presence को भी GPT-Live-1 पर वॉइस वर्कफ़्लो बनाने का एक अन्य तरीका बताया है, जहां मॉडल रियल-टाइम वॉइस इंटरैक्शन को शक्ति देता है। मगर उपलब्ध सामग्री Presence की एंटरप्राइज़ पात्रता, व्यावसायिक शर्तों, होस्टिंग मॉडल या एक्सेस प्रक्रिया को स्पष्ट नहीं करती। इसलिए इन बातों को केवल API घोषणा के आधार पर मान लेना उचित नहीं होगा। 3
किसी टीम के लिए मुख्य सवाल केवल प्रति-मिनट कीमत नहीं है: बेहतर टर्न-टेकिंग से उस वर्कफ़्लो में कितना वास्तविक लाभ होगा, और भरोसेमंद नतीजों के लिए कौन-सा बैकएंड मॉडल व टूल-पथ स्वीकार्य कुल लागत में काम करेगा?
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
GPT Live 1, OpenAI का डेवलपर केंद्रित फुल डुप्लेक्स वॉइस मॉडल है, जो 10 सितंबर 2026 से API में फ्रंट एंड वॉइस लेयर के लिए $0.05 प्रति मिनट पर उपलब्ध है।
GPT Live 1, OpenAI का डेवलपर केंद्रित फुल डुप्लेक्स वॉइस मॉडल है, जो 10 सितंबर 2026 से API में फ्रंट एंड वॉइस लेयर के लिए $0.05 प्रति मिनट पर उपलब्ध है। मॉडल बोलते समय भी सुन सकता है, इसलिए रुकावट, छोटे ‘हां’ जैसे संकेत, चुप्पी और बैकग्राउंड आवाज़ को संभालने का लक्ष्य रखता है।
OpenAI के अनुसार, इसने Full Duplex Bench में GPT Realtime 2.1 पर 30 प्रतिशत अंक की बढ़त दर्ज की; GPT 6 Astra के साथ Tau3 में इसे पहला स्थान मिला।