घोषणा 11 सितंबर नहीं, 10 सितंबर 2026 को हुई थी। [3] GPT‑Live‑1 एक फुल डुप्लेक्स वॉइस मॉडल है, जो एजेंट को एक ही समय में सुनने और बोलने देता है। [3] यह पारंपरिक स्पीच टू टेक्स्ट, भाषा मॉडल और टेक्स्ट टू स्पीच की अलग अलग श्रृंखला को एकीकृत वॉइस मॉडल से बदलता है। [3]
प्रकाशितकर्ताGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT Live 1 full duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11.. Topic tags: general web, openai, chatgpt, prompt engineering, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidenc
OpenAI की API संबंधी घोषणा 11 सितंबर नहीं, 10 सितंबर 2026 की है। कंपनी ने GPT‑Live‑1 को API में उपलब्ध कराया—एक ऐसा फुल-डुप्लेक्स वॉइस मॉडल जो वॉइस एजेंट को बारी-बारी से होने वाले कठोर संवाद के बजाय अधिक स्वाभाविक बातचीत के लिए बनाया गया है। 3
आमतौर पर वॉइस एजेंट तीन अलग चरणों से काम करते हैं: पहले आवाज को टेक्स्ट में बदला जाता है (speech-to-text), फिर भाषा/रीज़निंग मॉडल जवाब तैयार करता है, और अंत में उस टेक्स्ट को आवाज में बदला जाता है (text-to-speech)। हर चरण के बीच होने वाला हस्तांतरण देरी बढ़ा सकता है और बोलने की लय, समय-संकेत तथा बातचीत का संदर्भ कमजोर कर सकता है।
GPT‑Live‑1 सुनने और बोलने को एक ही वॉइस मॉडल में जोड़ता है। इसलिए यह एक साथ सुन और बोल सकता है, बीच में टोके जाने या छोटे-छोटे प्रत्युत्तर—जैसे “हां” या “ठीक है”—पर उसी समय प्रतिक्रिया दे सकता है। जटिल रीजनिंग या टूल इस्तेमाल करने जैसे काम, इसके साथ जुड़ा बैकएंड मॉडल पृष्ठभूमि में संभाल सकता है। 3
डेवलपर गहरे रीजनिंग और कार्रवाई के लिए OpenAI के GPT‑6 Astra जैसे बैकएंड मॉडल या किसी तीसरे पक्ष के मॉडल को चुन सकते हैं। इससे वे अपने उपयोग-मामले के अनुसार गति, रीजनिंग क्षमता और लागत का संतुलन तय कर सकते हैं। 3
OpenAI ने सिस्टम प्रॉम्प्ट के जरिए बोलने के लहजे, गति और बातचीत की शैली पर नियंत्रण का भी उल्लेख किया है। अन्य क्षमताओं में टेलीफोनी पर तैनाती, बैकग्राउंड शोर और खामोशी को संभालना, लंबे सेशन में विश्वसनीयता, ट्रांसक्रिप्ट/रिस्पॉन्स टेक्स्ट, अल्फ़ान्यूमेरिक पहचान और कीवर्ड बायसिंग शामिल हैं। 3
पारंपरिक सिस्टम में एजेंट को अक्सर उपयोगकर्ता के बोलना खत्म करने का इंतजार करना पड़ता है। फिर ऑडियो को टेक्स्ट में बदलने, जवाब तैयार करने और जवाब को आवाज में बदलने के चरण चलते हैं। GPT‑Live‑1 का उद्देश्य इन अलग-अलग परतों के कारण आने वाली रुकावट को घटाना है।
व्यावहारिक रूप से इसका अर्थ है कि कॉल-बेस्ड ग्राहक सेवा, बुकिंग, भाषा-अभ्यास या अन्य बातचीत वाले उत्पादों में एजेंट किसी इंसान की तरह बातचीत की धारा के साथ चल सके—मिसाल के लिए, उपयोगकर्ता के बीच में बोलने पर अपनी प्रतिक्रिया बदल सके। 3
GPT‑Live‑1 के वॉइस सेशन की कीमत 0.05 डॉलर प्रति मिनट है। बिलिंग पूरे मिनट तक राउंड-अप करने के बजाय प्रति सेकंड होती है। 2
हालांकि 0.05 डॉलर प्रति मिनट केवल वॉइस लेयर का शुल्क है। चुने गए बैकएंड मॉडल तथा टूल के उपयोग का शुल्क अलग से लगेगा। इसलिए कुल लागत वॉइस सेशन के साथ इस्तेमाल किए गए रीजनिंग मॉडल और टूल पर निर्भर करेगी। 2
दिए गए स्रोत कथित प्रबंधित “Presence” एंटरप्राइज एक्सेस या उच्चारणों, बोलियों और भाषाओं के विस्तार संबंधी विशेष दावों की पुष्टि नहीं करते।
OpenAI के अनुसार, GPT‑Live‑1 ने GPT‑Realtime‑2.1 की तुलना में Full Duplex Bench पर 30 प्रतिशत अंक का सुधार दर्ज किया। कंपनी ने यह भी कहा कि GPT‑Live‑1 को GPT‑6 Astra के साथ मध्यम रीजनिंग प्रयास पर जोड़ने से Tau3 में पहला स्थान मिला। 3
हालांकि उपलब्ध साक्ष्य 1.41 बनाम 0.798 सेकंड की लेटेंसी या Tau3 के 86.2% बनाम 45.7% पास-रेट जैसे सटीक आंकड़ों को स्वतंत्र रूप से नहीं दिखाते; इसलिए इन संख्याओं को यहां सत्यापित नहीं माना जा सकता।
शुरुआती उपयोगकर्ताओं के बारे में OpenAI ने कहा:
कुल मिलाकर, GPT‑Live‑1 का मुख्य दावा केवल आवाज को टेक्स्ट और फिर आवाज में बदलना नहीं, बल्कि बातचीत के दौरान सुनने, बोलने और बीच में होने वाले बदलावों पर तुरंत प्रतिक्रिया देने की क्षमता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
घोषणा 11 सितंबर नहीं, 10 सितंबर 2026 को हुई थी। [3]
घोषणा 11 सितंबर नहीं, 10 सितंबर 2026 को हुई थी। [3] GPT‑Live‑1 एक फुल डुप्लेक्स वॉइस मॉडल है, जो एजेंट को एक ही समय में सुनने और बोलने देता है। [3]
यह पारंपरिक स्पीच टू टेक्स्ट, भाषा मॉडल और टेक्स्ट टू स्पीच की अलग अलग श्रृंखला को एकीकृत वॉइस मॉडल से बदलता है। [3]