أصبحت GPT‑Live‑1 متاحة بشكل عام عبر واجهة API في 10 سبتمبر 2026، وتستطيع الإصغاء والتحدث بالتزامن ضمن محادثات صوتية ثنائية الاتجاه بالكامل. يمكن للنموذج الصوتي إدارة إيقاع الحوار والمقاطعات، بينما يتولى نموذج أو وكيل خلفي مهام الاستدلال المعقدة واستدعاء الأدوات.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT-Live-1 full-duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11. It introduced GPT‑Live‑1 as a generally available, full‑duplex voice layer: a model intended to make voice agents more natural by listening and spe. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
أعلنت أوبن إيه آي الإتاحة العامة لنموذج GPT‑Live‑1 ضمن واجهة البرمجة API في 10 سبتمبر 2026، وليس 11 سبتمبر. ويمنح هذا المطورين طبقة صوتية لبناء وكلاء قادرين على الإصغاء والتحدث في آن واحد، بدلاً من جعل الحوار سلسلة من الأدوار المنفصلة والجامدة. 1
16
تُبنى أنظمة الوكلاء الصوتيين التقليدية غالباً من سلسلة مراحل: تحويل الكلام إلى نص، ثم توليد الرد عبر نموذج لغوي، ثم تحويل النص إلى كلام. أما GPT‑Live‑1 فيُقدَّم كطبقة صوتية موحدة للجزء الفوري من المحادثة. 1
الفارق العملي يتعلق بتبادل الأدوار في الحديث. تقول أوبن إيه آي إن النموذج يستطيع الإصغاء والتحدث بالتزامن، ومتابعة التوقفات وتغيّر سرعة الكلام، وتحديد ما إذا كان ينبغي أن يرد أو يواصل الاستماع. والهدف هو أن تبدو المقاطعات وإشارات المتابعة القصيرة، مثل «نعم» و«حسناً»، جزءاً طبيعياً من الحديث لا أخطاء في النظام. 1
9
15
ولا يتعين على النموذج الصوتي إنجاز كل مهمة بنفسه؛ إذ يمكن للمحادثة عبر GPT‑Live‑1 أن تستمر بينما ينفذ نموذج أو وكيل خلفي استدلالاً أعمق أو يستخدم أدوات. وتدعم أوبن إيه آي تفويض Responses إلى نموذج من نماذجها، أو التفويض من جانب العميل لربط النظام الخلفي الخاص بالمطور. 1
16
تعمل GPT‑Live‑1 كواجهة المحادثة الصوتية المباشرة، في حين يمكن أن يتولى النظام الخلفي مهام مثل الاستدلال الأكثر تعقيداً، واسترجاع المعلومات، وتنفيذ سير العمل، أو استدعاء الأدوات. وتشير ملاحظات أوبن إيه آي إلى GPT‑6 Astra كخيار للبحث والاستدلال في الأسئلة الأصعب، كما يستطيع مطورو API ربط أنظمتهم الخلفية عبر تفويض العميل. 4
16
عملياً، يعني ذلك أن تكلفة الوكيل وسلوكه لا يحددهما نموذج الصوت وحده:
كما سلطت أوبن إيه آي الضوء على تحسن اتباع التعليمات، والأصوات المخصصة، ودعم الاتصال الهاتفي في هذا الإصدار. 13
تبلغ تكلفة جلسات GPT‑Live‑1 الصوتية 0.05 دولار للدقيقة. ويجري الاحتساب بالثانية، من دون تقريب المدة إلى الدقيقة الكاملة التالية. 16
18
لكن هذا السعر خاص بجلسة الصوت، وليس بالضرورة تكلفة الوكيل الصوتي كاملة. فاستخدام النموذج الخلفي والأدوات يُحاسب عليه بشكل منفصل؛ لذلك يجب أن تشمل ميزانية التشغيل مدة المحادثة والعمل الذي يُفوَّض إلى ما وراء طبقة الصوت. 16
18
ذكرت أوبن إيه آي أن GPT‑Live‑1 حققت تحسناً قدره 30 نقطة مئوية في معيارها Full Duplex Bench مقارنةً بـGPT‑Realtime‑2.1، وأن GPT‑Live‑1 عند إقرانها بـGPT‑6 Astra مع جهد استدلال متوسط احتلت المرتبة الأولى في Tau3. 1
لكن المواد المصدرية المتاحة لا تقدم توثيقاً مستقلاً للأرقام المحددة المتداولة حول زمن تبديل الدور في الحديث أو المقارنة الدقيقة لنسب اجتياز Tau3. لذلك لا ينبغي التعامل مع تلك الأرقام التفصيلية بوصفها مؤكدة هنا.
عرضت أوبن إيه آي عدداً من التطبيقات التشغيلية المبكرة بوصفها أمثلة على فائدة تبادل الأدوار الأكثر طبيعية:
وهذه نتائج أبلغت عنها الشركات نفسها، وليست تقييماً مستقلاً أو ضماناً بأن النتائج ستتكرر في كل تطبيق.
لا تثبت المصادر المتاحة ادعاءات الوصول المؤسسي عبر منتج مُدار يسمى «Presence»، كما لا تؤكد توسعاً محدداً في اللكنات أو اللهجات أو اللغات بمناسبة إطلاق API هذا. وينبغي التحقق من هذه التفاصيل مباشرة في وثائق أوبن إيه آي الحالية قبل اتخاذ قرارات شراء أو تنفيذ.
أهم ما يقدمه GPT‑Live‑1 هو تغيير معماري: طبقة محادثة صوتية ثنائية الاتجاه بالكامل عبر API، تسمح للوكيل بأن يستمع ويتحدث بصورة أكثر سلاسة، بينما يتولى نظام آخر الاستدلال الأبطأ أو استدعاء الأدوات. وسعر 0.05 دولار للدقيقة، مع احتساب بالثانية، يجعل كلفة وقت الصوت واضحة؛ لكن الكلفة النهائية تظل مرتبطة بالنموذج الخلفي والأدوات المختارة. 1
16
18
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أصبحت GPT‑Live‑1 متاحة بشكل عام عبر واجهة API في 10 سبتمبر 2026، وتستطيع الإصغاء والتحدث بالتزامن ضمن محادثات صوتية ثنائية الاتجاه بالكامل.
أصبحت GPT‑Live‑1 متاحة بشكل عام عبر واجهة API في 10 سبتمبر 2026، وتستطيع الإصغاء والتحدث بالتزامن ضمن محادثات صوتية ثنائية الاتجاه بالكامل. يمكن للنموذج الصوتي إدارة إيقاع الحوار والمقاطعات، بينما يتولى نموذج أو وكيل خلفي مهام الاستدلال المعقدة واستدعاء الأدوات.
سعر جلسة الصوت 0.05 دولار للدقيقة مع احتساب بالثانية، لكن تكلفة النموذج الخلفي والأدوات تُضاف بصورة منفصلة.