أطلقت OpenAI نموذج GPT‑Live‑1 في واجهة API بتاريخ 10 سبتمبر 2026، بسعر 0.05 دولار للدقيقة لطبقة الصوت الأمامية. يستمع النموذج ويتحدث بالتزامن، ما يتيح التعامل بسلاسة أكبر مع المقاطعات والتردد والتأكيدات القصيرة والضوضاء الخلفية.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
أصبح GPT‑Live‑1 متاحاً للمطورين عبر واجهة برمجة التطبيقات (API) من OpenAI في 10 سبتمبر 2026. وهو نموذج صوتي «كامل الازدواج» (Full Duplex)، أي يستطيع الاستماع إلى المستخدم وإنتاج الكلام في الوقت نفسه، بدلاً من إدارة الحوار كدورات جامدة من «تحدث ثم انتظر الرد». وتبلغ كلفة طبقة الصوت الأمامية 0.05 دولار للدقيقة، فيما تُحتسب كلفة نموذج الاستدلال الخلفي والأدوات والبنية المتصلة به بصورة منفصلة. 3
5
تعتمد كثير من المساعدات الصوتية على سلسلة مراحل: تحويل الكلام إلى نص، ثم معالجة النص بواسطة نموذج لغوي، ثم تحويل الجواب النصي إلى كلام. يمكن لهذا الأسلوب أن ينجح، لكنه يفرض انتقالات بين مكونات متعددة، وعلى التطبيق أن ينسق بنفسه الصمت والتوقفات وتغيّر نية المتصل والمقاطعات. 3
أما GPT‑Live‑1 فيُقدَّم كنموذج صوتي واحد يتعامل مع الصوت الوارد والصادر. وعملياً، تسمح له بنيته كاملة الازدواج بمواصلة الاستماع أثناء التحدث. والهدف هو الاستجابة لمقاطعة المستخدم أو لعبارة تأكيد قصيرة من دون اعتبار كل صوت أو صمت أو حديث جانبي بدايةَ دورٍ جديد يجب الرد عليه. 3
المسألة، إذاً، لا تقتصر على سرعة توليد الصوت، بل تتعلق بإدارة إيقاع الحوار: هل ما زال المتحدث يفكر؟ هل يقاطع الإجابة؟ وهل كلمة مثل «نعم» مجرد إشارة متابعة أم طلب لسؤال جديد؟ تصف OpenAI النموذج بأنه خيارها الأبرز للمحادثات الصوتية الطبيعية والمعبرة، مع معالجة سلسة للمقاطعات. 2
3
لا يشترط GPT‑Live‑1 أن ينفذ منطق العمل كاملاً داخل النموذج الصوتي نفسه. إذ يمكنه الحفاظ على سير المحادثة الفورية، مع إحالة الاستدلال الأعمق أو استدعاء الأدوات أو تنفيذ الإجراءات إلى نموذج خلفي وإطار وكلاء يختارهما المطور. 3
ويعطي هذا الفصل فرق التطوير مرونة عملية، مثل:
بذلك يصبح النظام مكوّناً من جزأين: يدير GPT‑Live‑1 التفاعل الصوتي الحي، بينما يقدم النظام الخلفي الاستدلال وبيانات العمل وتنفيذ الإجراءات. لكن سعر الصوت المعلن ليس الكلفة الكلية للوكيل؛ إذ يمكن أن تضاف إليه كلفة الاستدلال الخلفي والأدوات وخدمات الاتصال الهاتفي وغيرها. 3
5
تقول OpenAI إن المطورين يستطيعون توجيه نبرة النموذج وسرعته وأسلوب المحادثة عبر تعليمات النظام (system prompt). ويوفر GPT‑Live‑1 أيضاً نصوصاً مفرغة من الصوت ونص الاستجابة، ويدعم فهم الرموز والحروف والأرقام، والتحيز للكلمات المفتاحية، فضلاً عن كشف الأدوار للمنتجات التي لا تزال بحاجة إلى حدود صريحة بين أدوار المتحدثين. 3
ويستهدف النموذج الجلسات الطويلة والوكلاء عبر الهاتف، مثل سيناريوهات خدمة العملاء والحجوزات. وتقول OpenAI إنه يستطيع التعامل مع الصمت والضوضاء الخلفية من دون وصف كل خطوة داخلية، وهي سمة مهمة للمكالمات الحقيقية والبيئات الأقل انضباطاً. 3
ولا تثبت المواد المتاحة قائمة نهائية باللغات المدعومة، أو أدوات تحكم تفصيلية بلهجات ونبرات محددة. لذلك ينبغي التحقق من وثائق API الأحدث قبل اعتماد هذه التفاصيل كمتطلبات للنشر.
أفادت OpenAI بأن GPT‑Live‑1 حقق تحسناً قدره 30 نقطة مئوية مقارنةً بـ GPT‑Realtime‑2.1 في اختبار Full Duplex Bench، وهو تقييم يركز على السلوك التفاعلي في المحادثات الصوتية، بما يشمل تبادل الأدوار والتوقفات والمقاطعات وإشارات المتابعة القصيرة والكلام في الخلفية. 3
وعند إقرانه بـ GPT‑6 Astra مع مستوى استدلال متوسط، قالت OpenAI إن GPT‑Live‑1 احتل المركز الأول في Tau3، وهو معيار شامل لوكلاء الصوت. ويتضمن جزء خدمة العملاء فيه مهام منطوقة ضمن قطاعات الطيران والتجزئة والاتصالات. 3
تورد بعض التقارير الثانوية أرقاماً دقيقة لزمن تبادل الأدوار ودرجات Tau3، لكن المادة الأولية المتاحة هنا لا تعرض تلك القيم التفصيلية. والخلاصة الأكثر تحفظاً هي أن OpenAI تعلن مكاسب كبيرة في السلوك التفاعلي وصدارة في Tau3 لتكوين GPT‑Live‑1 مع Astra، لا أن كل تطبيق سيعيد بالضرورة إنتاج رقم معياري بعينه. 3
7
تسلط OpenAI الضوء على عدة تطبيقات مبكرة لوكلاء صوتيين:
توضح هذه الأمثلة متى تكون ميزة الازدواج الكامل مهمة: عندما يتردد المتصل، أو يصحح نفسه، أو يؤكد ما سمعه أثناء الجواب، أو يقاطع الوكيل من دون أن يرغب في إعادة المحادثة من بدايتها.
سعر GPT‑Live‑1 هو 0.05 دولار للدقيقة لطبقة الصوت الأمامية. ويمكن للمطورين إقرانه بنموذج خلفي وإطار وكلاء من اختيارهم، لكن هذه الاختيارات تؤثر في كلفة التشغيل الإجمالية لأنها تُحاسب بشكل منفصل عن طبقة الصوت. 3
5
وتذكر OpenAI كذلك OpenAI Presence كطريقة أخرى لبناء تدفقات عمل صوتية تعتمد على GPT‑Live‑1 للتفاعل الصوتي الفوري. غير أن المواد المتاحة لا تحدد أهلية المؤسسات، أو الشروط التجارية، أو نموذج الاستضافة، أو آلية الوصول إلى Presence؛ لذلك لا ينبغي افتراض هذه التفاصيل اعتماداً على إعلان API وحده. 3
وللفرق التي تقيّم النموذج، فإن السؤال الأهم يتجاوز سعر الدقيقة: ما مقدار القيمة التي تضيفها سلاسة تبادل الأدوار إلى سير العمل، وما النموذج الخلفي ومسار الأدوات القادران على تقديم الموثوقية المطلوبة ضمن كلفة إجمالية مقبولة؟
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أطلقت OpenAI نموذج GPT‑Live‑1 في واجهة API بتاريخ 10 سبتمبر 2026، بسعر 0.05 دولار للدقيقة لطبقة الصوت الأمامية.
أطلقت OpenAI نموذج GPT‑Live‑1 في واجهة API بتاريخ 10 سبتمبر 2026، بسعر 0.05 دولار للدقيقة لطبقة الصوت الأمامية. يستمع النموذج ويتحدث بالتزامن، ما يتيح التعامل بسلاسة أكبر مع المقاطعات والتردد والتأكيدات القصيرة والضوضاء الخلفية.
تُفصل المحادثة الصوتية عن الاستدلال والأدوات: يمكن اختيار نموذج خلفي منخفض الكلفة للمهام الروتينية أو GPT‑6 Astra للطلبات الأعقد.