تطرح جوجل Gemini 3.8 Live للمحادثات الصوتية واسعة النطاق والكفاءة في التكلفة، بينما يستهدف Extended Thinking المهام المركبة متعددة الخطوات مع التفكير في الخلفية. الفكرة العملية ليست مجرد ردود أسرع: يستطيع نموذج Extended Thinking مواصلة الحديث أثناء التخطيط وانتظار الأدوات غير المتزامنة ومعالجة نتائجها.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
أعلنت جوجل عن Gemini 3.8 Live وGemini 3.8 Live Extended Thinking، وهما نموذجان أصليان لتحويل الصوت إلى صوت، صُمما للوكلاء الصوتيين والمحادثات الحية في الزمن الفعلي. النموذج القياسي موجه للتوسع والكفاءة في التكلفة والحوار السلس والاستناد إلى السياق البصري، فيما يستهدف إصدار Extended Thinking المهام الأصعب التي تتطلب استدلالاً متعدد الخطوات في الخلفية. 10
2
الميزة الفاصلة تخص Gemini 3.8 Live Extended Thinking. تقول جوجل إن النموذج يستطيع التخطيط والاستدلال في الخلفية، واستدعاء أدوات غير متزامنة، بالتوازي مع بث استجابة صوتية مستمرة. وعندما يستغرق تنفيذ أداة وقتاً أطول، يمكنه استخدام عبارات حوارية طبيعية للحفاظ على تفاعل المستخدم بدلاً من تعليق المحادثة بالكامل حتى وصول النتيجة. 1
2
بمعنى آخر، لا يقتصر ادعاء «الاستدلال المتزامن» على تقليل زمن الانتظار بين سؤال وجواب. وفق تصميم جوجل، يمكن أن يعمل توليد الكلام والتخطيط الخلفي ونشاط الأدوات غير المتزامن معاً. وقد يتيح ذلك للوكيل مثلاً شرح الخطوة التالية للمستخدم بينما ينتظر بيانات أو يعالج مسار عمل متعدد المراحل. لكن جودة التجربة الفعلية ستعتمد على موثوقية الأدوات، وتصميم الحوار، وما إذا كان الكلام المرافق مفيداً بالفعل لا مجرد ملء للصمت. 1
2
تضع جوجل Gemini 3.8 Live باعتباره الخيار المناسب لتجارب المحادثة ذات حجم الاستخدام الكبير وزمن الاستجابة المنخفض، من دون تأخيرات ناتجة من الاستدلال. ويجمع بين الحوار الحي وفهم السياق البصري، بما يسمح للوكيل بالاستناد إلى ما يراه، إلى جانب محتوى المحادثة. 10
45
كما ذكر ممثلون عن جوجل أن النموذج يدعم 97 لغة مع القدرة على التبديل بين اللغات أثناء المحادثة. وينبغي للمطورين اختبار جودة كل لغة، والتوافر حسب المنطقة، والأداء مع اللهجات وحالات الاستخدام المستهدفة قبل الإطلاق. 16
أفادت تغطية الإطلاق بنتائج Speech-to-Speech Quality Index بلغت 76.0 لـGemini 3.8 Live و82.6 لـGemini 3.8 Live Extended Thinking، مقابل 81.5 لنموذج OpenAI GPT-Live-1 عند مستوى جهد متوسط. 25
تجعل هذه الأرقام إصدار Extended Thinking الأعلى في هذه المقارنة المنشورة، لكنها لا تمثل تقييماً مستقلاً وشاملاً لجودة التشغيل الفعلية. فالوكيل الصوتي في بيئة الإنتاج يجب أن يتعامل أيضاً مع المقاطعات، والكلام متعدد اللغات واللهجات، ودقة استخدام الأدوات، وزمن الاستجابة تحت الضغط، والسلامة، وإمكانية المراقبة، والتكلفة الإجمالية لكل مهمة تُنجز بنجاح. لذا تُعد هذه النتائج إشارة واحدة للتقييم، وليست دليلاً على تفوق نظام واحد في كل سيناريو لمراكز الاتصال أو المساعدات الرقمية. 25
يضع جدول التسعير الرسمي من جوجل النموذجين ضمن Live API. وفي الشريحة القياسية المدفوعة، تبلغ كلفة إدخال الصوت 3.00 دولارات لكل مليون رمز، أو 0.005 دولار للدقيقة، بينما تبلغ كلفة إخراج الصوت 12.00 دولاراً لكل مليون رمز، أو 0.018 دولار للدقيقة. أما إدخال النص فسعره 0.75 دولار لكل مليون رمز، وإخراج النص — بما فيه رموز التفكير — فسعره 4.50 دولارات لكل مليون رمز. 37
وهذا التفريق مهم: فأسعار الرموز المتداولة لنموذج Gemini 3.8 Flash لا تنطبق تلقائياً على نماذج Live. ولإعداد الميزانية، ينبغي الرجوع إلى جدول Live API ووثائق النموذج المحدثة، ثم اختبار جلسات حقيقية؛ إذ تتأثر تكلفة الوكيل الصوتي بمزيج الصوت الوارد والصوت الصادر والسياق البصري والنص وأي أدوات مرتبطة به. 37
تدرج Google DeepMind النموذجين ضمن حالة التوافر العام. وتشمل قائمة التوافر المنشورة تطبيق Gemini وGoogle AI Studio وGemini API ومنصة Google Enterprise Agent Platform لكلا النموذجين. كما تُدرج Google Search Live لإصدار Extended Thinking، وGoogle Workspace لنموذج Gemini 3.8 Live. 54
بالنسبة إلى المطورين، يوفر ذلك خياراً بين نموذج للحوار الحي القياسي وآخر بقدرة استدلال أعلى ضمن عائلة الصوت-إلى-الصوت نفسها. أما المؤسسات، فلا يكفي أن تسأل عن النموذج المتاح؛ بل ينبغي التحقق من واجهة المنتج المناسبة، وضوابط البيانات، والمنطقة الجغرافية، ومسار التكامل الملائم للنشر المقصود. 54
تتمثل الرسالة التنافسية الأساسية في حزمة أكثر تكاملاً: تفاعل منطوق، وفهم بصري للسياق، واستدلال خلفي، وأدوات غير متزامنة ضمن عائلة نماذج واحدة. ومن حيث المبدأ، قد يقلل ذلك الحاجة إلى تجميع مكونات منفصلة لتحويل الكلام إلى نص، ونموذج لغوي نصي، وتنسيق الأدوات، وتحويل النص إلى كلام؛ وهو ما قد يساعد في الحفاظ على استمرارية الحوار أثناء تنفيذ العمل. 1
10
يبقى GPT-Live-1 من OpenAI نقطة مقارنة مهمة، خصوصاً للفرق التي تقيّم السلوك الحواري ثنائي الاتجاه بالكامل. إلا أن مقارنة معيارية ضيقة لا تكفي وحدها لاتخاذ قرار على مستوى المنصة. التقييم الجاد ينبغي أن يستخدم مكالمات ممثلة للواقع، ويقيس التعامل مع المقاطعات، وصحة استدعاء الأدوات، والأداء متعدد اللغات، وضوابط السلامة، والتعافي من الأعطال، وزمن الاستجابة، وكلفة كل نتيجة مكتملة. 25
لا تحدد مواد الإطلاق المتاحة سياسة دقيقة لوضع العلامة المائية الصوتية SynthID في Gemini 3.8 Live أو Extended Thinking. وتقول جوجل إن SynthID توسعت لتضع علامات مائية وتتعرف على النصوص التي ينتجها تطبيق Gemini وتجربة الويب، لكن ذلك لا يثبت أن كل تدفق صوتي صادر من نماذج Live يحمل علامة مائية، ولا يوضح آلية الاكتشاف أو شروط الإتاحة. 59
وينطبق الحذر نفسه على ادعاءات التكاملات ودعم الشركاء، إذ قد تتغير سريعاً. وعلى الفرق التي تخطط لنشر إنتاجي التحقق من وثائق النماذج الحالية، والأسعار، وتوافر المنصات، وشروط الخدمة ذات الصلة قبل الالتزام ببنية تقنية محددة. 37
54
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
تطرح جوجل Gemini 3.8 Live للمحادثات الصوتية واسعة النطاق والكفاءة في التكلفة، بينما يستهدف Extended Thinking المهام المركبة متعددة الخطوات مع التفكير في الخلفية.
تطرح جوجل Gemini 3.8 Live للمحادثات الصوتية واسعة النطاق والكفاءة في التكلفة، بينما يستهدف Extended Thinking المهام المركبة متعددة الخطوات مع التفكير في الخلفية. الفكرة العملية ليست مجرد ردود أسرع: يستطيع نموذج Extended Thinking مواصلة الحديث أثناء التخطيط وانتظار الأدوات غير المتزامنة ومعالجة نتائجها.