عرضت علي بابا نموذجًا للترجمة الفورية أثناء الكلام، إلى جانب خمسة نماذج ضمن عائلة Qwen Audio 3.1. تغطي العائلة تحويل الكلام إلى نص، وتوليد الكلام، والمحادثات الصوتية، وفهم التسجيلات، وإنشاء مشاهد صوتية تضم الحوار والمؤثرات والأجواء المحيطة.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What audio models did Alibaba unveil at the 2026 Apsara Conference, and what are their capabilities and intended uses—including Qwen3.8-Live. Article summary: At the 2026 Apsara Conference, Alibaba presented Qwen3.8-LiveTranslate for simultaneous interpretation and its Qwen-Audio-3.1 lineup for speech recognition, synthesis, live interaction and audio creation. The reported tr. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
إذا أردت معرفة وظيفة كل إعلان صوتي من علي بابا في مؤتمر أبسارا ٢٠٢٦، فالتمييز الأساسي هو هذا: Qwen3.8-LiveTranslate للترجمة أثناء حديث المتكلم، أما Qwen-Audio-3.1 فهي عائلة من خمسة نماذج لمهام صوتية مختلفة، من تفريغ الكلام إلى إنتاج مقطع يجمع الأصوات والمؤثرات. 3
14
صُمم Qwen3.8-LiveTranslate للترجمة الشفوية المتزامنة؛ أي إخراج الترجمة تباعًا بدل انتظار انتهاء المتحدث. وتقول علي بابا إن بنية Interleave حسّنت أمانة الترجمة وطلاقتها واختصارها، وخفّضت مؤشر LAAL، وهو مقياس لمتوسط التأخر في الترجمة، من نحو ٢٫٨ إلى ٢٫٣ ثانية. الفارق نصف ثانية، أو قرابة ١٨٪. هذه أرقام وتقييمات أعلنتها الشركة، وليست نتائج اختبار مستقل. 3
7
وللمحادثات التي تضم أكثر من متحدث، تصف علي بابا إمكانات تشمل التمييز بين المتحدثين لحظيًا، وعرض النص الأصلي وترجمته بصورة متزامنة، والاستفادة من سياق الحديث السابق لفهم العبارات الملتبسة. وتدرج وثائق «Model Studio» الترجمة الشفوية المتزامنة والترجمة المباشرة ضمن استخدامات النموذج الآني. 7
1
تقول «كوين» إنها طوّرت ثلاث قدرات قائمة، هي ASR للتعرّف الآلي على الكلام، وTTS لتحويل النص إلى كلام، وRealtime للتفاعل الصوتي الآني؛ وأضافت نموذجين جديدين هما ASR-Next وTTS-Next. ولكل منها وظيفة مختلفة: 14
الفرق الأبرز في TTS-Next أنه موجّه إلى إنتاج مشهد صوتي، لا إلى قراءة نص بصوت اصطناعي فحسب. وتطرح علي بابا استخدامه في الكتب الصوتية والأفلام والتلفزيون والبودكاست والألعاب. لكن هذه استخدامات مستهدفة، وليست دليلًا على أن كل مشهد يولّده سيكون جاهزًا للنشر من دون تحرير أو مراجعة. 3
24
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
عرضت علي بابا نموذجًا للترجمة الفورية أثناء الكلام، إلى جانب خمسة نماذج ضمن عائلة Qwen Audio 3.1.
عرضت علي بابا نموذجًا للترجمة الفورية أثناء الكلام، إلى جانب خمسة نماذج ضمن عائلة Qwen Audio 3.1. تغطي العائلة تحويل الكلام إلى نص، وتوليد الكلام، والمحادثات الصوتية، وفهم التسجيلات، وإنشاء مشاهد صوتية تضم الحوار والمؤثرات والأجواء المحيطة.