בהכרזות האודיו של עליבאבא סביב כנס Apsara 2026 קל להתבלבל בין השמות, אבל ההבחנה פשוטה: Qwen3.8-LiveTranslate נועד לתרגם אדם בזמן שהוא עדיין מדבר; Qwen-Audio-3.1 היא סדרה של חמישה מודלים למשימות אודיו אחרות, מתמלול ועד יצירת פס קול.
3
14
תרגום חי: Qwen3.8-LiveTranslate
המודל מיועד לתרגום סימולטני, כלומר להפיק תרגום כשהדיבור המקורי עוד נמשך. עליבאבא טוענת שארכיטקטורת Interleave משפרת את הנאמנות למקור, השטף והתמציתיות, ובמקביל מורידה את LAAL — מדד לעיכוב הממוצע בתרגום — מכ־2.8 לכ־2.3 שניות. זהו שיפור של כחצי שנייה, או כ־18%, לפי נתוני החברה; הוא אינו תוצאה מאומתת של בדיקה עצמאית.
3
7
לשיחות מרובות משתתפים החברה מתארת גם זיהוי נפרד של הדוברים בזמן אמת, הצגה מסונכרנת של המקור והתרגום, ושימוש בהקשר מוקדם בשיחה כדי לפענח ביטויים דו־משמעיים. בתיעוד של Alibaba Cloud מצוינים תרגום חי ותרגום סימולטני כשימושים במודל.
7
1
חמשת מודלי Qwen-Audio-3.1: איזה מודל מתאים לאיזו משימה?
לפי צוות Qwen, הסדרה כוללת גרסאות משודרגות של ASR, TTS ו־Realtime, ולצדן שני מודלים חדשים — ASR-Next ו־TTS-Next.
14
- Qwen-Audio-3.1-ASR: ממיר דיבור לטקסט; זהו מודל התמלול בסדרה.
14
26
- Qwen-Audio-3.1-ASR-Next: מרחיב את ניתוח ההקלטה מעבר למילים שנאמרו. לפי Qwen, הוא יכול לזהות דוברים, להצמיד חותמות זמן לתמליל ולנתח רגשות וצלילים שאינם דיבור, למשל לצורך תיאור צלילים ומענה על שאלות לגבי הקלטה.
14
- Qwen-Audio-3.1-TTS: הופך טקסט לדיבור. Qwen מציינת תמיכה במספר שפות וניבים ואפשרות לשלוט במאפייני ההגשה, בהם רגש, מהירות וסגנון.
14
- Qwen-Audio-3.1-Realtime: מיועד לשיחות קוליות אינטראקטיביות. Alibaba Cloud מציגה עוזרים קוליים ושיחות שירות לקוחות כדוגמאות לשימוש.
14
1
- Qwen-Audio-3.1-TTS-Next: מיועד ליצירת קטע אודיו שלם, ולא רק קול מקריא. לפי Alibaba Cloud, הוא יכול להפיק במעבר אחד דיאלוג, אפקטים וקולות רקע, על בסיס קלט שעשוי לכלול טקסט, חותמות זמן ואודיו לדוגמה.
24
ההבדל המעשי הבולט הוא בין TTS, שמפיק דיבור מטקסט, לבין TTS-Next, שעל פי עליבאבא מיועד לבנות סצנה קולית מתסריט. החברה מציעה אותו לשימושים כמו ספרי שמע, קולנוע וטלוויזיה, פודקאסטים ומשחקים. אלה שימושים מיועדים — לא הוכחה שכל קטע שייווצר יהיה מוכן לפרסום ללא עריכה.
3
24