שלושת מודלי MAI החדשים של מיקרוסופט מטפלים בשני הכיוונים של שיחה קולית: MAI-Transcribe-2-Streaming הופך דיבור שמגיע בזמן אמת לטקסט, ואילו MAI-Voice-2.1 ו־MAI-Voice-2.1-Flash מייצרים דיבור מתוך טקסט. המודלים מיועדים למפתחים שבונים סוכני קול, והם זמינים בתצוגה מקדימה ציבורית דרך Microsoft Foundry.
36
39
השוואה מהירה
| מודל |
למה הוא מיועד |
תמיכה מדווחת בשפות |
מחיר מדווח |
| MAI-Transcribe-2-Streaming |
תמלול דיבור בזמן אמת, עם עדכונים תוך כדי השיחה |
60 שפות וזיהוי שפה אוטומטי |
0.54 דולר לשעת אודיו — מחיר היכרות עד סוף 2026 4 35 |
| MAI-Voice-2.1 |
המרת טקסט לדיבור עם דגש על הבעה |
23 שפות |
22 דולר למיליון תווים 35 36 |
| MAI-Voice-2.1-Flash |
המרת טקסט לדיבור בגרסה מהירה יותר, לאפליקציות שבהן חשובה תגובה זריזה |
23 שפות לפי הדיווחים על דגמי הקול |
15 דולר למיליון תווים 35 36 |
אלה המחירים והפרטים שפורסמו בדיווחים, ולא התחייבות לכך שהמחיר או הזמינות לא ישתנו. בפרט, מחיר התמלול מוגדר כמחיר היכרות.
4
35
MAI-Transcribe-2-Streaming: תמלול תוך כדי דיבור
בשונה ממערכת שממתינה עד שהדובר מסיים משפט, MAI-Transcribe-2-Streaming מעביר עדכוני תמלול בזמן שהאודיו עדיין מגיע. לפי הדיווחים על דף המודל, הוא מקבל זרם אודיו רציף באמצעות WebSocket ומזהה אוטומטית שפה מתוך 60 שפות.
1
הדיווחים על זמן ההשהיה אינם מציגים מדידה זהה. לפי מקור אחד, המודל יכול להתחיל להציג תוצאות חלקיות מעט יותר מ־100 אלפיות השנייה לאחר קבלת האודיו; מקור אחר מתאר מילים שמתחילות להופיע כ־320 אלפיות השנייה לאחר שנאמרו. מאחר שנקודות ההתחלה שונות, אין לראות בנתונים השוואה ישירה של אותו מדד.
2
4
במבחן תמלול הסטרימינג של Artificial Analysis, דיווחים אומרים שהמודל הופיע לראשונה במקום הראשון בדיוק. דיווח אחד מציין שיעור שגיאות מילים סופי של 2.5% מתוך 38 מודלים. זהו נתון מבחן מדווח, ולא הבטחה לדיוק זהה בכל שפה, תנאי הקלטה או שימוש.
34
המחיר המוצג לתמלול הוא 0.54 דולר לשעת אודיו, כמחיר היכרות עד סוף 2026. מפתחים שבוחנים את המודל צריכים להביא בחשבון שמדובר בתעריף מוגבל בזמן.
4
35
MAI-Voice-2.1 ו־Flash: להפוך טקסט לקול
שני המודלים מייצרים אודיו מדובר מתוך טקסט, אך מיועדים להעדפות שונות. MAI-Voice-2.1 מתואר כאפשרות הבעתית יותר, ואילו Flash הוא הגרסה המהירה יותר, לאפליקציות שבהן חשוב לצמצם את ההמתנה בין תורות בשיחה. לפי הדיווחים, מודלי הקול תומכים ב־23 שפות.
6
35
36
המחירים המדווחים הם 22 דולר למיליון תווים עבור MAI-Voice-2.1 ו־15 דולר למיליון תווים עבור Flash. דיווח נוסף מציין ש־Flash יכול לייצר 45 שניות של אודיו בהשהיה של 150 אלפיות השנייה. יש להתייחס לכך כנתון שפורסם, ולא כמדד אחיד לזמן התגובה הכולל בכל מערכת.
35
36
בדיווחים הזמינים אין ציון מבחן ציבורי שאפשר להשוות ישירות בין איכות הקול של שני המודלים. דירוג הדיוק של מודל התמלול אינו דירוג של מודלי יצירת הדיבור.
32
34
מה זמין למפתחים — ומה ההשקה מסמנת
לפי הדיווחים, שלושת המודלים זמינים בתצוגה מקדימה ציבורית דרך Microsoft Foundry. תצוגה מקדימה מאפשרת למפתחים לבדוק את המודלים, אך אינה שקולה להכרזה על זמינות כללית.
36
המשמעות המעשית למפתחים היא שמיקרוסופט מציעה כעת רכיבים משלה הן לזיהוי דיבור והן ליצירת דיבור בתהליך עבודה של סוכן קולי. כך אפשר לבנות חלק גדול יותר משכבת הקול בתוך סביבת הפיתוח של מיקרוסופט, ואולי לצמצם את הצורך להביא את הרכיבים האלה מספקים אחרים. עם זאת, ההשקה אינה מוכיחה שסוכן קולי שלם יכול לפעול בלי שירותים חיצוניים: יכולות כמו הסקה, תזמור ומשימות נוספות עדיין עשויות להסתמך על מודלים או שירותים אחרים.
6
39
השורה התחתונה
ההשוואה הברורה ביותר היא במודל התמלול: הוא תומך ב־60 שפות, מעביר תוצאות בהדרגה, ולפי דיווחים הגיע לראש דירוג הדיוק של Artificial Analysis, עם שיעור שגיאות מילים סופי מדווח של 2.5%. שני מודלי הקול מציעים בחירה בין הבעה למהירות, עם תמיכה מדווחת ב־23 שפות ומחירים שונים לפי מספר התווים. לפני החלטה על שימוש בייצור, כדאי לבדוק את זמינות התצוגה המקדימה, המחיר וההשהיה בתצורה המתוכננת.
1
34
35
36