Microsoft представила модель потокового розпізнавання мовлення на 60 мовах і дві моделі синтезу мовлення, для яких заявлено підтримку 23 мов. MAI Transcribe 2 Streaming надсилає проміжні результати, поки людина говорить.
ОпублікувавВідредаговано за допомогою GPT-6 LunaЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Три нові моделі Microsoft MAI охоплюють обидві частини голосової взаємодії: MAI-Transcribe-2-Streaming перетворює живе мовлення на текст, а MAI-Voice-2.1 і MAI-Voice-2.1-Flash озвучують текст. Їх представили для розробників голосових агентів. Усі три моделі доступні в публічній попередній версії через Microsoft Foundry. 36
39
| Модель | Для чого призначена | Заявлена підтримка мов | Заявлена ціна |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Потокове розпізнавання мовлення з проміжними оновленнями тексту | 60 мов, автоматичне визначення мови | $0,54 за годину аудіо — вступний тариф до кінця 2026 року |
| MAI-Voice-2.1 | Виразний синтез мовлення з тексту | 23 мови | $22 за мільйон символів |
| MAI-Voice-2.1-Flash | Швидший синтез мовлення для застосунків, де важлива оперативна відповідь | 23 мови для голосових моделей, згідно з оприлюдненими даними | $15 за мільйон символів |
Ціни й доступність наведено за опублікованими даними; вони можуть змінюватися. Microsoft окремо називає тариф на транскрипцію вступним. 4
35
Модель не чекає, доки співрозмовник закінчить фразу. Вона приймає безперервний аудіопотік через WebSocket і надсилає проміжні версії транскрипту в міру надходження мовлення. За даними про модель, вона автоматично визначає мову серед 60 підтримуваних. 1
У повідомленнях про швидкість наведено різні показники, які не варто напряму порівнювати. Один звіт зазначає, що перші часткові результати можуть з’явитися трохи більш як за 100 мілісекунд після отримання аудіо. Інший описує появу слів приблизно через 320 мілісекунд після їх вимовляння. Відлік у цих оцінках починається з різних моментів. 2
4
За повідомленнями про тест Artificial Analysis для потокового розпізнавання, модель дебютувала на першому місці за точністю. В одному зі звітів наведено показник помилки у фінальному тексті — 2,5% серед 38 моделей. Це результат бенчмарку, а не обіцянка такої самої точності для будь-якої мови, якості запису чи застосунку. 34
Заявлена вступна ціна — $0,54 за годину аудіо до кінця 2026 року. Розробникам, які оцінюють витрати, варто врахувати, що тариф обмежений у часі. 4
35
Обидві моделі генерують мовлення з тексту, але розраховані на різні пріоритети. MAI-Voice-2.1 описують як більш виразний варіант, а Flash — як швидшу модель для застосунків, де важливо скоротити паузу між репліками. Для голосових моделей заявлено підтримку 23 мов. 6
35
36
За оприлюдненими тарифами, MAI-Voice-2.1 коштує $22 за мільйон символів, а MAI-Voice-2.1-Flash — $15. В одному зі звітів для Flash також наведено показник генерації 45 секунд аудіо із затримкою 150 мілісекунд. Його слід сприймати як повідомлене значення, а не універсальну оцінку повного часу відповіді в будь-якій системі. 35
36
У доступних звітах немає безпосередньо зіставного публічного рейтингу якості синтезу для цих голосових моделей. Тому перше місце моделі транскрипції не свідчить про рейтинг MAI-Voice-2.1 чи Flash. 32
34
Усі три моделі, за повідомленнями, доступні через Microsoft Foundry у публічній попередній версії. Це дає змогу розробникам випробувати їх, але не означає, що моделі вже перейшли до загальної доступності. 36
Практичний сенс запуску — Microsoft пропонує власні компоненти для розпізнавання й генерації мовлення в межах одного інструментарію для розробників. Це може спростити створення мовного шару голосового агента в екосистемі Microsoft і зменшити потребу залучати інші постачальницькі рішення саме для цих компонентів. Водночас це не означає, що для повноцінного голосового агента більше не потрібні інші моделі чи сервіси: міркування, керування взаємодією та інші функції можуть працювати на окремих системах. 6
39
Найчіткіше порівняти можна модель транскрипції: вона підтримує 60 мов, видає текст поступово й, за наведеними даними, посіла перше місце в тесті Artificial Analysis із 2,5% помилок у фінальному тексті. Дві голосові моделі пропонують вибір між виразністю та швидкістю; для них заявлено 23 мови й різні тарифи за символи. Перед використанням у готовому продукті варто перевірити актуальну доступність, ціну та затримку в потрібній конфігурації. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsoft представила модель потокового розпізнавання мовлення на 60 мовах і дві моделі синтезу мовлення, для яких заявлено підтримку 23 мов.
Microsoft представила модель потокового розпізнавання мовлення на 60 мовах і дві моделі синтезу мовлення, для яких заявлено підтримку 23 мов. MAI Transcribe 2 Streaming надсилає проміжні результати, поки людина говорить. У звітах наведено різні показники затримки — трохи більш як 100 мс від отримання аудіо та приблизно 320 мс після вимовлених слів.
За наведеними даними Artificial Analysis, модель транскрипції посіла перше місце серед 38 моделей і показала 2,5% помилок у фінальному тексті.