MAI Transcribe 2 Streaming преобразует речь в текст по мере поступления аудио, поддерживает 60 языков и, по опубликованным данным, заняла первое место в тесте Artificial Analysis. Две модели синтеза речи охватывают 23 языка: MAI Voice 2.1 стоит 22 доллара за миллион символов, а более быстрая Flash версия — 15 долларов.
ОпубликовалОтредактировано с помощью GPT-6 LunaИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Новые модели Microsoft MAI охватывают обе стороны голосового диалога: MAI-Transcribe-2-Streaming превращает речь в текст прямо во время разговора, а MAI-Voice-2.1 и MAI-Voice-2.1-Flash озвучивают текст. Microsoft представила их для разработчиков голосовых ИИ-агентов; все три доступны в публичном превью через Microsoft Foundry. 36
39
| Модель | Для чего нужна | Заявленная поддержка языков | Указанная цена |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Распознаёт речь в реальном времени и обновляет расшифровку по мере поступления аудио | 60 языков, автоматическое определение языка | $0,54 за час аудио — вводная цена до конца 2026 года |
| MAI-Voice-2.1 | Преобразует текст в выразительную речь | 23 языка | $22 за миллион символов |
| MAI-Voice-2.1-Flash | Синтезирует речь с упором на скорость отклика | 23 языка для голосовых моделей | $15 за миллион символов |
Это опубликованные цены и характеристики, а не гарантия неизменных условий. В частности, тариф на транскрибацию обозначен как вводный. 4
35
Модель не ждёт, пока человек закончит говорить: она принимает непрерывный аудиопоток через WebSocket и поэтапно возвращает текст. Согласно опубликованному описанию, она поддерживает 60 языков и автоматически определяет, на каком из них идёт речь. 1
Оценки задержки в публикациях отличаются. В одном случае говорится, что первые промежуточные результаты появляются чуть более чем через 100 миллисекунд после получения аудио; в другом — что слова начинают отображаться примерно через 320 миллисекунд после того, как их произнесли. Поскольку отсчёт начинается в разных точках, эти цифры нельзя напрямую сравнивать как один и тот же показатель задержки. 2
4
По данным публикаций об испытании потоковой транскрибации Artificial Analysis, модель дебютировала на первом месте по точности. В одном отчёте указана итоговая доля ошибок в словах — 2,5% среди 38 моделей. Это результат конкретного теста, а не обещание такой же точности для любого языка, качества записи или сценария использования. 34
Указанная вводная цена — $0,54 за час аудио до конца 2026 года. При расчёте стоимости разработчикам стоит учитывать, что этот тариф ограничен по времени. 4
35
Обе модели генерируют речь по тексту, но рассчитаны на разные приоритеты. MAI-Voice-2.1 позиционируется как более выразительный вариант, а Flash — как более быстрый выбор для приложений, где важно сократить паузу между репликами. Для голосовых моделей указывается поддержка 23 языков. 6
35
36
В опубликованных списках цена MAI-Voice-2.1 составляет $22 за миллион символов, а MAI-Voice-2.1-Flash — $15 за миллион. Также приводится показатель для Flash: 45 секунд аудио с задержкой 150 миллисекунд. Его следует считать опубликованной характеристикой, а не универсальной оценкой полного времени отклика в любом приложении. 35
36
Сопоставимой публичной оценки качества синтеза речи в доступных публикациях нет. Поэтому первое место транскрибационной модели в рейтинге нельзя переносить на модели, которые генерируют голос. 32
34
Все три модели, согласно публикациям, доступны в публичном превью через Microsoft Foundry. Такой статус позволяет разработчикам тестировать модели, но сам по себе не означает, что они перешли в общую доступность. 36
Практический смысл запуска — Microsoft предлагает собственные компоненты и для распознавания речи, и для её генерации. Это может упростить создание речевой части голосового агента в экосистеме Microsoft и снизить потребность искать именно эти компоненты у других поставщиков. Однако запуск не доказывает, что агенту больше не нужны сторонние модели или сервисы: для рассуждений, управления диалогом и других задач могут потребоваться отдельные инструменты. 6
39
Самое наглядное предложение в этой линейке — потоковая транскрибация: 60 языков, выдача промежуточного текста и опубликованный результат на первом месте в рейтинге Artificial Analysis, включая указанный показатель ошибок в словах 2,5%. Две голосовые модели дают выбор между выразительностью и скоростью, а также отличаются ценой за миллион символов. Перед внедрением стоит проверить актуальные тарифы, доступность превью и задержку в собственном сценарии. 1
34
35
36
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
MAI Transcribe 2 Streaming преобразует речь в текст по мере поступления аудио, поддерживает 60 языков и, по опубликованным данным, заняла первое место в тесте Artificial Analysis.
MAI Transcribe 2 Streaming преобразует речь в текст по мере поступления аудио, поддерживает 60 языков и, по опубликованным данным, заняла первое место в тесте Artificial Analysis. Две модели синтеза речи охватывают 23 языка: MAI Voice 2.1 стоит 22 доллара за миллион символов, а более быстрая Flash версия — 15 долларов.
Все три модели доступны разработчикам в публичном превью Microsoft Foundry. Они закрывают задачи распознавания и генерации речи, но не заменяют другие компоненты голосового ИИ агента.