Microsoft propose trois modèles MAI pour les agents vocaux : un outil de transcription en continu couvrant 60 langues et deux modèles de synthèse vocale annoncés pour 23 langues. Le modèle de transcription renvoie des résultats au fil de la parole.
Publié parModifié avec GPT-6 LunaImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft lance trois modèles MAI destinés aux développeurs d’agents vocaux : MAI-Transcribe-2-Streaming transforme la parole en texte au fil de l’échange, tandis que MAI-Voice-2.1 et MAI-Voice-2.1-Flash convertissent du texte en parole. Les trois sont annoncés en préversion publique dans Microsoft Foundry. 36
39
| Modèle | Fonction principale | Langues annoncées | Tarif rapporté |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Transcription en direct avec mises à jour progressives | 60, avec détection automatique de la langue | 0,54 $ par heure d’audio, tarif de lancement jusqu’à la fin de 2026 |
| MAI-Voice-2.1 | Synthèse vocale privilégiant l’expressivité | 23 | 22 $ par million de caractères |
| MAI-Voice-2.1-Flash | Synthèse vocale privilégiant la rapidité | 23 pour les modèles vocaux | 15 $ par million de caractères |
Ces tarifs et conditions correspondent aux informations rapportées au lancement : ils ne garantissent pas que les prix ou la disponibilité resteront identiques. Le tarif de transcription, notamment, est présenté comme une offre de lancement. 4
35
MAI-Transcribe-2-Streaming ne patiente pas jusqu’à la fin d’une intervention pour afficher le texte. Il reçoit un flux audio continu via WebSocket et transmet des résultats intermédiaires pendant que la personne parle. Selon la fiche du modèle citée dans les comptes rendus, il prend en charge 60 langues et détecte automatiquement celle qui est utilisée. 1
Les délais annoncés ne sont pas formulés de la même manière. Une source indique que les premiers résultats peuvent apparaître un peu plus de 100 millisecondes après la réception de l’audio ; une autre parle d’environ 320 millisecondes après que les mots ont été prononcés. Ces mesures n’ont pas le même point de départ : elles ne permettent donc pas une comparaison directe des performances. 2
4
Sur le benchmark de transcription en continu d’Artificial Analysis, le modèle aurait pris la première place pour la précision. Un compte rendu indique un taux d’erreur de mots final de 2,5 % parmi 38 modèles. Il s’agit d’un résultat rapporté sur un benchmark, et non d’une garantie de précision pour toutes les langues, les conditions d’enregistrement ou les applications. 34
Le tarif annoncé pour la transcription est de 0,54 $ par heure d’audio jusqu’à la fin de 2026. Les développeurs qui évaluent le modèle devront tenir compte du caractère temporaire de ce prix promotionnel. 4
35
Les deux modèles MAI-Voice produisent de la parole à partir d’un texte, mais ils visent des usages différents. MAI-Voice-2.1 est présenté comme l’option la plus expressive ; Flash est la variante la plus rapide, conçue pour les applications où la réactivité compte particulièrement. Les modèles vocaux sont annoncés pour 23 langues. 6
35
36
Les tarifs rapportés sont de 22 $ par million de caractères pour MAI-Voice-2.1 et de 15 $ pour Flash. Une source indique que Flash peut générer 45 secondes d’audio avec une latence de 150 millisecondes. Ce chiffre est à considérer comme une mesure rapportée, et non comme un délai universel de réponse de bout en bout. 35
36
Les sources disponibles ne fournissent pas de score public directement comparable pour la qualité des voix. Le classement de précision obtenu par le modèle de transcription ne permet donc pas de départager les deux modèles de synthèse vocale. 32
34
Les trois modèles sont signalés comme accessibles en préversion publique dans Microsoft Foundry. Une préversion permet de les tester, mais ne signifie pas qu’ils sont disponibles en version générale. 36
Pour les développeurs, Microsoft fournit désormais ses propres composants de reconnaissance et de génération vocales, qui peuvent servir à construire le volet audio d’un agent conversationnel au sein de son écosystème. Cela pourrait réduire le besoin de recourir à d’autres fournisseurs pour ces composants précis. En revanche, leur lancement ne signifie pas qu’un agent vocal complet peut se passer d’autres services : le raisonnement, l’orchestration et d’autres fonctions peuvent toujours dépendre de modèles ou de fournisseurs distincts. 6
39
Le modèle de transcription se distingue par ses mises à jour en direct, sa prise en charge annoncée de 60 langues et son classement rapporté en tête d’un benchmark d’Artificial Analysis, avec un taux d’erreur final de 2,5 % selon une source. Les deux modèles vocaux proposent plutôt un choix entre expressivité et rapidité, avec 23 langues annoncées et des tarifs différents au caractère. Avant un déploiement en production, mieux vaut vérifier les conditions d’accès à la préversion, les prix et la latence dans le contexte d’utilisation visé. 1
34
35
36
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Microsoft propose trois modèles MAI pour les agents vocaux : un outil de transcription en continu couvrant 60 langues et deux modèles de synthèse vocale annoncés pour 23 langues.
Microsoft propose trois modèles MAI pour les agents vocaux : un outil de transcription en continu couvrant 60 langues et deux modèles de synthèse vocale annoncés pour 23 langues. Le modèle de transcription renvoie des résultats au fil de la parole. Les délais rapportés varient selon le point de départ retenu : un peu plus de 100 ms après réception de l’audio ou environ 320 ms après que les mot...
Les trois modèles sont proposés en préversion publique dans Microsoft Foundry. Ils fournissent des briques vocales aux développeurs, sans remplacer nécessairement les autres modèles requis pour le raisonnement ou l’or...