La nueva línea combina transcripción en streaming para 60 idiomas con dos modelos de texto a voz que, según los listados, cubren 23 idiomas. MAI Transcribe 2 Streaming entrega resultados parciales mientras llega el audio.
Publicado porEditado con GPT-6 LunaImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft presentó tres modelos MAI para cubrir las dos partes de una conversación por voz: MAI-Transcribe-2-Streaming convierte voz en texto mientras alguien habla; MAI-Voice-2.1 y MAI-Voice-2.1-Flash generan audio a partir de texto. La propuesta está dirigida a desarrolladores que crean agentes de voz y, por ahora, los tres modelos se ofrecen en vista previa pública a través de Microsoft Foundry. 36
39
| Modelo | Para qué sirve | Idiomas reportados | Precio reportado |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Transcripción en directo con actualizaciones parciales | 60, con detección automática del idioma | 0,54 dólares por hora de audio; tarifa promocional hasta finales de 2026 |
| MAI-Voice-2.1 | Generación de voz con énfasis en la expresividad | 23 | 22 dólares por millón de caracteres |
| MAI-Voice-2.1-Flash | Generación de voz orientada a responder con mayor rapidez | 23 para los modelos de voz, según los listados | 15 dólares por millón de caracteres |
Son precios y datos de disponibilidad reportados, no una garantía de que las condiciones vayan a mantenerse. En particular, Microsoft describe como promocional la tarifa de transcripción. 4
35
A diferencia de un sistema que espera a que la persona termine de hablar, este modelo envía fragmentos de transcripción mientras recibe audio continuo mediante WebSocket. Según el listado citado en los informes, detecta automáticamente el idioma entre 60 opciones. 1
Las cifras de latencia varían según el reporte y el punto desde el que se empieza a medir. Una fuente indica que puede ofrecer resultados parciales poco más de 100 milisegundos después de recibir el audio; otra señala que las palabras pueden aparecer alrededor de 320 milisegundos después de ser pronunciadas. Como los puntos de partida no son iguales, no conviene comparar ambas cifras como si midieran exactamente lo mismo. 2
4
En el benchmark de transcripción en streaming de Artificial Analysis, el modelo debutó en el primer puesto de precisión, según los informes. Uno de ellos cifra su tasa final de error de palabras en un 2,5 % entre 38 modelos. Es un resultado reportado para esa evaluación, no una promesa de precisión idéntica con cualquier idioma, calidad de grabación o aplicación. 34
El precio anunciado para la transcripción es de 0,54 dólares por hora de audio, con carácter promocional hasta finales de 2026. Quienes evalúen el modelo para un producto deberían tener en cuenta que esa tarifa tiene un plazo. 4
35
Los dos modelos convierten texto en voz, pero están pensados para distintas prioridades. MAI-Voice-2.1 se presenta como la opción más expresiva; Flash, como la alternativa más rápida para aplicaciones en las que importa reducir la espera entre turnos. Los listados consultados atribuyen 23 idiomas a los modelos de voz. 6
35
36
El precio reportado es de 22 dólares por millón de caracteres para MAI-Voice-2.1 y de 15 dólares para Flash. Un informe afirma que Flash puede generar 45 segundos de audio con 150 milisegundos de latencia; hay que leerlo como una cifra publicada, no como una medición universal del tiempo total de respuesta en cualquier configuración. 35
36
Los informes disponibles no ofrecen una puntuación pública directamente comparable para medir la calidad de las voces generadas. Por tanto, el puesto de precisión del modelo de transcripción no sirve para establecer una clasificación de MAI-Voice-2.1 o Flash. 32
34
Los tres modelos están disponibles en vista previa pública en Microsoft Foundry. Esto permite a los desarrolladores probarlos, pero no equivale a que Microsoft los haya declarado disponibles de forma general. 36
La novedad práctica es que Microsoft ofrece componentes propios tanto para reconocer voz como para generarla. Eso puede facilitar que parte de la tecnología de voz de un agente se integre en el ecosistema de desarrollo de Microsoft y reducir la necesidad de recurrir a proveedores externos para esos componentes concretos. No significa que un agente completo pueda prescindir de otros servicios: el razonamiento, la coordinación de tareas y otras funciones pueden depender de modelos o herramientas distintos. 6
39
La comparación más clara es la de MAI-Transcribe-2-Streaming: transcribe de forma incremental, admite 60 idiomas y obtuvo un primer puesto reportado en precisión en Artificial Analysis, con una tasa de error final de palabras del 2,5 % en un informe. Para generar voz, MAI-Voice-2.1 prioriza la expresividad y Flash la rapidez; ambos tienen precios por carácter distintos. Antes de decidirse, conviene comprobar el acceso, las tarifas vigentes y la latencia en el entorno donde se piensa usar cada modelo. 1
34
35
36
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
La nueva línea combina transcripción en streaming para 60 idiomas con dos modelos de texto a voz que, según los listados, cubren 23 idiomas.
La nueva línea combina transcripción en streaming para 60 idiomas con dos modelos de texto a voz que, según los listados, cubren 23 idiomas. MAI Transcribe 2 Streaming entrega resultados parciales mientras llega el audio.
El modelo de transcripción figura primero en un informe del benchmark de Artificial Analysis y registra una tasa de error de palabras del 2,5 % en otro reporte.