A Microsoft apresentou três modelos para experiências de voz: um transcreve fala ao vivo em 60 idiomas; os outros dois geram fala a partir de texto e têm cobertura informada de 23 idiomas. O MAI Transcribe 2 Streaming envia transcrições parciais enquanto a pessoa fala.
Publicado porEditado com GPT-6 LunaImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
A Microsoft anunciou três modelos de IA voltados a aplicações de voz: o MAI-Transcribe-2-Streaming, que transforma fala ao vivo em texto, e os modelos MAI-Voice-2.1 e MAI-Voice-2.1-Flash, que convertem texto em áudio. A proposta é oferecer a desenvolvedores componentes para criar agentes de voz — sistemas que escutam e respondem por fala. Os três estão disponíveis em prévia pública no Microsoft Foundry. 36
39
| Modelo | Para que serve | Idiomas informados | Preço informado |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Transcrição ao vivo, com atualizações parciais | 60, com detecção automática do idioma | US$ 0,54 por hora de áudio, em preço promocional até o fim de 2026 |
| MAI-Voice-2.1 | Geração de fala com foco em expressividade | 23 | US$ 22 por milhão de caracteres |
| MAI-Voice-2.1-Flash | Geração de fala com foco em velocidade | 23, conforme os dados informados para os modelos de voz | US$ 15 por milhão de caracteres |
Os valores são os preços publicados nos relatos disponíveis, em dólares americanos. A tarifa de transcrição é apresentada como promocional, então desenvolvedores devem confirmar as condições atuais antes de estimar custos de produção. 4
35
O MAI-Transcribe-2-Streaming não precisa esperar o fim de uma frase para começar a exibir texto. Ele recebe áudio contínuo por WebSocket — um protocolo de comunicação em tempo real — e envia atualizações da transcrição à medida que a fala chega. O modelo tem suporte informado para 60 idiomas e detecção automática do idioma falado. 1
Os relatos sobre a velocidade inicial não usam exatamente o mesmo ponto de partida. Um descreve resultados parciais aparecendo pouco mais de 100 milissegundos após o recebimento do áudio; outro cita palavras surgindo cerca de 320 milissegundos depois de serem pronunciadas. Por isso, os números não devem ser tratados como uma comparação direta da mesma medida de latência. 2
4
Em uma avaliação de transcrição em streaming da Artificial Analysis, o modelo teria estreado em primeiro lugar em precisão. Um dos relatos informa uma taxa final de erro por palavra de 2,5% entre 38 modelos. É um resultado de benchmark, não uma garantia de desempenho igual em todos os idiomas, ambientes de gravação ou usos. 34
O preço divulgado para o modelo é de US$ 0,54 por hora de áudio, em caráter promocional até o fim de 2026. 4
35
Os modelos MAI-Voice-2.1 e MAI-Voice-2.1-Flash geram áudio a partir de texto, mas atendem a prioridades diferentes. O 2.1 é descrito como a opção mais expressiva; o Flash é voltado a aplicações em que reduzir a espera entre uma fala e outra é importante. A cobertura informada para os modelos de voz é de 23 idiomas. 6
35
36
Os preços publicados são de US$ 22 por milhão de caracteres para o MAI-Voice-2.1 e US$ 15 por milhão de caracteres para o Flash. Um relato afirma que o Flash gera 45 segundos de áudio com latência de 150 milissegundos. Esse dado deve ser lido como uma especificação relatada, não como uma medida universal do tempo total de resposta em qualquer aplicação. 35
36
As informações disponíveis não apresentam uma pontuação pública diretamente comparável de qualidade de voz para os dois modelos. Portanto, a posição do modelo de transcrição em um ranking de precisão não deve ser interpretada como uma classificação dos modelos de geração de fala. 32
34
Os três modelos estão em prévia pública no Microsoft Foundry, plataforma da Microsoft para desenvolver e testar aplicações de IA. A prévia permite que desenvolvedores experimentem os modelos, mas não equivale a um anúncio de disponibilidade geral. 36
A novidade prática é a oferta de componentes próprios da Microsoft tanto para reconhecer fala quanto para gerar respostas em áudio. Isso pode facilitar a construção de parte da camada de voz dentro do ecossistema de desenvolvimento da empresa. Mas o lançamento não significa que um agente de voz completo dispense outros modelos ou serviços: raciocínio, orquestração e outras funções podem continuar dependendo de ferramentas diferentes. 6
39
O modelo de transcrição se destaca pela operação em streaming, pelo suporte informado a 60 idiomas e pelo resultado relatado na Artificial Analysis, incluindo uma taxa de erro final de 2,5%. Já os modelos de voz oferecem uma escolha entre expressividade e velocidade, com preços e cobertura de idiomas informados. Antes de decidir pelo uso em produção, vale verificar a disponibilidade, os preços e a latência no cenário específico da aplicação. 1
34
35
36
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Microsoft apresentou três modelos para experiências de voz: um transcreve fala ao vivo em 60 idiomas; os outros dois geram fala a partir de texto e têm cobertura informada de 23 idiomas.
A Microsoft apresentou três modelos para experiências de voz: um transcreve fala ao vivo em 60 idiomas; os outros dois geram fala a partir de texto e têm cobertura informada de 23 idiomas. O MAI Transcribe 2 Streaming envia transcrições parciais enquanto a pessoa fala.
O preço promocional informado para transcrição é de US$ 0,54 por hora de áudio até o fim de 2026.