MAI Transcribe 2 Streaming trascrive mentre si parla, supporta 60 lingue e ha ottenuto il primo posto in una classifica di accuratezza citata dalle fonti. I tempi di risposta riportati non sono direttamente confrontabili: una fonte parla di poco più di 100 millisecondi per i primi risultati, un’altra di circa 320 mi...
Pubblicato daModificato con GPT-6 LunaImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
I tre nuovi modelli MAI di Microsoft coprono entrambe le fasi di una conversazione vocale: MAI-Transcribe-2-Streaming converte il parlato in testo mentre arriva, mentre MAI-Voice-2.1 e MAI-Voice-2.1-Flash trasformano il testo in voce. Pensati per gli sviluppatori che creano agenti vocali, sono disponibili in anteprima pubblica su Microsoft Foundry, la piattaforma Microsoft per sviluppare e usare modelli di IA. 36
39
| Modello | A cosa serve | Lingue dichiarate | Prezzo riportato |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Trascrizione in tempo reale, con aggiornamenti progressivi | 60, con rilevamento automatico della lingua | 0,54 USD per ora di audio; tariffa promozionale fino alla fine del 2026 |
| MAI-Voice-2.1 | Sintesi vocale con maggiore enfasi sull’espressività | 23 | 22 USD per milione di caratteri |
| MAI-Voice-2.1-Flash | Sintesi vocale più rapida, per applicazioni attente ai tempi di risposta | 23 per i modelli vocali, secondo le fonti disponibili | 15 USD per milione di caratteri |
Sono prezzi riportati nelle fonti, non una garanzia che tariffe e disponibilità restino invariate. In particolare, il costo della trascrizione è presentato come promozionale. 4
35
A differenza di un sistema che restituisce il testo solo quando una persona ha finito di parlare, MAI-Transcribe-2-Streaming invia aggiornamenti progressivi della trascrizione. Riceve audio continuo tramite WebSocket e, secondo le informazioni pubblicate sul modello, rileva automaticamente la lingua tra 60 opzioni. 1
Le fonti riportano tempi di latenza diversi, che non vanno messi sullo stesso piano. Una descrive i primi risultati parziali a poco più di 100 millisecondi dalla ricezione dell’audio; un’altra riferisce che le parole possono comparire circa 320 millisecondi dopo essere state pronunciate. I due dati partono da riferimenti diversi e non costituiscono un confronto diretto. 2
4
Secondo le notizie sul benchmark di trascrizione in streaming di Artificial Analysis, il modello ha esordito al primo posto per accuratezza. Una fonte riporta un tasso finale di errore sulle parole (WER) del 2,5% su 38 modelli. È un risultato di benchmark: non garantisce la stessa accuratezza con ogni lingua, qualità di registrazione o applicazione. 34
Il prezzo promozionale indicato è di 0,54 USD per ora di audio fino alla fine del 2026. Chi sta valutando il modello per un prodotto o servizio dovrà quindi considerare che si tratta di una tariffa a tempo. 4
35
Entrambi i modelli producono parlato a partire da testo, ma sono pensati per priorità diverse. MAI-Voice-2.1 è descritto come l’opzione più espressiva; Flash è la variante più rapida, adatta quando è importante ridurre l’attesa tra un turno di conversazione e l’altro. Per i modelli vocali è riportato il supporto a 23 lingue. 6
35
36
Il prezzo indicato è di 22 USD per milione di caratteri per MAI-Voice-2.1 e di 15 USD per milione di caratteri per Flash. Una fonte attribuisce a Flash la generazione di 45 secondi di audio con una latenza di 150 millisecondi: è un dato riportato, non una misura universale del tempo necessario per completare una risposta in qualsiasi configurazione. 35
36
Le fonti disponibili non offrono un punteggio pubblico direttamente confrontabile sulla qualità delle voci. Il risultato del modello di trascrizione non va quindi interpretato come una classifica dei due modelli di sintesi vocale. 32
34
Tutti e tre i modelli risultano disponibili in anteprima pubblica su Microsoft Foundry. La public preview consente agli sviluppatori di testarli, ma non equivale a un annuncio di disponibilità generale. 36
La novità pratica è che Microsoft propone componenti propri sia per riconoscere il parlato sia per generarlo. Questo può semplificare la realizzazione della parte vocale di un agente all’interno dell’ecosistema Microsoft e ridurre la necessità di ricorrere ad altri fornitori per queste specifiche funzioni. Non significa, però, che un agente vocale completo possa fare a meno di servizi esterni: ragionamento, coordinamento delle operazioni e altre capacità possono continuare a dipendere da modelli o piattaforme differenti. 6
39
Il confronto più concreto riguarda la trascrizione: il modello supporta 60 lingue, produce risultati progressivi e ha ottenuto un primo posto riportato nel benchmark di accuratezza di Artificial Analysis, con un WER finale indicato al 2,5%. Per la sintesi vocale, la scelta è tra l’approccio più espressivo di MAI-Voice-2.1 e la maggiore rapidità di Flash, con copertura dichiarata di 23 lingue e prezzi diversi per carattere. Prima di adottarli in produzione, conviene verificare accesso, tariffe e latenza nella configurazione che si intende usare. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MAI Transcribe 2 Streaming trascrive mentre si parla, supporta 60 lingue e ha ottenuto il primo posto in una classifica di accuratezza citata dalle fonti.
MAI Transcribe 2 Streaming trascrive mentre si parla, supporta 60 lingue e ha ottenuto il primo posto in una classifica di accuratezza citata dalle fonti. I tempi di risposta riportati non sono direttamente confrontabili: una fonte parla di poco più di 100 millisecondi per i primi risultati, un’altra di circa 320 millisecondi da quando le parole vengono pronunciate.
MAI Voice 2.1 punta sull’espressività, mentre Flash privilegia la velocità. Tutti e tre i modelli sono disponibili in anteprima pubblica su Microsoft Foundry.