Microsoftin kolme MAI mallia kattavat puheesta tekstiksi muunnoksen 60 kielellä sekä tekstistä puheeksi mallit, joiden ilmoitettu kielituki on 23 kieltä. MAI Transcribe 2 Streaming näyttää tekstityksen puheen aikana.
JulkaisijaMuokattu mallilla GPT-6 LunaKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoftin kolme uutta MAI-mallia kattavat puhutun keskustelun molemmat suunnat: MAI-Transcribe-2-Streaming muuntaa puheen tekstiksi sitä mukaa kuin sitä kuuluu, ja MAI-Voice-2.1 sekä MAI-Voice-2.1-Flash tuottavat puhetta tekstistä. Mallit on suunnattu kehittäjille, jotka rakentavat ääniavustajia, ja ne ovat saatavilla Microsoft Foundryssa julkisessa esikatselussa. 36
39
| Malli | Käyttötarkoitus | Ilmoitettu kielituki | Ilmoitettu hinta |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Puheen reaaliaikainen tekstitys, jossa tulos päivittyy puheen aikana | 60 kieltä, automaattinen kielen tunnistus | 0,54 dollaria äänitunnilta; aloitushinta vuoden 2026 loppuun asti |
| MAI-Voice-2.1 | Ilmeikäs tekstistä puheeksi -synteesi | 23 kieltä | 22 dollaria miljoonalta merkiltä |
| MAI-Voice-2.1-Flash | Nopeampi puhesynteesi sovelluksiin, joissa vasteaika on tärkeä | 23 kieltä on ilmoitettu puhemalleille | 15 dollaria miljoonalta merkiltä |
Hinnat ovat lähteissä ilmoitettuja listahintoja, eivät lupaus siitä, että hinta tai saatavuus pysyy ennallaan. Erityisesti transkriptiomallin 0,54 dollarin tuntihinta on määräaikainen aloitushinta. 4
35
Tavallinen litterointityökalu voi odottaa puhujan lauseen tai puheenvuoron loppuun. MAI-Transcribe-2-Streaming sen sijaan lähettää tekstiversiota sitä mukaa kuin ääntä saapuu. Se vastaanottaa jatkuvaa ääntä WebSocket-yhteyden kautta ja tunnistaa automaattisesti 60 kielen joukosta, mitä kieltä puhutaan. 1
Mallin viiveestä on julkaistu erilaisia lukuja, sillä mittaukset eivät kuvaa täsmälleen samaa asiaa. Yhden raportin mukaan osittaisia tuloksia alkaa tulla hieman yli 100 millisekuntia äänen vastaanottamisen jälkeen; toisen mukaan sanoja voi ilmestyä näkyviin noin 320 millisekuntia niiden lausumisen jälkeen. Lukuja ei siksi pidä tulkita suoraan keskenään vertailukelpoisiksi. 2
4
Artificial Analysisin suoratoistavan puheentunnistuksen vertailussa malli sijoittui raporttien mukaan tarkkuudessa ensimmäiseksi. Yhdessä raportissa sen lopullisen tekstin sanavirheprosentiksi ilmoitetaan 2,5 prosenttia 38 mallin joukossa. Kyse on vertailutuloksesta, eikä se takaa samaa tarkkuutta kaikilla kielillä, äänenlaaduilla tai käyttötavoilla. 34
Ilmoitettu aloitushinta on 0,54 dollaria äänitunnilta vuoden 2026 loppuun asti. Mallia arvioivien kehittäjien kannattaa huomioida, että kyseessä on määräaikainen hinta. 4
35
Molemmat äänimallit muuttavat tekstin puhutuksi ääneksi, mutta niiden painotukset eroavat. MAI-Voice-2.1:tä kuvataan ilmeikkäämmäksi vaihtoehdoksi, kun taas Flash on nopeampi versio sovelluksiin, joissa vastausvuorojen välinen odotus halutaan pitää lyhyenä. Puhemalleille ilmoitetaan 23 kielen tuki. 6
35
36
Listatuiksi hinnoiksi ilmoitetaan 22 dollaria miljoonalta merkiltä MAI-Voice-2.1-mallille ja 15 dollaria miljoonalta merkiltä Flash-mallille. Erään raportin mukaan Flash pystyy tuottamaan 45 sekuntia ääntä 150 millisekunnin viiveellä. Tätä kannattaa pitää raportoituna lukuna, ei yleispätevänä mittana siitä, kuinka nopeasti sovellus vastaa alusta loppuun. 35
36
Saatavilla olevissa raporteissa ei ole puheen laadusta suoraan vertailukelpoista julkista testitulosta. Transkriptiomallin sijoitusta tarkkuusvertailussa ei siis pidä tulkita arvioksi kummankaan puhesynteesimallin laadusta. 32
34
Kaikkien kolmen mallin kerrotaan olevan saatavilla Microsoft Foundryn julkisessa esikatselussa. Julkinen esikatselu mahdollistaa mallien kokeilemisen, mutta ei tarkoita samaa kuin yleisesti saatavilla oleva valmis palvelu. 36
Kehittäjille keskeinen muutos on se, että Microsoft tarjoaa nyt omat komponenttinsa sekä puheen tunnistamiseen että puheen tuottamiseen. Tämä voi helpottaa puhekerroksen rakentamista Microsoftin kehittäjäympäristössä ja vähentää tarvetta hankkia juuri nämä komponentit muualta. Julkaisu ei kuitenkaan tarkoita, että kokonainen ääniavustaja toimisi ilman muita palveluntarjoajia: esimerkiksi päättelyyn ja järjestelmän eri osien yhteensovittamiseen voidaan edelleen tarvita muita malleja tai palveluita. 6
39
Selkein vertailukohta on MAI-Transcribe-2-Streaming: se tukee 60 kieltä, tuottaa päivittyvää tekstiä puheen aikana ja sai raporteissa parhaan tarkkuussijoituksen Artificial Analysisin vertailussa. Yhdessä raportissa sen lopullisen tekstin sanavirheprosentiksi ilmoitetaan 2,5. Kaksi puhemallia tarjoavat puolestaan valinnan ilmeikkäämmän ja nopeamman vaihtoehdon välillä; niiden ilmoitettu kielituki on 23 kieltä, ja niillä on eri merkkikohtaiset hinnat. Ennen tuotantokäyttöä kehittäjän kannattaa tarkistaa saatavuus, hinnat ja viiveet omassa käyttötapauksessaan. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsoftin kolme MAI mallia kattavat puheesta tekstiksi muunnoksen 60 kielellä sekä tekstistä puheeksi mallit, joiden ilmoitettu kielituki on 23 kieltä.
Microsoftin kolme MAI mallia kattavat puheesta tekstiksi muunnoksen 60 kielellä sekä tekstistä puheeksi mallit, joiden ilmoitettu kielituki on 23 kieltä. MAI Transcribe 2 Streaming näyttää tekstityksen puheen aikana. Sen viiveestä on raportoitu eri lukuja, koska mittaukset alkavat ja päättyvät eri kohdissa.
Kaikki kolme mallia ovat saatavilla Microsoft Foundryssa julkisessa esikatselussa.