Microsoft ogłosił trzy modele MAI: jeden do strumieniowej transkrypcji mowy w 60 językach oraz dwa do generowania głosu, obsługujące 23 języki. Transcribe 2 Streaming przesyła kolejne fragmenty transkrypcji, gdy rozmówca nadal mówi.
Opublikowane przezEdytowane za pomocą GPT-6 LunaObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft wprowadza trzy modele MAI, które obsługują oba kierunki komunikacji głosowej: MAI-Transcribe-2-Streaming zamienia mowę na tekst w trakcie wypowiedzi, a MAI-Voice-2.1 i MAI-Voice-2.1-Flash generują mowę na podstawie tekstu. Zestaw przygotowano z myślą o deweloperach budujących agentów głosowych. Wszystkie trzy modele są dostępne w Microsoft Foundry w publicznej wersji testowej. 36
39
| Model | Zastosowanie | Podawana obsługa języków | Podawana cena |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Transkrypcja na żywo, z aktualizacjami tekstu w trakcie wypowiedzi | 60 języków, automatyczne wykrywanie języka | 0,54 USD za godzinę dźwięku; cena promocyjna do końca 2026 r. |
| MAI-Voice-2.1 | Generowanie ekspresyjnej mowy z tekstu | 23 języki | 22 USD za milion znaków |
| MAI-Voice-2.1-Flash | Szybsze generowanie mowy, gdy liczy się krótki czas oczekiwania | 23 języki dla modeli głosowych | 15 USD za milion znaków |
To ceny podawane w dostępnych zestawieniach, a nie gwarancja, że pozostaną niezmienione. Microsoft określa stawkę za transkrypcję jako promocyjną. 4
35
MAI-Transcribe-2-Streaming nie musi czekać, aż rozmówca skończy mówić, by zwrócić tekst. Przyjmuje ciągły strumień dźwięku przez WebSocket i przesyła kolejne aktualizacje transkrypcji. Według opisu modelu obsługuje 60 języków i automatycznie rozpoznaje język wypowiedzi. 1
Podawane wartości opóźnienia zależą od opisu i punktu pomiaru. Jedno źródło mówi o pierwszych częściowych wynikach nieco ponad 100 milisekund po otrzymaniu dźwięku, a inne — o pojawianiu się słów mniej więcej 320 milisekund po ich wypowiedzeniu. Ponieważ pomiary zaczynają się w różnych momentach, nie należy traktować ich jako bezpośrednio porównywalnych. 2
4
W zestawieniu Artificial Analysis dotyczącym strumieniowej transkrypcji model miał zadebiutować na pierwszym miejscu pod względem dokładności. Jedna z relacji podaje końcowy współczynnik błędu słów (WER) na poziomie 2,5 proc. w porównaniu 38 modeli. To wynik testu, a nie obietnica takiej samej dokładności w każdym języku, nagraniu czy zastosowaniu. 34
Podawana cena promocyjna wynosi 0,54 USD za godzinę dźwięku i ma obowiązywać do końca 2026 r. Deweloperzy oceniający model powinni uwzględnić, że jest to oferta czasowa. 4
35
Oba modele Voice zamieniają tekst na mowę, ale mają odpowiadać na różne potrzeby. MAI-Voice-2.1 jest opisywany jako wariant stawiający na ekspresję, natomiast Flash ma być szybszą opcją dla aplikacji, w których ważne jest ograniczenie przerwy między kolejnymi wypowiedziami. Podawana obsługa językowa modeli głosowych obejmuje 23 języki. 6
35
36
Według dostępnych zestawień MAI-Voice-2.1 kosztuje 22 USD za milion znaków, a MAI-Voice-2.1-Flash — 15 USD. Jedna z relacji podaje, że Flash generuje 45 sekund dźwięku przy opóźnieniu 150 milisekund. Należy traktować tę wartość jako raportowany wynik, a nie uniwersalny pomiar czasu odpowiedzi w każdej konfiguracji. 35
36
Dostępne materiały nie przedstawiają bezpośrednio porównywalnego publicznego wyniku testu jakości głosu. Wysoka pozycja modelu transkrypcyjnego nie jest więc oceną jakości generowanej mowy w którymkolwiek z wariantów Voice. 32
34
Wszystkie trzy modele są dostępne w Microsoft Foundry jako publiczna wersja testowa. Oznacza to, że deweloperzy mogą je wypróbować, ale nie jest równoznaczne z ogólną dostępnością. 36
Praktycznie Microsoft oferuje teraz własne komponenty zarówno do rozpoznawania mowy, jak i jej generowania — elementy, które można wykorzystać przy budowie agenta głosowego. Może to ułatwić tworzenie warstwy głosowej w ekosystemie narzędzi Microsoftu i ograniczyć potrzebę pozyskiwania tych konkretnych funkcji od innych dostawców. Nie oznacza jednak, że kompletny agent może działać bez zewnętrznych usług: rozumowanie, koordynacja zadań i inne funkcje mogą nadal opierać się na odrębnych modelach lub rozwiązaniach. 6
39
Najbardziej konkretne dane dotyczą modelu transkrypcyjnego: obsługuje 60 języków, zwraca tekst w miarę napływania mowy i — według opublikowanych doniesień — zajął pierwsze miejsce w teście dokładności Artificial Analysis, osiągając końcowy WER na poziomie 2,5 proc. Dwa modele głosowe pozwalają wybierać między większym naciskiem na ekspresję a szybkością; podawana obsługa obejmuje 23 języki, a ceny różnią się w zależności od wariantu. Przed wdrożeniem warto sprawdzić aktualny dostęp do wersji testowej, cennik i opóźnienia w docelowej konfiguracji. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsoft ogłosił trzy modele MAI: jeden do strumieniowej transkrypcji mowy w 60 językach oraz dwa do generowania głosu, obsługujące 23 języki.
Microsoft ogłosił trzy modele MAI: jeden do strumieniowej transkrypcji mowy w 60 językach oraz dwa do generowania głosu, obsługujące 23 języki. Transcribe 2 Streaming przesyła kolejne fragmenty transkrypcji, gdy rozmówca nadal mówi.
Podawane ceny to 0,54 USD za godzinę dźwięku dla transkrypcji, 22 USD za milion znaków dla Voice 2.1 i 15 USD za milion znaków dla wersji Flash.