Microsoft menghadirkan satu model transkripsi streaming yang mendukung 60 bahasa dan dua model text to speech dengan dukungan 23 bahasa. MAI Transcribe 2 Streaming mengirimkan transkrip bertahap.
Diterbitkan olehDiedit dengan GPT-6 LunaGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft memperkenalkan tiga model MAI untuk membantu pengembang membangun agen suara: MAI-Transcribe-2-Streaming mengubah ucapan langsung menjadi teks, sedangkan MAI-Voice-2.1 dan MAI-Voice-2.1-Flash mengubah teks menjadi suara. Ketiganya tersedia dalam public preview melalui Microsoft Foundry. 36
39
| Model | Fungsi utama | Dukungan bahasa yang dilaporkan | Harga yang dilaporkan |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Transkripsi langsung dengan pembaruan teks bertahap | 60 bahasa, dengan deteksi bahasa otomatis | US$0,54 per jam audio; tarif perkenalan hingga akhir 2026 |
| MAI-Voice-2.1 | Menghasilkan suara dari teks dengan fokus pada ekspresi | 23 bahasa | US$22 per satu juta karakter |
| MAI-Voice-2.1-Flash | Text-to-speech yang lebih cepat untuk aplikasi yang mengutamakan respons singkat | 23 bahasa untuk model suara | US$15 per satu juta karakter |
Angka di atas merupakan harga dan ketersediaan yang dilaporkan, bukan jaminan bahwa keduanya akan tetap sama. Microsoft menyebut harga transkripsi sebagai tarif perkenalan. 4
35
Model ini tidak perlu menunggu pembicara menyelesaikan kalimat untuk mulai menampilkan teks. MAI-Transcribe-2-Streaming menerima audio berkelanjutan melalui WebSocket dan mengirim pembaruan transkrip secara bertahap. Daftar modelnya menyebut dukungan 60 bahasa dengan deteksi bahasa otomatis. 1
Laporan yang tersedia menyajikan angka latensi dengan titik awal pengukuran berbeda. Salah satunya menyebut model dapat mulai memberikan hasil sementara sedikit di atas 100 milidetik setelah menerima audio; laporan lain menyebut kata-kata mulai muncul sekitar 320 milidetik setelah diucapkan. Karena cara pengukurannya berbeda, kedua angka itu tidak bisa dibandingkan secara langsung. 2
4
Dalam tolok ukur transkripsi streaming Artificial Analysis, laporan menyebut model ini menempati peringkat pertama untuk akurasi. Salah satu laporan mencatat tingkat kesalahan kata akhir sebesar 2,5% di antara 38 model. Hasil tolok ukur tersebut bukan jaminan akurasi yang sama untuk setiap bahasa, kondisi rekaman, atau aplikasi. 34
Harga perkenalan yang tercantum adalah US$0,54 per jam audio hingga akhir 2026. Pengembang sebaiknya memperhitungkan bahwa tarif tersebut bersifat sementara. 4
35
Kedua model menghasilkan audio dari teks, tetapi menawarkan prioritas yang berbeda. MAI-Voice-2.1 diposisikan sebagai pilihan yang lebih ekspresif, sedangkan versi Flash ditujukan untuk aplikasi yang membutuhkan respons lebih cepat. Dukungan bahasa yang dilaporkan untuk model-model suara ini adalah 23 bahasa. 6
35
36
Harga yang tercantum adalah US$22 per satu juta karakter untuk MAI-Voice-2.1 dan US$15 per satu juta karakter untuk MAI-Voice-2.1-Flash. Sebuah laporan menyebut Flash dapat menghasilkan audio berdurasi 45 detik dengan latensi 150 milidetik. Angka itu merupakan klaim yang dilaporkan, bukan ukuran waktu respons menyeluruh yang berlaku untuk semua penggunaan. 35
36
Laporan yang tersedia belum memberikan skor tolok ukur publik yang bisa dibandingkan langsung untuk kualitas suara. Peringkat akurasi model transkripsi juga tidak menunjukkan peringkat kualitas untuk kedua model pembuat suara tersebut. 32
34
Ketiga model dilaporkan tersedia dalam public preview melalui Microsoft Foundry. Artinya, pengembang dapat mencobanya, tetapi status pratinjau publik tidak sama dengan ketersediaan umum. 36
Bagi pengembang, peluncuran ini menambahkan komponen buatan Microsoft untuk mengenali dan menghasilkan suara dalam alur kerja agen suara. Hal itu dapat memudahkan pengembangan lapisan suara di ekosistem Microsoft dan mengurangi kebutuhan mencari komponen-komponen tersebut dari penyedia lain. Namun, peluncuran ini tidak membuktikan bahwa seluruh agen suara bisa berjalan tanpa layanan lain: penalaran, orkestrasi, dan kemampuan berbeda mungkin tetap menggunakan model atau layanan lain. 6
39
Perbandingan paling jelas ada pada model transkripsi: dukungan 60 bahasa, transkrip bertahap, serta peringkat pertama yang dilaporkan dalam tolok ukur akurasi Artificial Analysis, dengan tingkat kesalahan kata akhir 2,5% pada salah satu laporan. Dua model suara menawarkan pilihan antara ekspresi dan kecepatan, dengan dukungan 23 bahasa serta harga per karakter yang berbeda. Sebelum menerapkannya, pengembang sebaiknya memeriksa kembali akses pratinjau, harga, dan latensi untuk kebutuhan mereka. 1
34
35
36
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Microsoft menghadirkan satu model transkripsi streaming yang mendukung 60 bahasa dan dua model text to speech dengan dukungan 23 bahasa.
Microsoft menghadirkan satu model transkripsi streaming yang mendukung 60 bahasa dan dua model text to speech dengan dukungan 23 bahasa. MAI Transcribe 2 Streaming mengirimkan transkrip bertahap. Laporan menyebut waktu respons berbeda beda, bergantung pada cara pengukurannya.
Ketiga model tersedia dalam public preview di Microsoft Foundry. Harganya mencakup tarif pengenalan untuk transkripsi hingga akhir 2026.