Microsoft memperkenalkan satu model transkripsi penstriman yang menyokong 60 bahasa dan dua model penjanaan suara yang dilaporkan menyokong 23 bahasa. Transkripsi muncul secara berperingkat semasa seseorang bercakap.
Diterbitkan olehDisunting dengan GPT-6 LunaImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft memperkenalkan tiga model MAI untuk membantu pembangun membina ejen suara: MAI-Transcribe-2-Streaming menukar pertuturan langsung kepada teks, sementara MAI-Voice-2.1 dan MAI-Voice-2.1-Flash menukar teks kepada pertuturan. Ketiga-tiganya tersedia dalam pratonton awam melalui Microsoft Foundry. 36
39
| Model | Kegunaan utama | Sokongan bahasa yang dilaporkan | Harga yang disenaraikan |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Transkripsi langsung dengan kemas kini teks secara berperingkat | 60 bahasa, dengan pengesanan bahasa automatik | AS$0.54 sejam audio; harga pengenalan hingga akhir 2026 |
| MAI-Voice-2.1 | Penjanaan pertuturan daripada teks dengan penekanan pada ekspresi | 23 bahasa | AS$22 bagi setiap sejuta aksara |
| MAI-Voice-2.1-Flash | Penjanaan pertuturan yang lebih pantas untuk aplikasi yang mementingkan respons segera | 23 bahasa dilaporkan bagi model suara | AS$15 bagi setiap sejuta aksara |
Harga dan ketersediaan ini merujuk kepada maklumat yang dilaporkan, bukan jaminan bahawa kadar atau akses akan kekal sama. Harga transkripsi, khususnya, dinyatakan sebagai harga pengenalan. 4
35
Sistem transkripsi biasa mungkin menunggu sehingga seseorang selesai bercakap sebelum memaparkan teks. Model ini pula menerima audio berterusan melalui WebSocket dan mengemas kini transkrip semasa pertuturan berlangsung. Menurut senarai model yang dilaporkan, ia mengesan bahasa secara automatik antara 60 bahasa. 1
Angka kependaman berbeza mengikut laporan dan cara pengukuran. Satu laporan menyatakan hasil awal boleh mula muncul sedikit lebih 100 milisaat selepas audio diterima; laporan lain menyebut perkataan mula dipaparkan kira-kira 320 milisaat selepas dituturkan. Oleh sebab titik permulaan pengukuran yang dinyatakan berbeza, angka ini tidak wajar dianggap sebagai perbandingan langsung. 2
4
Dalam penilaian transkripsi penstriman Artificial Analysis, laporan menyebut model ini muncul di tempat pertama dari segi ketepatan. Satu laporan memberikan kadar ralat perkataan akhir sebanyak 2.5% dalam kalangan 38 model. Itu ialah keputusan penanda aras yang dilaporkan, bukannya jaminan ketepatan bagi setiap bahasa, keadaan rakaman atau aplikasi. 34
Harga pengenalannya disenaraikan pada AS$0.54 sejam audio hingga akhir 2026. Pembangun yang menilainya patut mengambil kira bahawa kadar tersebut bersifat sementara. 4
35
Kedua-dua model ini menjana audio pertuturan daripada teks, tetapi disasarkan kepada keutamaan yang berbeza. MAI-Voice-2.1 digambarkan sebagai pilihan yang lebih ekspresif, manakala Flash ialah varian yang lebih pantas untuk aplikasi yang perlu mengurangkan masa menunggu antara giliran perbualan. Model suara ini dilaporkan menyokong 23 bahasa. 6
35
36
Harga yang dilaporkan ialah AS$22 bagi setiap sejuta aksara untuk MAI-Voice-2.1 dan AS$15 bagi setiap sejuta aksara untuk MAI-Voice-2.1-Flash. Satu laporan turut menyatakan Flash boleh menjana audio selama 45 saat dengan kependaman 150 milisaat. Angka itu ialah ukuran yang dilaporkan, bukan ukuran masa respons hujung ke hujung yang semestinya terpakai dalam semua keadaan. 35
36
Laporan yang tersedia tidak memberikan skor penanda aras awam yang boleh dibandingkan secara terus untuk kualiti suara. Kedudukan ketepatan model transkripsi juga tidak boleh dianggap sebagai penarafan bagi mana-mana model penjanaan suara. 32
34
Ketiga-tiga model dilaporkan tersedia dalam pratonton awam Microsoft Foundry. Pratonton awam membolehkan pembangun menguji model, tetapi tidak bermaksud produk itu sudah tersedia secara umum. 36
Bagi pembangun, pelancaran ini bermakna Microsoft kini menawarkan komponen pengecaman dan penjanaan pertuturan sendiri untuk aliran kerja ejen suara. Ini boleh memudahkan mereka membina lebih banyak bahagian sistem suara dalam ekosistem pembangun Microsoft dan mengurangkan keperluan mendapatkan komponen khusus tersebut daripada pembekal lain. Namun, pelancaran ini tidak membuktikan bahawa ejen suara lengkap boleh berfungsi tanpa penyedia lain: penaakulan, penyelarasan proses dan keupayaan lain mungkin masih memerlukan model atau perkhidmatan berbeza. 6
39
Perbezaan paling jelas terletak pada model transkripsi: ia menyokong 60 bahasa, mengeluarkan hasil secara berperingkat dan dilaporkan menduduki tempat pertama dalam penilaian ketepatan Artificial Analysis, dengan kadar ralat perkataan akhir sebanyak 2.5% dalam satu laporan. Dua model suara pula menawarkan pilihan antara ekspresi dan kelajuan, dengan sokongan 23 bahasa yang dilaporkan serta harga berbeza bagi setiap aksara. Sebelum membuat keputusan untuk penggunaan produksi, pembangun wajar menyemak semula akses pratonton, harga dan kependaman dalam konfigurasi yang akan digunakan. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsoft memperkenalkan satu model transkripsi penstriman yang menyokong 60 bahasa dan dua model penjanaan suara yang dilaporkan menyokong 23 bahasa.
Microsoft memperkenalkan satu model transkripsi penstriman yang menyokong 60 bahasa dan dua model penjanaan suara yang dilaporkan menyokong 23 bahasa. Transkripsi muncul secara berperingkat semasa seseorang bercakap. Laporan memberikan ukuran kependaman yang berbeza: satu menyebut hasil awal muncul sedikit lebih 100 milisaat selepas audio diterima, manakala satu lag...
Ketiga tiga model tersedia dalam pratonton awam Microsoft Foundry. Harga pengenalan transkripsi ialah AS$0.54 sejam audio hingga akhir 2026; model suara masing masing disenaraikan pada AS$22 dan AS$15 bagi setiap seju...