Microsoft’un üç yeni MAI modeli; 60 dilde canlı konuşma transkripsiyonu ile 23 dilde metinden sese üretimi bir araya getiriyor. Transkripsiyon modeli konuşma sürerken ara sonuçlar veriyor.
YayımlayanGPT-6 Luna ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft’un yeni MAI ses modelleri, sesli bir etkileşimin iki temel parçasını kapsıyor: MAI-Transcribe-2-Streaming canlı konuşmayı yazıya çeviriyor; MAI-Voice-2.1 ve MAI-Voice-2.1-Flash ise metinden ses üretiyor. Sesli asistan geliştiren yazılımcılara yönelik üç model de Microsoft Foundry’de herkese açık önizleme olarak sunuluyor. 36
39
| Model | Temel işlev | Bildirilen dil desteği | Bildirilen fiyat |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Konuşma devam ederken metni parça parça oluşturma | Otomatik dil algılamayla 60 dil | 2026 sonuna kadar tanıtım fiyatı olarak ses saati başına 0,54 ABD doları |
| MAI-Voice-2.1 | Duygulu ve ifade gücü yüksek metinden sese üretimi | 23 dil | Milyon karakter başına 22 ABD doları |
| MAI-Voice-2.1-Flash | Hızlı yanıt gereken uygulamalar için metinden sese üretimi | Ses modelleri için 23 dil bildiriliyor | Milyon karakter başına 15 ABD doları |
Bunlar kaynaklarda bildirilen fiyatlar; fiyatların veya erişim koşullarının değişmeyeceği anlamına gelmiyor. Özellikle transkripsiyon modelinin 0,54 dolarlık ücreti geçici tanıtım fiyatı olarak belirtiliyor. 4
35
Konuşmacının cümlesini bitirmesini bekleyen sistemlerden farklı olarak MAI-Transcribe-2-Streaming, ses geldikçe metin güncellemeleri gönderiyor. Sürekli ses akışını WebSocket üzerinden alıyor; model listelemesine ilişkin haberlere göre 60 dil arasından konuşulan dili otomatik olarak algılıyor. 1
Gecikme için aktarılan ölçümler aynı şeyi ölçmüyor. Bir haberde modelin ses verisini aldıktan 100 milisaniyeyi biraz aşan bir sürede ilk kısmi sonucu verebildiği belirtiliyor; başka bir haberde ise kelimelerin söylendikten yaklaşık 320 milisaniye sonra görünmeye başladığı aktarılıyor. Başlangıç noktaları farklı olduğu için bu iki süreyi doğrudan karşılaştırmak doğru olmaz. 2
4
Artificial Analysis’in akış hâlindeki transkripsiyon kıyaslamasında modelin doğrulukta ilk sırada yer aldığı bildiriliyor. Bir habere göre 38 model arasındaki değerlendirmede nihai kelime hata oranı yüzde 2,5. Bu, belirli bir kıyaslama testinin sonucu; her dilde, kayıt koşulunda veya uygulamada aynı doğruluğun sağlanacağı anlamına gelmiyor. 34
Listelenen tanıtım fiyatı, 2026 sonuna kadar ses saati başına 0,54 ABD doları. Modeli değerlendiren geliştiricilerin bunun süreli bir fiyat olduğunu hesaba katması gerekiyor. 4
35
Her iki model de metinden konuşma sesi üretiyor; aralarındaki temel fark öncelik. MAI-Voice-2.1 daha ifade gücü yüksek bir seçenek olarak tanımlanırken Flash, yanıt bekleme süresinin önemli olduğu uygulamalar için daha hızlı sürüm olarak konumlandırılıyor. Ses modelleri için bildirilen dil desteği 23 dil. 6
35
36
Bildirilen fiyatlar MAI-Voice-2.1 için milyon karakter başına 22, Flash içinse 15 ABD doları. Bir haberde Flash’ın 150 milisaniye gecikmeyle 45 saniyelik ses üretebildiği aktarılıyor. Bu değeri, her uygulamada uçtan uca yanıt süresini gösteren evrensel bir ölçüm olarak değil, bildirilen bir sonuç olarak değerlendirmek gerekir. 35
36
Mevcut haberlerde ses kalitesini doğrudan karşılaştıran ortak bir kamuya açık kıyaslama puanı bulunmuyor. Transkripsiyon modelinin doğruluk sıralaması, ses üreten iki modelin de sıralaması olarak yorumlanmamalı. 32
34
Üç modelin de Microsoft Foundry üzerinden herkese açık önizlemede sunulduğu bildiriliyor. Önizleme, geliştiricilere modelleri deneme olanağı sağlıyor; ancak genel kullanıma açıldıkları anlamına gelmiyor. 36
Geliştiriciler açısından yenilik, Microsoft’un sesli asistan iş akışında hem konuşmayı tanıma hem de konuşma üretme bileşenlerini kendi modelleriyle sunması. Bu, ses katmanının daha büyük bir bölümünü Microsoft’un geliştirici ekosistemi içinde kurmayı ve söz konusu bileşenler için başka sağlayıcılara başvurma ihtiyacını azaltmayı kolaylaştırabilir. Ancak bu modeller, eksiksiz bir sesli asistanın başka hizmetlere ihtiyaç duymadan çalışacağını göstermiyor: akıl yürütme, orkestrasyon ve diğer işlevler için farklı model veya hizmetler hâlâ gerekebilir. 6
39
En somut karşılaştırma verileri transkripsiyon modelinde: 60 dil desteği, konuşma sürerken kademeli metin üretimi ve Artificial Analysis’te bildirilen birincilik sıralamasının yanı sıra yüzde 2,5’lik nihai kelime hata oranı. İki ses modeli ise ifade gücü ile hız arasında seçim sunuyor; her ikisi için 23 dil desteği ve karakter başına farklı fiyat bildiriliyor. Üretim ortamında karar vermeden önce güncel önizleme erişimini, fiyatları ve kendi kullanım senaryonuzdaki gecikmeyi doğrulamakta fayda var. 1
34
35
36
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Microsoft’un üç yeni MAI modeli; 60 dilde canlı konuşma transkripsiyonu ile 23 dilde metinden sese üretimi bir araya getiriyor.
Microsoft’un üç yeni MAI modeli; 60 dilde canlı konuşma transkripsiyonu ile 23 dilde metinden sese üretimi bir araya getiriyor. Transkripsiyon modeli konuşma sürerken ara sonuçlar veriyor. Bildirilen gecikme ölçümleri farklı başlangıç noktalarına dayandığı için doğrudan karşılaştırılmamalı.
Üç model de Microsoft Foundry’de herkese açık önizlemede. Sesli asistanların konuşma katmanını sağlayabilirler; ancak akıl yürütme gibi diğer işlevlerin yerini tek başlarına almıyorlar.