MAI Transcribe 2 Streaming wandelt gesprochene Sprache fortlaufend in Text um und unterstützt laut den Angaben 60 Sprachen mit automatischer Spracherkennung. Für die Transkription nennt Microsoft einen Einführungspreis von 0,54 US Dollar pro Audiostunde bis Ende 2026.
Veröffentlicht vonBearbeitet mit GPT-6 LunaBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Microsoft ergänzt sein Angebot für Entwickler um drei Sprachmodelle: MAI-Transcribe-2-Streaming wandelt laufende Sprache in Text um. MAI-Voice-2.1 und MAI-Voice-2.1-Flash erzeugen dagegen gesprochene Antworten aus Text. Die Modelle sind für Anwendungen wie Sprachagenten gedacht und stehen über Microsoft Foundry in einer öffentlichen Vorschau bereit. 36
39
| Modell | Aufgabe | Angegebene Sprachunterstützung | Angegebener Preis |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Sprache während des Sprechens verschriftlichen und Text schrittweise aktualisieren | 60 Sprachen, automatische Spracherkennung | 0,54 US-Dollar pro Audiostunde; Einführungspreis bis Ende 2026 |
| MAI-Voice-2.1 | Text in ausdrucksstarke Sprache umwandeln | 23 Sprachen | 22 US-Dollar pro einer Million Zeichen |
| MAI-Voice-2.1-Flash | Schnellere Sprachausgabe für Anwendungen, bei denen kurze Wartezeiten zählen | 23 Sprachen für die Sprachmodelle angegeben | 15 US-Dollar pro einer Million Zeichen |
Die Preise beruhen auf den veröffentlichten Preisangaben und sind keine Garantie dafür, dass Konditionen oder Verfügbarkeit dauerhaft gleich bleiben. Besonders der Transkriptionspreis ist ausdrücklich als Einführungspreis ausgewiesen. 4
35
Herkömmliche Transkription wartet oft, bis ein Satz oder eine Äußerung beendet ist. MAI-Transcribe-2-Streaming liefert dagegen fortlaufend Text, während die Sprache eingeht. Das Modell verarbeitet kontinuierliche Audiodaten über eine WebSocket-Verbindung und soll automatisch zwischen 60 Sprachen erkennen können. 1
Bei der Verzögerung nennen die Berichte unterschiedliche Werte und Bezugspunkte: Einer beschreibt erste Teilergebnisse gut 100 Millisekunden nach Eingang des Audios, ein anderer nennt rund 320 Millisekunden ab dem gesprochenen Wort. Diese Angaben sind nicht direkt miteinander vergleichbar, weil sie unterschiedlich messen, wann die Zeitmessung beginnt. 2
4
Im Streaming-Transkriptionsbenchmark von Artificial Analysis soll das Modell zum Start den ersten Platz bei der Genauigkeit belegt haben. Ein Bericht nennt eine abschließende Wortfehlerrate von 2,5 Prozent im Vergleich mit 38 Modellen. Das ist ein berichtetes Benchmark-Ergebnis – keine Garantie für dieselbe Genauigkeit bei jeder Sprache, Aufnahmequalität oder Anwendung. 34
Der gelistete Einführungspreis beträgt 0,54 US-Dollar pro Audiostunde und gilt bis Ende 2026. Wer das Modell testet oder einsetzt, sollte berücksichtigen, dass dieser Tarif zeitlich begrenzt ist. 4
35
Beide Voice-Modelle wandeln Text in gesprochene Audiodaten um, setzen aber unterschiedliche Schwerpunkte. MAI-Voice-2.1 wird als ausdrucksstärkere Variante beschrieben. Flash ist auf höhere Geschwindigkeit ausgelegt – etwa für Anwendungen, bei denen eine kurze Pause zwischen den Gesprächsbeiträgen wichtig ist. Für die Voice-Modelle werden 23 unterstützte Sprachen angegeben. 6
35
36
Die gelisteten Preise liegen bei 22 US-Dollar pro einer Million Zeichen für MAI-Voice-2.1 und 15 US-Dollar für die Flash-Version. Ein Bericht gibt für Flash an, 45 Sekunden Audio mit 150 Millisekunden Verzögerung erzeugen zu können. Dieser Wert sollte als berichtete Angabe verstanden werden, nicht als allgemeingültige Messung der gesamten Antwortzeit in jeder Anwendung. 35
36
Für die Sprachqualität liegt in den verfügbaren Berichten kein direkt vergleichbarer öffentlicher Benchmark vor. Der Genauigkeitsrang des Transkriptionsmodells sagt daher nichts darüber aus, wie MAI-Voice-2.1 oder Flash im Vergleich zu anderen Sprachgeneratoren abschneiden. 32
34
Alle drei Modelle sind Berichten zufolge über Microsoft Foundry als öffentliche Vorschau verfügbar. Eine solche Vorschau ermöglicht Entwicklern das Testen, bedeutet aber nicht automatisch, dass die Modelle allgemein verfügbar sind. 36
Für den Aufbau eines Sprachagenten bietet Microsoft damit eigene Komponenten für das Verstehen und Erzeugen von Sprache an. Das kann es erleichtern, diese Teile einer Anwendung innerhalb des Microsoft-Entwicklerökosystems umzusetzen, und den Bedarf an externen Anbietern für genau diese Sprachfunktionen verringern. Daraus folgt jedoch nicht, dass ein vollständiger Sprachagent ohne weitere Modelle oder Dienste auskommt: Schlussfolgerungen, Ablaufsteuerung und andere Aufgaben können weiterhin zusätzliche Komponenten erfordern. 6
39
Am klarsten lässt sich MAI-Transcribe-2-Streaming anhand seiner Funktionen vergleichen: Es soll 60 Sprachen unterstützen, laufend Teilergebnisse liefern und laut einem Bericht im Artificial-Analysis-Benchmark den ersten Platz belegen. Derselbe Bericht nennt eine abschließende Wortfehlerrate von 2,5 Prozent. Bei den beiden Voice-Modellen geht es vor allem um die Wahl zwischen Ausdrucksstärke und Geschwindigkeit; für beide werden 23 Sprachen und unterschiedliche Zeichenpreise angegeben. Vor einer Produktionsentscheidung sollten Entwickler den aktuellen Zugang, die Preise und die tatsächliche Verzögerung in ihrer eigenen Anwendung prüfen. 1
34
35
36
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
MAI Transcribe 2 Streaming wandelt gesprochene Sprache fortlaufend in Text um und unterstützt laut den Angaben 60 Sprachen mit automatischer Spracherkennung.
MAI Transcribe 2 Streaming wandelt gesprochene Sprache fortlaufend in Text um und unterstützt laut den Angaben 60 Sprachen mit automatischer Spracherkennung. Für die Transkription nennt Microsoft einen Einführungspreis von 0,54 US Dollar pro Audiostunde bis Ende 2026.
MAI Voice 2.1 ist auf ausdrucksstarke Sprachausgabe ausgelegt, Flash auf mehr Tempo.