Eleven v4 erschien am 28. September 2026 und ist auf ausdrucksstarke Erzählungen ausgelegt. Beide Modelle unterstützen mehr als 90 Sprachen.
Veröffentlicht vonBearbeitet mit GPT-6 LunaBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What are ElevenLabs’ new Eleven v4 and Eleven v4 Turbo text-to-speech models, how do their availability, architecture, voice cloning, langua. Article summary: ElevenLabs launched Eleven v4 and Eleven v4 Turbo on September 28, 2026: v4 prioritizes expressive, produced speech, while Turbo trades some emphasis on maximum quality for the speed needed by live voice agents. Together. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Mit dem Start am 28. September 2026 teilt ElevenLabs seine neueste Sprachgenerierung in zwei Optionen auf: Eleven v4 für ausdrucksstarke, produzierte Audioinhalte und Eleven v4 Turbo für Echtzeitanwendungen. Beide unterstützen mehr als 90 Sprachen und Voice Cloning. Die Modelle sind jedoch für unterschiedliche Aufgaben gedacht – und Angaben des Unternehmens zu Qualität und Geschwindigkeit ersetzen keinen Test mit den eigenen Inhalten. 5
11
17
| Eleven v4 | Eleven v4 Turbo | |
|---|---|---|
| Gedacht für | Inhalte, Hörbücher und Figurenstimmen, bei denen die Qualität im Vordergrund steht |
Echtzeitanwendungen, etwa dialogorientierte Agenten und interaktive Spracherlebnisse |
| Schwerpunkt | Ausdrucksstarke Wiedergabe und Kontrolle über das Skript |
Sprachgenerierung mit möglichst geringer Latenz |
| Angegebene Latenz | In den verfügbaren Quellen kein vergleichbarer Wert genannt | Laut ElevenLabs rund 100 ms mediane Inferenzlatenz und rund 150 ms bis zum ersten gesprochenen Wort |
| Sprachen | Mehr als 90 |
Mehr als 90 |
| Verfügbarkeit | ElevenAPI, ElevenAgents und ElevenCreative |
ElevenAPI, ElevenAgents und ElevenCreative |
Wenn Vortrag, Emotion und Kontrolle über das Skript besonders wichtig sind, liegt v4 nahe. Steht die schnelle Reaktion einer Anwendung im Mittelpunkt, ist Turbo die passendere Variante. Die verfügbare Dokumentation beschreibt Turbo als weiterhin hochwertig, aber mit geringerer Latenz. Einen direkten Qualitätsvergleich für sämtliche Einsatzbereiche enthält sie nicht. 17
ElevenLabs beschreibt v4 als Modell mit einer neuen Architektur, die mehr Kontrolle über Tonfall, Tempo, Emotion und Charakter ermöglichen soll. Die öffentlichen Informationen zum Start erläutern diese Ziele, enthalten aber nicht genug technische Details, um die Architektur unabhängig zu beurteilen. 5
10
Ausgebaut wurden auch die sogenannten Inline-Audio-Tags: Mit ihnen lässt sich vorgeben, wie eine Textstelle gesprochen werden soll. ElevenLabs hatte Inline-Tags mit v3 eingeführt. Laut TechCrunch können bei v4 mehrere Tags kombiniert werden; das Modell soll ihrer Reihenfolge folgen. 5 Das gibt beim Skript mehr Regiemöglichkeiten – das Ergebnis sollte dennoch daraufhin geprüft werden, ob es zur gewünschten Sprechweise passt.
Beide neuen Modelle unterstützen mehr als 90 Sprachen. Laut ElevenLabs lässt sich ein Instant Voice Clone bereits mit mindestens zehn Sekunden Audiomaterial erstellen. Professional Voice Clones, die nach Angaben des Unternehmens in v3 nicht unterstützt wurden, sind mit v4 wieder verfügbar. 1
5
11
Für längere Texte soll die Funktion Context Stitching dafür sorgen, dass Tempo und Vortrag über ein Skript beliebiger Länge hinweg gleichmäßig bleiben. Das könnte etwa für Hörbücher und andere längere Produktionen nützlich sein. Es handelt sich dabei jedoch um eine Produktangabe, nicht um einen unabhängigen Nachweis dafür, dass jede Stimme in jedem Projekt konsistent bleibt. 11
ElevenLabs gibt für v4 Turbo eine mediane Inferenzlatenz von etwa 100 ms und eine mediane Zeit bis zum ersten gesprochenen Wort von etwa 150 ms an. Das sind unterschiedliche Messgrößen: Die erste beschreibt die Inferenzlatenz, die zweite die Wartezeit, bis die Sprachausgabe beginnt. Für sich genommen sagt keine der beiden Zahlen aus, wie schnell sich ein vollständiger Austausch mit einem Sprachagenten für Anrufende anfühlt. 11
Bei einem Live-Gespräch hängt die Reaktionszeit auch davon ab, was der Rest des Systems leisten muss: die Spracheingabe verarbeiten, eine Antwort erzeugen und sie über das Netzwerk ausliefern. Die veröffentlichten Werte sind daher nützliche Angaben zum Modell, sollten aber durch Messungen in der konkret geplanten Anwendung ergänzt werden.
Einem Bericht zum Start zufolge setzte Artificial Analysis Eleven v4 in seiner Provider Voice Arena auf Platz eins. Das ist ein Ergebnis für v4 in einer bestimmten Bewertung – kein Beleg dafür, dass das Modell in jeder Sprache, bei jeder Stimme, für lange Texte oder in einem Live-Agenten-Setup vorn liegt. 6 Das Ranking lässt sich auch nicht auf Turbo übertragen: In den verfügbaren Benchmark-Informationen fand sich keine separate, belegte öffentliche Rangliste für v4 Turbo.
18
Cartesia und Inworld gehören zu den weiteren Anbietern, die in Berichten über Echtzeit-Sprachtechnologie behandelt werden. Für einen aussagekräftigen Vergleich sollte man Stimmen und Latenz mit denselben Skripten, Netzwerkbedingungen und Agentenabläufen testen – statt sich allein auf Latenzangaben der Anbieter zu verlassen. 19
Die Aufteilung in zwei Modelle zeigt eine breitere Produktstrategie: ElevenLabs will sowohl Kreative ansprechen, die kontrollierte, ausdrucksstarke Vertonungen suchen, als auch Unternehmen, die Echtzeit-Sprachagenten entwickeln. Das ist ein Signal zur Positionierung des Produkts, aber kein Beleg dafür, dass eines der Modelle den Markt bereits für sich entschieden hat.
Das Unternehmen meldete Anfang 2026 einen annualisierten wiederkehrenden Umsatz (ARR) von mehr als 500 Millionen US-Dollar. Bei einer Finanzierungsrunde im Februar 2026 wurde ElevenLabs mit 11 Milliarden US-Dollar bewertet. 32
33 TechCrunch berichtete später, das Unternehmen bewege sich auf einen ARR von 600 Millionen US-Dollar zu und sei Berichten zufolge mit 22 Milliarden US-Dollar bewertet. Diese gemeldete Bewertung ist nicht mit einer bestätigten neuen Finanzierungsrunde gleichzusetzen. Im selben Bericht wurde ein möglicher Börsengang als Zielsetzung behandelt, nicht als angekündigter Börsengang.
28 TechCrunch bezeichnete außerdem Decagon, einen früheren ElevenLabs-Kunden, als Wettbewerber – ein Beispiel dafür, wie sich der Wettbewerb auch auf kundennahe Sprachprodukte ausdehnt.
28
Für Teams, die die Modelle prüfen, ist die praktische Konsequenz einfach: Zuerst den Einsatzzweck festlegen, dann die konkrete Stimme und den gesamten Ablauf testen. Vergleichen Sie v4 und Turbo mit demselben Skript oder derselben Agentenaufgabe, messen Sie die Ende-zu-Ende-Latenz und prüfen Sie, ob Voice Cloning und die Konsistenz bei längeren Texten Ihren Anforderungen genügen. Der Start macht die Wahl zwischen Ausdruck und Geschwindigkeit klarer – welches Modell im eigenen Projekt besser funktioniert, muss der Test zeigen.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Eleven v4 erschien am 28. September 2026 und ist auf ausdrucksstarke Erzählungen ausgelegt.
Eleven v4 erschien am 28. September 2026 und ist auf ausdrucksstarke Erzählungen ausgelegt. Beide Modelle unterstützen mehr als 90 Sprachen. v4 bietet erweiterte Möglichkeiten zur Steuerung der Sprechweise und unterstützt wieder Professional Voice Clones; Turbo ist die Variante für Echtzeitanwendungen.
Ein gemeldeter Spitzenplatz in einem Ranking bezieht sich auf v4 – nicht automatisch auf Turbo oder auf jede Sprache und jeden Anwendungsfall.