Eleven v4 is bedoeld voor expressieve voice overs en andere producties; v4 Turbo richt zich op toepassingen die snel moeten reageren, zoals spraakassistenten. Beide modellen ondersteunen meer dan 90 talen.
Gepubliceerd doorBewerkt met GPT-6 LunaAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are ElevenLabs’ new Eleven v4 and Eleven v4 Turbo text-to-speech models, how do their availability, architecture, voice cloning, langua. Article summary: ElevenLabs launched Eleven v4 and Eleven v4 Turbo on September 28, 2026: v4 prioritizes expressive, produced speech, while Turbo trades some emphasis on maximum quality for the speed needed by live voice agents. Together. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ElevenLabs lanceerde op 28 september 2026 twee nieuwe spraakmodellen: Eleven v4 voor expressieve, geproduceerde audio en Eleven v4 Turbo voor toepassingen die in realtime moeten reageren. Beide ondersteunen meer dan 90 talen en stemklonen, maar zijn op verschillende gebruikssituaties gericht. De claims over kwaliteit en snelheid zijn bovendien geen vervanging voor testen met je eigen scripts en toepassing. 5
11
17
| Eleven v4 | Eleven v4 Turbo | |
|---|---|---|
| Vooral geschikt voor | Content, luisterboeken en personage-voice-overs waarbij kwaliteit vooropstaat |
Realtime toepassingen, zoals gesprekssystemen en interactieve spraakervaringen |
| Nadruk | Expressieve voordracht en controle over de tekst |
Spraak genereren met lage vertraging |
| Gerapporteerde latency | In de beschikbare bronnen staat geen vergelijkbaar cijfer | Volgens ElevenLabs circa 100 ms mediane inferentielatency en circa 150 ms tot de eerste spraak |
| Talen | Meer dan 90 |
Meer dan 90 |
| Beschikbaar via | ElevenAPI, ElevenAgents en ElevenCreative |
ElevenAPI, ElevenAgents en ElevenCreative |
Kies v4 als toon, emotie en regie over de voordracht belangrijk zijn. Turbo ligt meer voor de hand wanneer een toepassing snel op een gebruiker moet reageren. ElevenLabs zegt dat Turbo hoge kwaliteit combineert met minder vertraging, maar er is geen rechtstreekse kwaliteitsvergelijking beschikbaar voor alle mogelijke toepassingen. 17
ElevenLabs zegt dat v4 op een nieuwe architectuur is gebouwd, met meer controle over toon, tempo, emotie en karakter. De openbare informatie beschrijft vooral wat het model moet kunnen; er is niet genoeg technische uitleg om de architectuur zelf onafhankelijk te beoordelen. 5
10
Ook de mogelijkheden met inline audiotags zijn uitgebreid. Met zulke tags kunnen makers aanwijzingen meegeven over hoe een zin moet klinken. ElevenLabs introduceerde inline tags in v3; TechCrunch meldde dat gebruikers ze in v4 kunnen combineren en in een bepaalde volgorde kunnen laten uitvoeren. 5 Dat geeft meer regie in het script, maar het eindresultaat moet nog steeds worden gecontroleerd op de gewenste voordracht.
Beide nieuwe modellen ondersteunen meer dan 90 talen. Volgens ElevenLabs kun je een Instant Voice Clone maken met slechts 10 seconden audio. Ook Professional Voice Clones zijn terug in v4; volgens het bedrijf werden die in v3 niet ondersteund. 1
5
11
Voor langere teksten moet de functie context stitching helpen om tempo en voordracht door een heel script heen gelijkmatig te houden. Dat kan van pas komen bij luisterboeken en andere lange producties. Het blijft wel een claim van de aanbieder, geen onafhankelijk bewijs dat iedere stem in elk project consistent klinkt. 11
ElevenLabs noemt voor v4 Turbo een mediane inferentielatency van ongeveer 100 ms en een mediane tijd tot de eerste spraak van ongeveer 150 ms. Dat zijn twee verschillende metingen: de ene gaat over de inferentielatency, de andere over de wachttijd voordat de spraak begint. Geen van beide vertelt op zichzelf hoe snel een volledig gesprek met een spraakassistent voor de gebruiker aanvoelt. 11
Bij een live gesprek spelen ook andere onderdelen mee: de audio van de gebruiker verwerken, een antwoord genereren en dat antwoord via het netwerk afleveren. Zie de cijfers daarom als specificaties op modelniveau en meet de totale reactietijd in de toepassing die je wilt gebruiken.
In een lanceringsbericht staat dat Artificial Analysis’ Provider Voice Arena-ranglijst Eleven v4 op de eerste plaats zette. Dat resultaat geldt voor v4 binnen een specifieke evaluatie. Het bewijst niet dat het model in elke taal, met elke stem of bij iedere lange tekst of spraakassistent het beste presteert. 6 Die rangschikking geldt bovendien niet automatisch voor Turbo: in de beschikbare benchmarkinformatie is geen afzonderlijke, publiek onderbouwde rangschikking voor v4 Turbo gevonden.
18
Cartesia en Inworld worden in berichtgeving over realtime spraaktechnologie genoemd als andere aanbieders. Wie modellen vergelijkt, kan daarom het beste dezelfde scripts, netwerkcondities en agent-workflow gebruiken. Zo vergelijk je de stemmen en vertraging onder gelijke omstandigheden, in plaats van alleen af te gaan op claims van leveranciers. 19
De keuze voor twee modellen laat zien hoe ElevenLabs verschillende markten wil bedienen: makers die expressieve, geregisseerde audio zoeken én bedrijven die realtime spraakassistenten bouwen. Dat zegt iets over de productstrategie, maar bewijst niet dat een van beide modellen zijn markt al heeft gewonnen.
ElevenLabs meldde in de eerste maanden van 2026 meer dan 500 miljoen dollar aan jaarlijkse terugkerende omzet (ARR). In februari 2026 werd het bedrijf bij een financieringsronde gewaardeerd op 11 miljard dollar. 32
33 TechCrunch schreef later dat het bedrijf afstevende op 600 miljoen dollar ARR en naar verluidt op 22 miljard dollar werd gewaardeerd. Die gemelde waardering is niet hetzelfde als een bevestigde nieuwe financieringsronde. TechCrunch besprak ook een mogelijke beursgang als ambitie, niet als aangekondigde notering.
28 Het medium noemde Decagon, een voormalige klant van ElevenLabs, bovendien als concurrent — een voorbeeld van hoe concurrentie ook kan ontstaan rond toepassingen voor eindgebruikers.
28
Voor wie de modellen overweegt, is de praktische conclusie simpel: begin bij de toepassing en test daarna de stem en workflow die je daadwerkelijk wilt gebruiken. Vergelijk v4 en Turbo met hetzelfde script of dezelfde agenttaak, meet de reactietijd van begin tot eind en controleer of stemklonen en consistentie bij lange teksten aan je eisen voldoen. De lancering maakt het onderscheid tussen maximale expressie en snelheid duidelijk, maar bepaalt niet welk model voor jouw project het beste werkt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Eleven v4 is bedoeld voor expressieve voice overs en andere producties; v4 Turbo richt zich op toepassingen die snel moeten reageren, zoals spraakassistenten.
Eleven v4 is bedoeld voor expressieve voice overs en andere producties; v4 Turbo richt zich op toepassingen die snel moeten reageren, zoals spraakassistenten. Beide modellen ondersteunen meer dan 90 talen. Volgens ElevenLabs kan een Instant Voice Clone worden gemaakt op basis van slechts 10 seconden audio.
De gemelde latencycijfers en een hoge benchmarkpositie voor v4 zijn geen garantie voor dezelfde prestaties in iedere taal, stem of toepassing.