Lancé le 28 septembre 2026, Eleven v4 privilégie la qualité et l’expressivité, tandis que v4 Turbo vise les agents vocaux en temps réel et affiche environ 100 ms de latence médiane d’inférence. Les deux modèles prennent en charge plus de 90 langues et le clonage vocal.
Publié parModifié avec GPT-6 LunaImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What are ElevenLabs’ new Eleven v4 and Eleven v4 Turbo text-to-speech models, how do their availability, architecture, voice cloning, langua. Article summary: ElevenLabs launched Eleven v4 and Eleven v4 Turbo on September 28, 2026: v4 prioritizes expressive, produced speech, while Turbo trades some emphasis on maximum quality for the speed needed by live voice agents. Together. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Le 28 septembre 2026, ElevenLabs a décliné sa nouvelle génération de synthèse vocale en deux modèles : Eleven v4 pour produire des voix expressives et Eleven v4 Turbo pour les applications en temps réel. Tous deux prennent en charge plus de 90 langues et le clonage vocal. Leur différence tient surtout à l’usage visé — et les chiffres annoncés au lancement ne remplacent pas des essais avec vos propres contenus. 5
11
17
| Eleven v4 | Eleven v4 Turbo | |
|---|---|---|
| Pensé pour | La création de contenu, les livres audio et les voix de personnages, lorsque la qualité prime |
Les usages en temps réel, notamment les agents conversationnels et les expériences vocales interactives |
| Priorité | L’expressivité et le contrôle de l’interprétation d’un texte |
Une génération vocale à faible latence |
| Latence annoncée | Aucune mesure comparable n’est citée dans les sources disponibles | Environ 100 ms de latence médiane d’inférence et 150 ms avant la première parole, selon ElevenLabs |
| Langues | Plus de 90 |
Plus de 90 |
| Disponibilité | ElevenAPI, ElevenAgents et ElevenCreative |
ElevenAPI, ElevenAgents et ElevenCreative |
Choisissez v4 si le rendu, l’émotion et la maîtrise d’un texte sont au premier plan. Turbo est davantage adapté lorsque la rapidité de réponse est essentielle. La documentation présente Turbo comme un modèle de grande qualité à latence réduite, mais ne fournit pas de comparaison directe de qualité pour tous les usages. 17
ElevenLabs présente v4 comme un modèle reposant sur une nouvelle architecture, conçue pour mieux contrôler le ton, le rythme, l’émotion et le caractère d’une voix. Les informations publiques décrivent ces objectifs sans donner assez de détails techniques pour évaluer l’architecture indépendamment. 5
10
Le modèle enrichit aussi les balises audio intégrées au texte, qui permettent d’indiquer comment une réplique doit être dite. ElevenLabs avait introduit ces balises avec v3 ; selon TechCrunch, v4 permet d’en combiner plusieurs et de respecter leur séquence. 5 C’est un moyen de guider plus finement l’interprétation, mais le résultat doit toujours être vérifié par rapport au rendu souhaité.
Les deux modèles prennent en charge plus de 90 langues. ElevenLabs indique qu’un Instant Voice Clone peut être créé à partir de seulement 10 secondes d’audio. Les Professional Voice Clones, qui n’étaient pas pris en charge par v3 selon l’entreprise, font leur retour avec v4. 1
5
11
Pour les textes longs, ElevenLabs affirme que sa fonction context stitching aide à conserver un rythme et une interprétation réguliers sur un script de toute longueur. Cela pourrait être utile pour les livres audio et d’autres formats longs, mais il s’agit d’une promesse produit, et non d’une preuve indépendante que la voix reste cohérente dans tous les projets. 11
ElevenLabs annonce pour v4 Turbo environ 100 ms de latence médiane d’inférence et environ 150 ms de délai médian avant la première parole. Ce sont deux mesures différentes : la première concerne la latence d’inférence, la seconde le temps d’attente avant que la voix commence. À elles seules, ni l’une ni l’autre ne permettent de savoir à quelle vitesse une conversation complète avec un agent vocal semblera se dérouler. 11
Une interaction en direct dépend aussi du traitement de la voix de l’appelant, de la génération de la réponse de l’agent et de son acheminement sur le réseau. Ces chiffres sont donc des indications utiles sur le modèle ; pour évaluer un déploiement, il faut mesurer la latence de bout en bout dans l’application concernée.
Un article consacré au lancement rapporte que le classement Provider Voice Arena d’Artificial Analysis a placé Eleven v4 en première position. Ce résultat concerne v4 dans le cadre d’une évaluation particulière : il ne démontre pas une supériorité dans toutes les langues, avec toutes les voix, pour les contenus longs ou dans les configurations d’agents vocaux en direct. 6 Ce classement ne doit pas être attribué à Turbo : les informations de benchmark disponibles ne font pas état d’une évaluation publique distincte et sourcée pour v4 Turbo.
18
Cartesia et Inworld figurent parmi les autres fournisseurs évoqués dans les comparatifs d’outils vocaux en temps réel. Pour les départager, mieux vaut tester les voix et la latence avec les mêmes textes, les mêmes conditions réseau et le même parcours d’agent, plutôt que de s’en tenir aux chiffres communiqués par les fournisseurs. 19
La distinction entre les deux modèles illustre une stratégie produit plus large : répondre aux besoins des créateurs qui veulent une narration expressive et maîtrisée, tout en visant les entreprises qui développent des agents vocaux en temps réel. Cela indique un positionnement, pas une victoire acquise sur l’un ou l’autre marché.
L’entreprise a annoncé avoir dépassé les 500 millions de dollars de revenus récurrents annualisés au début de 2026. Son tour de financement de février 2026 l’a valorisée à 11 milliards de dollars. 32
33 TechCrunch a ensuite rapporté qu’ElevenLabs avançait à un rythme correspondant à 600 millions de dollars de revenus récurrents annualisés et que sa valorisation serait désormais de 22 milliards de dollars. Cette valorisation rapportée ne doit pas être confondue avec un nouveau tour de financement confirmé. Le même article évoque une éventuelle introduction en Bourse comme une ambition, et non comme une cotation annoncée.
28 TechCrunch décrit également Decagon, ancien client d’ElevenLabs, comme un concurrent : un exemple de la concurrence qui s’étend aux produits vocaux destinés aux utilisateurs.
28
Pour choisir, partez donc de votre usage, puis testez la voix et le parcours réels. Comparez v4 et Turbo sur le même texte ou la même tâche d’agent, mesurez la latence de bout en bout et vérifiez que le clonage et la cohérence sur les contenus longs répondent à vos besoins. Le lancement dessine un choix clair entre priorité à la qualité et priorité à la vitesse ; il ne permet pas, à lui seul, de savoir quel modèle conviendra le mieux à votre projet.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Lancé le 28 septembre 2026, Eleven v4 privilégie la qualité et l’expressivité, tandis que v4 Turbo vise les agents vocaux en temps réel et affiche environ 100 ms de latence médiane d’inférence.
Lancé le 28 septembre 2026, Eleven v4 privilégie la qualité et l’expressivité, tandis que v4 Turbo vise les agents vocaux en temps réel et affiche environ 100 ms de latence médiane d’inférence. Les deux modèles prennent en charge plus de 90 langues et le clonage vocal. v4 ajoute des contrôles de jeu plus détaillés et rétablit les Professional Voice Clones.
La première place attribuée à v4 dans un classement rapporté ne signifie pas que Turbo domine, ni que v4 est supérieur dans toutes les langues et tous les usages.