Lançado em 28 de setembro de 2026, o Eleven v4 prioriza narrações expressivas; o v4 Turbo foi pensado para agentes de voz em tempo real. Os dois modelos oferecem suporte a mais de 90 idiomas e clonagem de voz.
Publicado porEditado com GPT-6 LunaImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What are ElevenLabs’ new Eleven v4 and Eleven v4 Turbo text-to-speech models, how do their availability, architecture, voice cloning, langua. Article summary: ElevenLabs launched Eleven v4 and Eleven v4 Turbo on September 28, 2026: v4 prioritizes expressive, produced speech, while Turbo trades some emphasis on maximum quality for the speed needed by live voice agents. Together. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
O lançamento de 28 de setembro de 2026 divide a nova geração de síntese de voz da ElevenLabs em duas propostas: Eleven v4 para áudio mais expressivo e produzido e Eleven v4 Turbo para aplicações em tempo real. Os dois modelos atendem a mais de 90 idiomas e oferecem clonagem de voz, mas foram pensados para necessidades diferentes. E, como sempre em lançamentos de IA, vale testar com o próprio conteúdo antes de tomar decisões com base nas promessas de qualidade e velocidade. 5
11
17
| Eleven v4 | Eleven v4 Turbo | |
|---|---|---|
| Indicado para | Criação de conteúdo, audiolivros e vozes de personagens, quando a qualidade é prioridade |
Agentes conversacionais e experiências interativas por voz, que precisam responder em tempo real |
| Foco | Expressividade e controle sobre a interpretação do roteiro |
Menor latência na geração de fala |
| Latência divulgada | As fontes disponíveis não trazem uma medida diretamente comparável | Cerca de 100 ms de latência mediana de inferência e cerca de 150 ms até o início da fala, segundo a ElevenLabs |
| Idiomas | Mais de 90 |
Mais de 90 |
| Disponibilidade | ElevenAPI, ElevenAgents e ElevenCreative |
ElevenAPI, ElevenAgents e ElevenCreative |
Em resumo: escolha o v4 se a interpretação, a emoção e o controle do roteiro forem o mais importante. O Turbo faz mais sentido quando a rapidez de resposta é essencial. A documentação da empresa descreve o Turbo como um modelo de alta qualidade com latência reduzida, mas não apresenta uma comparação de qualidade direta para todos os usos possíveis. 17
A ElevenLabs afirma que o v4 usa uma nova arquitetura para dar mais controle sobre tom, ritmo, emoção e personalidade. Os materiais de lançamento apresentam essa proposta, mas não trazem detalhes técnicos suficientes para avaliar a arquitetura de forma independente. 5
10
Outra novidade está na expansão das audio tags inseridas no texto, que ajudam a orientar a interpretação de uma fala. A empresa introduziu tags inline no v3; segundo a TechCrunch, o v4 permite combinar várias tags e seguir a sequência indicada. 5 Isso dá mais direção ao roteiro, mas ainda é necessário conferir se o resultado corresponde à interpretação desejada.
Os dois modelos aceitam mais de 90 idiomas. A ElevenLabs diz que é possível criar um Instant Voice Clone com apenas 10 segundos de áudio. O Professional Voice Clone, que segundo a empresa não era compatível com o v3, também voltou no v4. 1
5
11
Para textos mais extensos, a empresa afirma que o recurso context stitching ajuda a manter o ritmo e a interpretação consistentes ao longo de roteiros de qualquer tamanho. Isso pode ser útil em audiolivros e outros projetos longos, mas é uma afirmação do fabricante — não uma garantia independente de que toda voz permanecerá uniforme em qualquer produção. 11
A ElevenLabs informa cerca de 100 ms de latência mediana de inferência para o v4 Turbo e aproximadamente 150 ms de tempo mediano até a primeira fala. São medidas diferentes: a primeira se refere à inferência; a segunda, à espera antes de o áudio começar. Nenhuma delas, sozinha, indica quanto tempo uma interação completa com um agente de voz vai parecer levar para quem está ligando. 11
Uma conversa ao vivo também depende de outras etapas, como processar o áudio de quem fala, gerar a resposta do agente e entregá-la pela rede. Por isso, os números publicados servem como referência sobre o modelo; para avaliar a experiência real, é preciso medir a latência de ponta a ponta na aplicação em que ele será usado.
Um relato sobre o lançamento diz que o Eleven v4 ficou em primeiro lugar no ranking Provider Voice Arena, da Artificial Analysis. O resultado vale para o v4 naquela avaliação específica — não prova que ele seja superior em todos os idiomas, vozes, trabalhos longos ou configurações de agentes ao vivo. 6 Esse ranking também não deve ser atribuído ao Turbo: as informações de benchmark disponíveis não identificam uma avaliação pública equivalente para esse modelo.
18
Cartesia e Inworld também aparecem em coberturas sobre ferramentas de voz em tempo real. Para comparar as opções, faz mais sentido testar as vozes e a latência com os mesmos roteiros, condições de rede e fluxos de uso do que se apoiar apenas nos números divulgados por cada empresa. 19
A divisão entre v4 e Turbo aponta para uma estratégia de produto mais ampla: atender tanto criadores que buscam narrações controladas e expressivas quanto empresas que desenvolvem agentes de voz em tempo real. Isso mostra como a empresa se posiciona, mas não comprova que qualquer um dos modelos já tenha vencido seu mercado.
A ElevenLabs informou ter ultrapassado US$ 500 milhões em receita recorrente anual no início de 2026. Em fevereiro do mesmo ano, uma rodada de investimento avaliou a empresa em US$ 11 bilhões. 32
33 Mais tarde, a TechCrunch relatou que a companhia estava avançando a um ritmo equivalente a US$ 600 milhões em receita recorrente anual e que sua avaliação teria chegado a US$ 22 bilhões. Esse valor reportado não deve ser confundido com uma nova rodada de investimento confirmada. A publicação também mencionou uma possível abertura de capital como uma ambição, não como uma listagem anunciada.
28
A TechCrunch ainda descreveu a Decagon, antiga cliente da ElevenLabs, como concorrente — um exemplo de como a disputa também pode envolver produtos de voz voltados ao cliente final. 28
Para quem está avaliando os modelos, o caminho mais prático é começar pelo uso pretendido e testar a voz e o fluxo de trabalho específicos. Compare v4 e Turbo com o mesmo roteiro ou tarefa de agente, meça a latência de ponta a ponta e confira se a clonagem e a consistência em textos longos atendem ao projeto. O lançamento deixa clara a escolha entre qualidade e velocidade; não determina qual modelo terá o melhor desempenho no seu caso.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Lançado em 28 de setembro de 2026, o Eleven v4 prioriza narrações expressivas; o v4 Turbo foi pensado para agentes de voz em tempo real.
Lançado em 28 de setembro de 2026, o Eleven v4 prioriza narrações expressivas; o v4 Turbo foi pensado para agentes de voz em tempo real. Os dois modelos oferecem suporte a mais de 90 idiomas e clonagem de voz. A ElevenLabs diz que um Instant Voice Clone pode ser criado com apenas 10 segundos de áudio.
A latência divulgada para o Turbo é de cerca de 100 ms na inferência, mas esse número não mede o tempo total de uma conversa com um agente.