ElevenLabs가 2026년 9월 28일 새 음성 생성 모델 두 가지를 공개했습니다. Eleven v4는 표현과 대본 연출에 무게를 둔 모델, Eleven v4 Turbo는 실시간 음성 응답을 겨냥한 모델입니다. 두 모델 모두 90개 이상의 언어와 음성 복제를 지원하지만, 쓰임새는 다릅니다. 출시 당시 공개된 성능 수치만으로 실제 프로젝트에서의 품질이나 체감 속도를 단정하기는 어렵습니다.
5
11
17
Eleven v4와 v4 Turbo 한눈에 보기
| 항목 |
Eleven v4 |
Eleven v4 Turbo |
| 주요 용도 |
콘텐츠 제작, 오디오북, 캐릭터 음성처럼 결과물의 완성도가 중요한 작업 17 |
대화형 에이전트와 인터랙티브 음성 서비스 등 실시간 사용 17 |
| 강조점 |
대본의 감정과 말투, 전달 방식을 세밀하게 조정 5 11 |
음성을 빠르게 생성해 응답 지연을 줄이는 데 초점 1 11 |
| 공개된 지연 시간 |
비교 가능한 수치가 제공된 자료에 없음 |
중앙값 추론 지연 시간 약 100ms, 첫 음성 출력까지 약 150ms라고 ElevenLabs가 밝힘 11 |
| 언어 지원 |
90개 이상 1 11 |
90개 이상 1 |
| 제공처 |
ElevenAPI, ElevenAgents, ElevenCreative 2 10 |
ElevenAPI, ElevenAgents, ElevenCreative 2 10 |
대본의 감정 표현과 연출이 우선이라면 v4, 음성 에이전트가 빠르게 응답해야 한다면 Turbo부터 살펴볼 만합니다. ElevenLabs는 Turbo가 짧은 지연 시간과 높은 품질을 함께 제공한다고 설명하지만, 모든 작업 조건에서 두 모델의 품질을 직접 비교한 자료까지 공개된 것은 아닙니다.
17
v4의 변화: 표현 조절, 음성 복제, 긴 대본
ElevenLabs는 v4에 새로운 아키텍처를 적용해 말투와 속도, 감정, 캐릭터 표현을 더 잘 조절할 수 있도록 했다고 설명합니다. 다만 공개된 출시 자료만으로는 아키텍처의 구체적인 기술 내용을 독립적으로 평가하기 어렵습니다.
5
10
대본 안에 넣는 인라인 오디오 태그도 확장됐습니다. 태그는 특정 대사를 어떤 분위기나 방식으로 읽을지 지정하는 기능입니다. TechCrunch에 따르면 ElevenLabs는 v3에서 인라인 태그를 도입했고, v4에서는 여러 태그를 함께 쓰거나 태그의 순서를 반영할 수 있도록 했습니다.
5 연출 의도를 더 구체적으로 전달할 수 있지만, 실제 음성이 기대한 결과와 맞는지는 직접 확인해야 합니다.
두 모델 모두 90개 이상의 언어를 지원합니다. ElevenLabs는 10초 분량의 오디오만으로도 인스턴트 음성 복제를 만들 수 있다고 밝혔습니다. 또 v3에서는 지원하지 않았던 프로페셔널 음성 복제 기능이 v4에서 다시 제공됩니다.
1
5
11
긴 대본에서는 컨텍스트 스티칭(context stitching) 기능이 문맥을 이어 받아 말의 흐름과 전달 방식을 유지하도록 돕는다고 회사는 설명합니다. 오디오북처럼 분량이 긴 작업에 유용할 수 있지만, 모든 음성과 프로젝트에서 일관된 결과가 나온다는 독립적인 검증을 뜻하지는 않습니다.
11
Turbo의 지연 시간, 무엇을 뜻하나
ElevenLabs가 공개한 v4 Turbo의 중앙값 추론 지연 시간은 약 100ms, 첫 음성 출력까지 걸리는 중앙값은 약 150ms입니다. 두 수치는 서로 다른 측정값입니다. 하나는 추론 지연 시간을, 다른 하나는 음성이 나오기 시작하기까지의 시간을 가리킵니다. 어느 쪽도 그 자체로 음성 에이전트와의 대화가 얼마나 빠르게 느껴질지 모두 설명하지는 않습니다.
11
실시간 대화에서는 상대방 음성 처리, 에이전트 답변 생성, 네트워크 전송도 함께 이뤄집니다. 따라서 공개된 수치는 모델 자체를 파악하는 참고 자료로 보고, 실제 도입을 검토할 때는 운영할 서비스 안에서 응답이 시작되고 끝나는 시간까지 측정하는 편이 좋습니다.
품질과 경쟁력을 보여주는 근거는 어디까지일까
출시 관련 보도에 따르면 Artificial Analysis의 Provider Voice Arena 순위에서 Eleven v4가 1위를 기록했습니다. 이는 특정 평가에서 나온 v4의 결과이지, 모든 언어와 음성, 장문 작업, 실시간 에이전트 환경에서 앞선다는 뜻은 아닙니다.
6 이 순위를 Turbo에 그대로 적용해서도 안 됩니다. 확인 가능한 자료에서는 v4 Turbo의 별도 공개 벤치마크 결과를 찾기 어렵습니다.
18
실시간 음성 도구 분야에서는 Cartesia와 Inworld도 경쟁 업체로 거론됩니다. 실제로 비교할 때는 업체가 제시한 지연 시간만 볼 게 아니라 동일한 대본과 네트워크 조건, 에이전트 작업 흐름에서 음성 품질과 응답 속도를 시험해야 합니다.
19
이번 출시가 보여주는 ElevenLabs의 전략
두 모델을 나눈 것은 콘텐츠 제작자에게는 세밀한 음성 연출을, 기업에는 실시간 음성 에이전트를 제공하려는 제품 전략으로 볼 수 있습니다. 다만 이는 시장 공략 방향을 보여주는 것이지, 어느 한쪽에서 이미 승리했다는 증거는 아닙니다.
회사는 2026년 초 연간 반복 매출(ARR)이 5억 달러를 넘었다고 밝혔고, 2026년 2월 투자 유치 당시 기업가치는 110억 달러로 평가됐습니다.
32
33 TechCrunch는 이후 회사의 ARR이 6억 달러 수준으로 향하고 있다고 전했으며, 기업가치가 220억 달러에 이른다는 보도도 소개했습니다. 보도된 기업가치를 확정된 신규 투자 유치와 혼동해서는 안 됩니다. 같은 인터뷰에서 다뤄진 기업공개(IPO) 시점도 회사가 상장을 발표했다는 의미가 아니라 목표에 관한 이야기였습니다.
28 TechCrunch는 과거 ElevenLabs 고객이었던 Decagon이 이제 경쟁 관계에 있다고 전했습니다. 이는 고객 접점의 음성 제품 분야에서도 경쟁이 이어지고 있음을 보여주는 사례입니다.
28
모델을 고르는 실용적인 기준은 간단합니다. 먼저 만들려는 결과물이나 서비스의 용도를 정한 뒤, 실제 사용할 음성과 작업 흐름을 시험하세요. 같은 대본이나 에이전트 작업을 v4와 Turbo에 적용해 보고, 서비스 전체의 응답 시간을 재며, 음성 복제와 장문 일관성이 요구 수준에 맞는지 확인하는 것이 좋습니다. 이번 출시는 품질 중심 모델과 속도 중심 모델의 구분을 분명히 했지만, 어느 쪽이 여러분의 프로젝트에서 더 나은지는 직접 테스트해야 알 수 있습니다.