Ra mắt ngày 28/9/2026, Eleven v4 hướng đến giọng đọc giàu biểu cảm; v4 Turbo tập trung vào ứng dụng trực tiếp với độ trễ suy luận trung vị khoảng 100 ms theo ElevenLabs. Cả hai hỗ trợ hơn 90 ngôn ngữ.
Đăng bởiBiên tập bằng GPT-6 LunaHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What are ElevenLabs’ new Eleven v4 and Eleven v4 Turbo text-to-speech models, how do their availability, architecture, voice cloning, langua. Article summary: ElevenLabs launched Eleven v4 and Eleven v4 Turbo on September 28, 2026: v4 prioritizes expressive, produced speech, while Turbo trades some emphasis on maximum quality for the speed needed by live voice agents. Together. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ElevenLabs ra mắt hai mô hình tạo giọng nói mới ngày 28/9/2026: Eleven v4 dành cho âm thanh được sản xuất, trau chuốt, còn Eleven v4 Turbo hướng đến ứng dụng thời gian thực. Cả hai hỗ trợ hơn 90 ngôn ngữ và có khả năng sao chép giọng nói, nhưng phục vụ những nhu cầu khác nhau. Các tuyên bố về chất lượng và tốc độ lúc ra mắt cũng chưa thay thế được việc thử nghiệm trên nội dung và hệ thống thực tế của bạn. 5
11
17
| Eleven v4 | Eleven v4 Turbo | |
|---|---|---|
| Phù hợp với | Sáng tạo nội dung, sách nói và lồng tiếng nhân vật khi chất lượng là ưu tiên |
Ứng dụng thời gian thực như tác nhân hội thoại và trải nghiệm tương tác bằng giọng nói |
| Điểm nhấn | Cách đọc giàu biểu cảm, khả năng điều khiển phần thể hiện trong kịch bản |
Tạo giọng nói với độ trễ thấp |
| Độ trễ được công bố | Các nguồn hiện có không nêu số liệu tương đương để đối chiếu | Độ trễ suy luận trung vị khoảng 100 ms; thời gian trung vị đến khi bắt đầu phát lời khoảng 150 ms, theo ElevenLabs |
| Ngôn ngữ hỗ trợ | Hơn 90 ngôn ngữ |
Hơn 90 ngôn ngữ |
| Nền tảng cung cấp | ElevenAPI, ElevenAgents và ElevenCreative |
ElevenAPI, ElevenAgents và ElevenCreative |
Nếu ưu tiên giọng đọc, cảm xúc và khả năng kiểm soát kịch bản, hãy bắt đầu với v4. Nếu ứng dụng cần phản hồi nhanh, Turbo là lựa chọn đáng thử. Tài liệu mô tả Turbo vẫn có chất lượng cao trong khi giảm độ trễ, nhưng không đưa ra phép so sánh chất lượng trực tiếp cho mọi tình huống sử dụng. 17
ElevenLabs cho biết v4 dùng kiến trúc mới nhằm tăng khả năng điều chỉnh tông giọng, nhịp đọc, cảm xúc và tính cách nhân vật. Tài liệu ra mắt mô tả mục tiêu này, nhưng chưa cung cấp đủ chi tiết kỹ thuật để đánh giá độc lập chính kiến trúc. 5
10
Mô hình cũng mở rộng khả năng dùng thẻ âm thanh nội tuyến trong kịch bản để định hướng cách đọc một câu thoại. ElevenLabs từng giới thiệu thẻ nội tuyến ở v3; TechCrunch cho biết v4 cho phép xếp chồng nhiều thẻ và để mô hình làm theo trình tự đó. 5 Cách này giúp người làm nội dung chỉ dẫn cụ thể hơn, nhưng vẫn cần nghe lại để bảo đảm phần thể hiện đúng ý đồ.
Cả hai mô hình mới hỗ trợ hơn 90 ngôn ngữ. ElevenLabs cho biết có thể tạo Instant Voice Clone chỉ từ 10 giây âm thanh. Professional Voice Clones — tính năng mà công ty nói v3 không hỗ trợ — cũng trở lại trong v4. 1
5
11
Với kịch bản dài, ElevenLabs cho biết tính năng context stitching giúp duy trì nhịp đọc và cách thể hiện ổn định xuyên suốt văn bản dài bất kỳ. Điều này có thể hữu ích cho sách nói và các dự án dài hơi, nhưng đây là tuyên bố của nhà cung cấp, không phải bằng chứng độc lập rằng mọi giọng đọc đều nhất quán trong mọi dự án. 11
ElevenLabs công bố độ trễ suy luận trung vị của v4 Turbo vào khoảng 100 ms, và thời gian trung vị đến khi bắt đầu phát lời khoảng 150 ms. Đây là hai phép đo khác nhau: một đo độ trễ suy luận, một đo thời gian chờ trước khi giọng nói bắt đầu. Tự thân các con số này không cho biết toàn bộ tương tác với một tác nhân giọng nói sẽ nhanh đến mức nào đối với người gọi. 11
Một cuộc hội thoại trực tiếp còn phụ thuộc vào các khâu khác: xử lý âm thanh đầu vào, tạo câu trả lời của tác nhân và truyền âm thanh qua mạng. Vì vậy, hãy xem số liệu công bố như thông số ở cấp mô hình, rồi đo độ trễ đầu-cuối trong chính ứng dụng dự định triển khai.
Một bài viết về đợt ra mắt cho biết bảng xếp hạng Provider Voice Arena của Artificial Analysis đưa Eleven v4 lên vị trí số 1. Đây là kết quả của v4 trong một bài đánh giá cụ thể, không chứng minh mô hình đứng đầu ở mọi ngôn ngữ, giọng đọc, tác vụ dài hay cấu hình tác nhân trực tiếp. 6 Không nên áp dụng thứ hạng này cho Turbo: thông tin benchmark hiện có chưa xác định được một đánh giá công khai, có nguồn riêng cho v4 Turbo.
18
Cartesia và Inworld cũng được nhắc đến trong các bài viết về công cụ giọng nói thời gian thực. Có nhiều nhà cung cấp để so sánh càng khiến việc thử nghiệm trực tiếp trở nên quan trọng: hãy dùng cùng kịch bản, điều kiện mạng và quy trình tác nhân, thay vì chỉ dựa vào số liệu độ trễ do từng hãng công bố. 19
Việc tách sản phẩm thành hai hướng phản ánh chiến lược rộng hơn: phục vụ nhà sáng tạo cần lời thoại biểu cảm, có kiểm soát, đồng thời nhắm đến doanh nghiệp xây dựng tác nhân giọng nói thời gian thực. Đây là tín hiệu về định vị sản phẩm, chưa phải bằng chứng rằng một trong hai mô hình đã thắng thị trường.
ElevenLabs cho biết doanh thu định kỳ hằng năm (ARR) vượt 500 triệu USD trong những tháng đầu năm 2026; vòng gọi vốn tháng 2/2026 định giá công ty ở mức 11 tỷ USD. 32
33 Sau đó, TechCrunch đưa tin công ty đang trên đà đạt ARR 600 triệu USD và được cho là có mức định giá 22 tỷ USD. Mức định giá được đưa tin này không đồng nghĩa với một vòng gọi vốn mới đã được xác nhận. Bài viết cũng đề cập thời điểm IPO như một mục tiêu, chứ không phải kế hoạch niêm yết đã công bố.
28 TechCrunch còn mô tả Decagon — một khách hàng cũ của ElevenLabs — là đối thủ cạnh tranh, cho thấy cạnh tranh đang mở rộng sang các sản phẩm giọng nói hướng đến khách hàng.
28
Với nhóm đang đánh giá hai mô hình, cách tiếp cận thực tế nhất là bắt đầu từ nhu cầu rồi thử đúng giọng đọc và quy trình dự định sử dụng. So sánh v4 với Turbo trên cùng một đoạn thoại hoặc tác vụ của tác nhân, đo độ trễ đầu-cuối và kiểm tra xem khả năng sao chép giọng cũng như độ ổn định ở nội dung dài có đáp ứng yêu cầu hay không. Đợt ra mắt cho thấy lựa chọn rõ ràng giữa ưu tiên chất lượng và ưu tiên tốc độ; mô hình nào phù hợp nhất vẫn cần được kiểm chứng trong dự án cụ thể.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ra mắt ngày 28/9/2026, Eleven v4 hướng đến giọng đọc giàu biểu cảm; v4 Turbo tập trung vào ứng dụng trực tiếp với độ trễ suy luận trung vị khoảng 100 ms theo ElevenLabs.
Ra mắt ngày 28/9/2026, Eleven v4 hướng đến giọng đọc giàu biểu cảm; v4 Turbo tập trung vào ứng dụng trực tiếp với độ trễ suy luận trung vị khoảng 100 ms theo ElevenLabs. Cả hai hỗ trợ hơn 90 ngôn ngữ. v4 bổ sung khả năng điều khiển cách thể hiện và hỗ trợ lại Professional Voice Clones, còn Turbo là lựa chọn dành cho phản hồi nhanh.
Thứ hạng đầu bảng được công bố là kết quả của v4, không thể mặc nhiên áp dụng cho Turbo hoặc mọi ngôn ngữ và tình huống sử dụng.