Diluncurkan pada 28 September 2026, Eleven v4 ditujukan untuk narasi ekspresif, sedangkan v4 Turbo memprioritaskan penggunaan waktu nyata dengan latensi inferensi median sekitar 100 ms. Kedua model mendukung lebih dari 90 bahasa dan kloning suara.
Diterbitkan olehDiedit dengan GPT-6 LunaGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What are ElevenLabs’ new Eleven v4 and Eleven v4 Turbo text-to-speech models, how do their availability, architecture, voice cloning, langua. Article summary: ElevenLabs launched Eleven v4 and Eleven v4 Turbo on September 28, 2026: v4 prioritizes expressive, produced speech, while Turbo trades some emphasis on maximum quality for the speed needed by live voice agents. Together. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Peluncuran ElevenLabs pada 28 September 2026 menghadirkan dua pilihan untuk menghasilkan suara dari teks: Eleven v4 untuk audio yang lebih ekspresif dan terarah, serta Eleven v4 Turbo untuk aplikasi yang membutuhkan respons cepat. Keduanya mendukung lebih dari 90 bahasa dan kloning suara, tetapi dirancang untuk kebutuhan berbeda. Klaim kualitas dan kecepatan saat peluncuran tetap perlu diuji dengan naskah dan alur kerja Anda sendiri. 5
11
17
| Eleven v4 | Eleven v4 Turbo | |
|---|---|---|
| Dirancang untuk | Produksi konten, buku audio, dan pengisi suara karakter—terutama saat kualitas menjadi prioritas |
Penggunaan waktu nyata, seperti agen percakapan dan pengalaman suara interaktif |
| Fokus utama | Ekspresi dan kendali atas penyampaian naskah |
Mengurangi latensi pembuatan suara |
| Angka latensi yang dilaporkan | Tidak ada angka pembanding yang sepadan dalam sumber yang tersedia | Latensi inferensi median sekitar 100 ms; waktu median hingga ucapan pertama sekitar 150 ms, menurut ElevenLabs |
| Dukungan bahasa | Lebih dari 90 bahasa |
Lebih dari 90 bahasa |
| Ketersediaan | ElevenAPI, ElevenAgents, dan ElevenCreative |
ElevenAPI, ElevenAgents, dan ElevenCreative |
Pilih v4 jika ekspresi, emosi, dan kendali atas naskah menjadi pertimbangan utama. Turbo lebih sesuai ketika kecepatan respons penting bagi aplikasi. Dokumentasi ElevenLabs menyebut Turbo tetap menawarkan kualitas tinggi dengan latensi lebih rendah, tetapi sumber yang tersedia tidak menyajikan perbandingan kualitas langsung untuk semua jenis penggunaan. 17
ElevenLabs menyebut v4 memakai arsitektur baru yang dirancang untuk memberi kendali lebih baik atas nada, tempo, emosi, dan karakter suara. Materi peluncuran menjelaskan tujuan tersebut, tetapi belum memberi rincian teknis yang cukup untuk menilai arsitekturnya secara independen. 5
10
Model ini juga memperluas penggunaan inline audio tags, yaitu penanda di dalam naskah untuk mengarahkan cara sebuah baris diucapkan. ElevenLabs memperkenalkan penanda sejenis di v3; menurut TechCrunch, v4 mendukung penggunaan beberapa penanda sekaligus dan dapat mengikuti urutannya. 5 Fitur ini memberi arahan lebih rinci, tetapi hasil suaranya tetap perlu diperiksa agar sesuai dengan performa yang diinginkan.
Kedua model mendukung lebih dari 90 bahasa. ElevenLabs mengatakan Instant Voice Clone dapat dibuat dari rekaman audio sesingkat 10 detik. Professional Voice Clones, yang menurut perusahaan tidak didukung di v3, kembali tersedia di v4. 1
5
11
Untuk naskah panjang, ElevenLabs mengatakan fitur context stitching membantu menjaga tempo dan penyampaian tetap stabil sepanjang naskah. Fitur ini berpotensi berguna untuk buku audio dan produksi berdurasi panjang lainnya, tetapi klaim tersebut berasal dari perusahaan—bukan bukti independen bahwa konsistensi setiap suara terjamin di semua proyek. 11
ElevenLabs melaporkan latensi inferensi median sekitar 100 ms untuk v4 Turbo dan waktu median hingga ucapan pertama sekitar 150 ms. Keduanya mengukur hal berbeda: yang pertama adalah latensi inferensi, sedangkan yang kedua mengacu pada waktu tunggu sebelum suara mulai terdengar. Tidak satu pun angka itu, jika berdiri sendiri, menunjukkan seberapa cepat seluruh percakapan dengan agen suara akan terasa bagi pengguna. 11
Interaksi langsung juga bergantung pada bagian lain dalam sistem: memproses audio pengguna, menyusun jawaban agen, lalu mengirimkannya melalui jaringan. Karena itu, angka latensi yang dipublikasikan berguna sebagai spesifikasi model, tetapi waktu respons sebaiknya diukur lagi dalam aplikasi yang akan digunakan.
Sebuah laporan peluncuran menyebut papan peringkat Provider Voice Arena dari Artificial Analysis menempatkan Eleven v4 di posisi pertama. Hasil itu berlaku untuk v4 dalam evaluasi tertentu; bukan bukti bahwa model tersebut unggul untuk semua bahasa, suara, tugas berdurasi panjang, atau konfigurasi agen langsung. 6 Peringkat itu juga tidak bisa langsung dianggap berlaku untuk Turbo. Informasi tolok ukur yang tersedia tidak mencantumkan evaluasi publik terpisah yang bersumber untuk v4 Turbo.
18
Cartesia dan Inworld juga dibahas dalam liputan tentang perangkat suara waktu nyata. Kehadiran penyedia lain membuat pengujian langsung penting: bandingkan suara dan latensi dengan naskah, kondisi jaringan, serta alur kerja agen yang sama, bukan hanya mengandalkan klaim latensi dari masing-masing vendor. 19
Pemisahan model ini mencerminkan strategi produk yang lebih luas: melayani kreator yang membutuhkan narasi ekspresif dan terkontrol, sekaligus perusahaan yang membangun agen suara waktu nyata. Ini menunjukkan arah produk, bukan bukti bahwa salah satu model sudah memenangkan pasar.
ElevenLabs melaporkan pendapatan berulang tahunan atau ARR lebih dari US$500 juta pada awal 2026, dan putaran pendanaan pada Februari 2026 menilai perusahaan sebesar US$11 miliar. 32
33 TechCrunch kemudian melaporkan bahwa perusahaan berada di jalur menuju ARR US$600 juta dan disebut-sebut memiliki valuasi US$22 miliar. Angka valuasi yang dilaporkan itu tidak boleh disamakan dengan putaran pendanaan baru yang telah dikonfirmasi. Laporan yang sama membahas waktu IPO sebagai ambisi, bukan pencatatan saham yang sudah diumumkan.
28 TechCrunch juga menyebut Decagon—mantan pelanggan ElevenLabs—sebagai pesaing, salah satu contoh persaingan yang merambah produk suara langsung ke pelanggan.
28
Bagi tim yang sedang mempertimbangkan kedua model, langkah praktisnya sederhana: mulai dari kebutuhan penggunaan, lalu uji suara dan alur kerja yang benar-benar akan dipakai. Bandingkan v4 dan Turbo dengan naskah atau tugas agen yang sama, ukur latensi dari awal hingga akhir, dan pastikan fitur kloning maupun konsistensi naskah panjang memenuhi kebutuhan. Peluncuran ini memperjelas pilihan antara kendali kualitas dan kecepatan, tetapi belum menentukan model mana yang paling cocok untuk setiap proyek.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Diluncurkan pada 28 September 2026, Eleven v4 ditujukan untuk narasi ekspresif, sedangkan v4 Turbo memprioritaskan penggunaan waktu nyata dengan latensi inferensi median sekitar 100 ms.
Diluncurkan pada 28 September 2026, Eleven v4 ditujukan untuk narasi ekspresif, sedangkan v4 Turbo memprioritaskan penggunaan waktu nyata dengan latensi inferensi median sekitar 100 ms. Kedua model mendukung lebih dari 90 bahasa dan kloning suara. v4 menambahkan kendali performa yang lebih luas serta menghadirkan kembali Professional Voice Clones.
Peringkat teratas yang dilaporkan berlaku untuk v4, bukan otomatis untuk Turbo atau setiap bahasa dan jenis penggunaan.