ElevenLabs Rilis v4 dan v4 Turbo: Kloning Suara 10 Detik, Lebih dari 90 Bahasa
ElevenLabs meluncurkan dua model suara baru, v4 dan v4 Turbo, dengan klaim kontrol ekspresi yang lebih halus, latensi lebih rendah, dan dukungan lebih dari 90 bahasa. Kloning suara kini cukup dari 10 detik audio. Lini ini diposisikan untuk agen suara perusahaan, termasuk menangani eskalasi dan jeda tahan.
ElevenLabs meluncurkan dua model suara baru pada Senin, 28 September 2026, yaitu ElevenLabs v4 dan v4 Turbo. Keduanya dibangun di atas arsitektur generasi baru yang menekankan dua hal sekaligus: kendali atas cara sebuah baris diucapkan, dan kecepatan proses kloning suara. Menurut pengumuman perusahaan, sebuah suara kini bisa dikloning hanya dengan 10 detik audio, jauh lebih singkat daripada generasi sebelumnya yang menuntut lebih banyak contoh rekaman. Model v3 diluncurkan tahun lalu, dan versi v4 sebenarnya sudah dicicip-cicip dalam sebuah acara di Warsawa pada awal 2026.
Dari sisi bahasa, generasi v3 mendukung 70 bahasa dan angka itu naik menjadi lebih dari 90 bahasa di v4. ElevenLabs menyebut lompatan kualitas terbesar terjadi pada bahasa Jepang, Portugis Brasil, Mandarin, dan Kanton. Pada sisi kreatif, model baru ini lebih mampu menjaga identitas suara pada potongan teks yang panjang, serta membaca konteks kalimat untuk mengubah ekspresi saat membacakan sesuatu. Tag ekspresi sebaris yang diperkenalkan di v3 diperluas di v4: pengguna bisa menumpuk beberapa tag sekaligus dan model diminta mengikuti urutannya.
Untuk agen suara, v4 Turbo diposisikan sebagai pilihan berlatensi rendah agar percakapan berjalan lebih mengalir. Model dapat mulai menghasilkan audio begitu model bahasa di belakangnya mulai menyusun jawaban, dan diklaim mampu menangani keberatan, eskalasi, serta jeda tahan dengan cara berbeda supaya penyelesaian masalah lebih mulus. Sisi bisnisnya ikut diungkap: lebih dari 55 persen pendapatan ElevenLabs kini berasal dari perusahaan besar, dan laju pendapatan tahunannya naik dari sekitar 330 juta dolar AS di awal tahun menjadi di atas 600 juta dolar AS. Perusahaan juga mengumpulkan 500 juta dolar AS dari Sequoia pada awal tahun dengan valuasi 11 miliar dolar AS, sementara rumor putaran lanjutan menyebut angka valuasi 22 miliar dolar AS. Jumlah karyawannya kini melewati 800 orang.
Persaingan model suara memang memanas. Cartesia, Deepgram, Fish Audio, Boson, dan WellSaid Labs menggarap model ekspresif, sementara Google dan OpenAI terus memperbaiki model suara mereka. Bagi pembaca di Indonesia, implikasinya praktis: dua variabel utama yang menentukan apakah hasil dubbing atau voice-over terdengar wajar bagi pendengar lokal adalah cakupan bahasa dan kendali atas ekspresi, bukan sekadar kejernihan suara. Kloning dari 10 detik audio juga menurunkan biaya produksi konten suara yang dipersonalisasi, misalnya narasi per nasabah atau materi pemasaran dengan beberapa variasi suara, karena jumlah bahan rekaman yang harus dikumpulkan jauh lebih sedikit.
Sumber asli
TechCrunchtechcrunch.comFakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan
