Lewati ke isi

Edisi harian · terbit setiap pagi

Berita AI pilihan, ditulis ulang dalam bahasa Indonesia, setiap pagi.

Kirim tips
Terkini
Tool Builder

VoiceStudio: Alternatif ElevenLabs Open Source yang Jalan di Komputermu Sendiri

Proyek berlisensi AGPL-3.0 ini menangani cloning suara zero-shot dari klip 3 detik, dubbing video, dikte real-time, dan audiobook dalam 646 bahasa — semuanya lokal, tanpa akun dan tanpa API key. Repo-nya sudah dikutip lebih dari 9.700 kali.

Bagikan WhatsApp X LinkedIn Telegram Email
Ilustrasi rubrik Tool Builder: VoiceStudio: Alternatif ElevenLabs Open Source yang Jalan di Komputermu Sendiri
Ilustrasi editorial Jekardah AI News

VoiceStudio — sebelumnya bernama OmniVoice-Studio — memposisikan diri sebagai alternatif open source ElevenLabs. Kemampuannya mencakup dikte real-time, cloning suara zero-shot, dan dubbing video yang mereka sebut sinematik, semuanya berjalan di komputer pengguna. Tidak ada akun, tidak ada API key, dan tidak ada cloud yang terlibat.

Pendekatan itu menjadi pembeda utamanya, dan proyek ini menuliskannya tanpa ragu di README: suara adalah data paling personal yang dimiliki seseorang, jadi mengapa harus menyewanya kembali dari cloud? Argumen mereka, setiap alat suara arus utama mengirim audio ke server orang lain dan menagih biaya bulanan untuk hak itu. VoiceStudio membalik model tersebut: kloning, desain, dubbing, dan dikte dilakukan di perangkat sendiri, tanpa meteran yang berjalan.

Kemampuan teknisnya cukup luas untuk ukuran proyek terbuka. Klip tiga detik sudah cukup untuk meniru sebuah suara secara zero-shot dalam 646 bahasa. Ada Voice Design untuk membangun suara baru dari parameter jenis kelamin, usia, aksen, pitch, emosi, dan dialek; Voice Gallery untuk memilih suara siap pakai dengan filter bahasa; serta alur Video Dubbing end-to-end yang pada contoh resminya mentranskripsi 37 segmen, menerjemahkannya ke Bengali, mengisi ulang suaranya, menyelaraskan waktunya, lalu mengekspor hasilnya sebagai MP4.

Dari sisi rekayasa, halaman pengaturan mesin menampilkan matriks kompatibilitas 14 mesin TTS dengan pemeriksaan awal GPU per mesin — dan menurut proyeknya tidak ada fallback senyap ke CPU. Artinya, kalau GPU tidak memadai, pengguna diberi tahu alih-alih diam-diam mendapat hasil yang lambat. Ada juga penyimpan model sekali-klik yang mendeteksi platform yang dipakai (CUDA, MPS, atau CPU) dan merekomendasikan model yang sesuai.

Popularitasnya terlihat dari angka repositori: lebih dari 9.700 bintang dan hampir 1.600 fork, dengan lisensi AGPL-3.0 dan sepuluh issue terbuka. Proyek ini dibuat pada April 2026 dan kontribusi terbesarnya masih didominasi pembuat aslinya, disertai beberapa kontributor lain — pola umum proyek muda yang sedang tumbuh cepat.

Ada satu catatan yang perlu dibaca sebelum memakainya untuk pekerjaan produksi: statusnya masih beta aktif. Peringatan resmi proyek menyebut hal-hal bisa rusak antar rilis dan menyarankan menjalankan dari sumber untuk mendapatkan perbaikan terbaru. Untuk aplikasi yang bergantung pada suara pelanggan, itu berarti perlu pengujian sendiri sebelum diandalkan, terutama karena lisensi AGPL-3.0 punya konsekuensi tersendiri kalau perangkat lunaknya dipakai sebagai bagian dari layanan berjaringan.

Sumber asli

GitHubgithub.com

Fakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan

Bagikan WhatsApp X LinkedIn Telegram Email

Baca juga