Qwen-Audio-3.1: lima model audio, obrolan dupleks penuh, dan potongan harga sampai 95 persen
Tim Qwen milik Alibaba merilis Qwen-Audio-3.1, satu set lima model audio yang mencakup pengenalan ucapan, sintesis suara, dan interaksi waktu nyata. Model utamanya, Qwen-Audio-3.1-Realtime, adalah model suara dupleks penuh untuk agen suara yang perlu memanggil alat di tengah percakapan. Harganya dipotong sekitar 85 persen untuk Realtime, 70 persen untuk TTS, dan sampai 95 persen untuk ASR.
Tim Qwen milik Alibaba merilis Qwen-Audio-3.1, satu set lima model audio yang mencakup pengenalan ucapan (ASR), sintesis suara (TTS), dan interaksi waktu nyata. Yang paling banyak dibahas adalah Qwen-Audio-3.1-Realtime, sebuah sistem suara dupleks penuh yang dirancang untuk agen suara yang perlu memanggil alat di tengah percakapan. Pemotongan harganya besar dan berlaku menyeluruh: sekitar 85 persen untuk Realtime, sekitar 70 persen untuk sintesis suara, dan sampai 95 persen untuk pengenalan ucapan otomatis.
Tidak satu pun dirilis sebagai bobot terbuka. Qwen menjalankannya sebagai API terkelola, dengan qwen-audio-3.1-realtime-plus tersedia di QwenCloud melalui WebSocket. Spesifikasi yang tercantum di halaman modelnya: konteks 262 ribu token, masukan maksimum 245 ribu token, keluaran maksimum 16 ribu token, dan pembatasan bawaan 60 permintaan serta 100 ribu token per menit. Tarifnya 6,4 dolar per juta token untuk masukan audio, 0,8 dolar untuk masukan teks, dan 24 dolar untuk keluaran gabungan teks serta audio, sedangkan keluaran teks sendiri gratis. Function calling, pencarian web, structured output, penyimpanan konteks, dan fine-tuning sudah tersedia di dalamnya.
Yang membedakan Realtime bukan label harganya, melainkan cara Qwen memecah tugas bercakap menjadi dua sistem yang bekerja bersamaan. Keputusan giliran bicara dipisahkan dari penyusunan kalimat: ada bagian yang khusus menentukan kapan agen harus bicara dan kapan harus diam, terpisah dari bagian yang memutuskan apa isi jawabannya. Pendekatan itu menyasar keluhan paling umum soal agen suara, yaitu mereka tidak tahu kapan harus berhenti berbicara. Bagi pengembang, memisahkan kapan bicara dari apa yang dikatakan adalah cara praktis agar agen tidak memotong ucapan nasabah saat memanggil alat.
Model kedua, Qwen-Audio-3.1-ASR-Flash-Filetrans, menangani transkripsi berkas audio panjang secara offline, dengan dukungan kata kunci khusus atau hot words, pemisahan pembicara, dan dialek Tionghoa. Kombinasi ini membuka pemakaian untuk transkripsi rapat, rekaman layanan pelanggan, dan arsip audio berdurasi panjang. Pada pekerjaan seperti itu, penurunan tarif pengenalan ucapan sampai 95 persen adalah angka yang langsung mengubah perhitungan biaya per jam audio yang diproses.
Ada catatan penting untuk yang bekerja dengan data nasabah. Tanpa bobot terbuka, yang didapat pengembang adalah perilaku model, bukan isi perutnya, dan audio tetap dikirim ke infrastruktur QwenCloud. Untuk rekaman yang memuat data pribadi, penilaian privasi dan lokasi pemrosesan tetap harus dilakukan lebih dahulu, sejalan dengan kewajiban pelindungan data yang berlaku. Arah kompetisinya juga jelas: Qwen berlomba pada biaya dan latensi infrastruktur suara melawan OpenAI dan Google, bukan pada keterbukaan, sehingga pilihan bagi pembangun layanan suara hari ini adalah harga murah dengan data di luar, atau biaya sendiri dengan kendali penuh.
Fakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan