Qwen rilis Image-2.1-Turbo, model gambar 7B yang selesai dalam 8 langkah
Alibaba Qwen merilis Qwen-Image-2.1-Turbo pada 9 Oktober 2026 di Hugging Face dan ModelScope dengan bobot terbuka. Turbo adalah checkpoint percepatan dari Qwen-Image-2.1 yang membuat dan menyunting gambar dalam 8 langkah denoising, bukan 40 langkah seperti konfigurasi bawaan model dasar, pada arsitektur visual 7B yang sama. API Pro dan Turbo juga sudah dibuka di Alibaba Cloud Model Studio.
Tim Qwen milik Alibaba merilis Qwen-Image-2.1-Turbo pada 9 Oktober 2026. Bobotnya tersedia terbuka di Hugging Face dan ModelScope, dan pada hari yang sama Qwen mengaktifkan API Qwen-Image-2.1 Pro serta Turbo di Alibaba Cloud Model Studio. Turbo bukan keluarga model baru, melainkan checkpoint percepatan dari Qwen-Image-2.1 yang terbit 20 September 2026: arsitektur generator visual 7B-nya sama, tetapi hasil akhirnya dicapai dalam 8 langkah denoising, bukan 40 langkah seperti pada contoh resmi model dasar. MarkTechPost mencatat selisih itu sebagai sekitar lima kali lebih sedikit langkah, ditambah pilihan API terkelola bagi yang tidak ingin menyiapkan GPU sendiri.
Secara teknis generatornya adalah Diffusion Transformer aliran tunggal 32 lapis dengan attention block-causal, dipasangkan dengan encoder teks Qwen3-VL 8B, VAE RGBA 64 kanal berkompresi spasial 16 kali sehingga transparansi asli didukung, serta penjadwal Flow Matching Euler diskret. Ada dua keputusan desain yang membuatnya cepat. Pertama, CFG bernilai 1 secara bawaan, sehingga setiap langkah hanya perlu satu forward pass dan bukan dua. Kedua, prefix KV caching menghitung konteks teks dan gambar rujukan sekali lalu memakainya ulang sepanjang langkah denoising. Karena langkahnya tinggal delapan, cache itu menutupi sebagian besar biaya pengondisian, dan itulah alasan percepatannya lebih besar daripada sekadar rasio jumlah langkah.
Ada satu jebakan teknis yang perlu diperhatikan sebelum menyalin kode dari model dasar. Jadwal 8 langkah disimpan di dalam checkpoint, sehingga mengatur num_inference_steps tidak menimpa jadwal tersebut; hanya argumen sigmas yang diberikan eksplisit saat pemanggilan yang bisa, dan Qwen menyatakan jadwal lain belum dievaluasi untuk checkpoint ini. Menjalankannya memerlukan Diffusers dari sumber dengan PR 14950 serta transformers 5.17.0 ke atas. Preset resolusinya mengikuti model dasar, dari 2048x2048 persegi sampai 2752x1536 pada rasio 16:9. Kemampuannya meliputi teks ke gambar, penyuntingan multi-rujukan dengan model dasar yang mendukung sampai 10 gambar rujukan, penyuntingan lokal lewat mask atau anotasi, dan keluaran PNG transparan.
Yang perlu ditimbang sebelum memakainya di produk adalah lisensinya. Bobot Turbo memakai Qwen Research License Agreement, jadi pemakaian komersial dengan self-hosting memerlukan izin terpisah, berbeda dari Qwen-Image generasi pertama yang berlisensi Apache 2.0. Untuk yang memilih jalur API, MarkTechPost mencatat tarif Turbo sekitar 0,1 yuan per gambar dengan batas 120 permintaan per menit, sedangkan Pro 0,25 yuan per gambar dengan batas 20 permintaan per menit. Belum ada tolok ukur khusus untuk Turbo; angka yang tersedia adalah 60,28 pada Qwen-Image-Bench untuk model dasar. Karena ComfyUI sudah mendukung keluarga Qwen-Image-2.1 sejak hari pertama, jalur tercepat bagi yang sudah memakainya adalah menukar model difusi atau memuat LoRA Turbo lalu menurunkan sampler ke 8 langkah dengan CFG 1, sementara kuantisasi GGUF Q8 dan Q4 dilaporkan sudah muncul dalam hitungan jam untuk kartu grafis bermemori kecil.
Sumber asli
MarkTechPostmarktechpost.comSumber pendukung
Fakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan