DeepSeek V4.1-Flash: Konteks Sejuta Token dengan Biaya Input di Bawah 15 Sen per Juta
DeepSeek merilis V4.1-Flash: MoE 552 miliar parameter berlisensi MIT, konteks satu juta token, dan KV cache yang dipangkas sampai sekitar 890 byte per token sehingga biaya konteks panjang jatuh.

DeepSeek merilis V4.1-Flash pada 10 September 2026: model Mixture-of-Experts 552 miliar parameter dengan lisensi MIT, jendela konteks satu juta token, output maksimum 384K token, dan pemahaman gambar yang ditanam native di model utama — bukan ditempel sebagai modul terpisah yang menuntut penggantian nama model. Model ini menyebut dirinya anggota terkecil dari keluarga arsitektur baru: struktur causal encoder-decoder yang membelah 40 lapisan transformer menjadi 20 tahap pengkodean dan 20 tahap pendekodean, dengan parameter aktif yang asimetris, sekitar 8 miliar saat membaca input dan 16 miliar saat menulis output.
Yang paling menentukan biaya bukan ukuran modelnya, melainkan KV cache. Dengan Compressed Sparse Attention 2 dan cache KV berformat FP4, jejak cache globalnya turun sampai sekitar 890 byte per token. Bagian cache yang tinggal di memori GPU menyusut menjadi sekitar seperempat dari yang dipakai V4-Flash, dan porsi yang digeser ke SSD atau memori host menyusut sekitar seperdelapan. Untuk pipeline dokumen panjang dan agen yang menahan konteks besar, pemangkasan memori ini langsung terasa di tagihan.
Harga resminya per satu juta token dalam dolar AS: input dengan cache hit 0,003 di luar jam sibuk dan 0,006 pada jam sibuk; input tanpa cache hit 0,15 dan 0,30; output 0,60 dan 1,20. Jam sibuk adalah hari kerja pukul 08.00–11.00 dan 13.00–17.00 WIB, selebihnya tarif luar jam sibuk. Nama model yang disarankan sekarang deepseek-flash; nama lama deepseek-v4-flash dan deepseek-v4-flash-vision-exp sudah dipensiunkan — permintaan ke nama itu tetap dilayani, tetapi dialihkan ke V4.1-Flash dan ditagih dengan tarif Flash. Batas konkurensi naik dari 500 menjadi 2.500.
Rencana pensiun DeepSeek V4 Pro akhirnya dibatalkan. Semula, mulai 14 September 2026 permintaan ke deepseek-v4-pro akan dialihkan ke V4.1-Flash dengan tarif Flash — pemotongan sekitar 70% untuk biaya output bagi siapa pun yang menulis nama Pro secara hard-code. Pada 11 September DeepSeek justru menerbitkan pemberitahuan di platformnya sendiri bahwa layanan API V4 Pro tetap disediakan setelah 14 September dengan penagihan tidak berubah. Alasan yang dilaporkan klasik: pengembang keberatan bobot di balik sebuah nama model ditukar diam-diam di integrasi produksi, dan pengujian multipihak DeepSeek sendiri menemukan V4 Pro masih unggul di sebagian beban kerja nyata.
Angkanya: pada upaya penalaran maksimum, V4.1-Flash mencatat Terminal-Bench 2.1 sebesar 90,6 dan DeepSWE v1.1 sebesar 74,2 — sedikit di depan model pembanding terbesar pada tolok ukur agen itu — dengan peringkat Codeforces 3.471. Versi dasarnya mencetak MMLU-Pro 74,1, HumanEval 79,4, dan GSM8K 93,0. Klaim bahwa model kelas Flash mengalahkan model unggulan 1,6 triliun parameter awalnya hanya asersi vendor tanpa audit luar, lalu ditutup oleh pihak independen: Artificial Analysis menempatkan V4.1-Flash pada Intelligence Index 40, peringkat keenam dari 113 model sekelas dan jauh di atas median 18 untuk model open-weight, sementara V4 Pro 0813 mencetak 36. Ia tetap tertinggal pada GPQA Diamond, Humanity's Last Exam, dan SimpleQA. Di sisi penyajian, pekerjaan agar V4.1 berjalan di runtime mainstream masih berlangsung terbuka dan belum digabungkan — termasuk pull request SGLang untuk modul Engram dan pemisahan prefill/decode di platform B200.
Kenapa penting buat saya: konteks satu juta token dengan biaya input di bawah lima belas sen per juta token mengubah hitungan produk konversi file dan PDF — dokumen besar bisa dibaca sekali jalan tanpa pra-potong — dan cache KV yang kecil berarti server sederhana pun sanggup melayaninya, bukan hanya kluster GPU besar.
Sumber asli
Morf.idmorf.idFakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan

