Lewati ke isi

Edisi harian · terbit setiap pagi

Berita AI pilihan, ditulis ulang dalam bahasa Indonesia, setiap pagi.

Kirim tips
Terkini
Rilis Model

Google DeepMind rilis EmbeddingGemma 2, model terbuka 740 juta parameter yang menyatukan pencarian teks, gambar, video, dan audio

Google DeepMind merilis EmbeddingGemma 2 pada 6 Oktober 2026, model embedding terbuka 740 juta parameter yang memetakan teks, kode, gambar, video, dan audio ke satu ruang vektor 768 dimensi. Bobotnya tersedia di Hugging Face dan Kaggle dengan lisensi Apache 2.0, dan versi terkuantisasinya disebut cukup berjalan di sekitar 191 megabita RAM untuk teks saja di ponsel.

Bagikan WhatsApp X LinkedIn Telegram Email
Ilustrasi rubrik Rilis Model: Google DeepMind rilis EmbeddingGemma 2, model terbuka 740 juta parameter yang menyatukan pencarian teks, gambar, video, dan audio
Ilustrasi: Jekardah AI News, dibuat otomatis sesuai rubrik.

Google DeepMind merilis EmbeddingGemma 2 pada 6 Oktober 2026. Berbeda dari versi pertama yang hanya menangani teks, model ini memetakan teks, kode, gambar, video, dan audio ke dalam satu ruang vektor berdimensi 768, sehingga satu kueri bisa mencari lintas jenis berkas: catatan suara bisa menemukan potongan video tertentu, dan pertanyaan teks bisa menemukan bagian tertentu dari rekaman audio. Bobot modelnya terbuka di Hugging Face dan Kaggle dengan lisensi Apache 2.0, dan build untuk Ollama, GGUF llama.cpp, serta LiteRT sudah tersedia pada hari peluncuran.

Ukurannya 740 juta parameter dengan susunan modular: tulang punggung teks dan kode 270 juta parameter, encoder visi 170 juta, dan encoder audio 300 juta. Pengembang cukup memuat bagian yang dipakai, mulai dari 270 juta parameter untuk teks saja, 440 juta untuk teks dan gambar, 570 juta untuk teks dan audio, sampai 740 juta untuk semuanya, dan semua konfigurasi itu tetap berada di ruang vektor yang sama sehingga hasil dari konfigurasi berbeda tetap bisa dibandingkan. Konteksnya 8.192 token, empat kali versi pertama, atau setara sekitar 29 gambar, 58 frame video, atau 5,5 menit audio dalam sekali proses. Teknik Matryoshka Representation Learning memungkinkan vektor dipotong dari 768 dimensi menjadi 512, 256, atau 128 dimensi, yang menurut Google memangkas kebutuhan penyimpanan hingga enam kali.

Sisi yang paling relevan untuk perangkat kecil ada di angka memori. Dengan kuantisasi, model teks saja disebut berjalan di sekitar 191 megabita RAM aktif di ponsel Google Pixel 11 Pro, sedangkan versi multimodal penuh sekitar 567 megabita. Google juga memposisikan model ini sebagai mesin keputusan di perangkat: tanpa data latih tambahan atau penyetelan ulang, ia bisa mencocokkan masukan pengguna langsung ke daftar label klasifikasi sehingga penentuan niat atau pengarahan permintaan bisa dilakukan dalam hitungan milidetik. Pada pengujian yang dipublikasikan Google, EmbeddingGemma 2 mencatat 78,68 pada MTEB Code v1, naik dari 68,76 pada versi sebelumnya, lalu 61,36 pada MTEB multilingual v2, 64,64 pada MIEB lite untuk gambar, 69,54 pada MSEB untuk pencarian suara, dan 49,39 pada MAEB untuk audio.

Google menyebutnya sebagai model embedding multimodal terbuka terbaik di kelas di bawah satu miliar parameter, dan mengklaim keluarga Gemma sudah melewati satu miliar unduhan, dengan versi pertama EmbeddingGemma menyumbang 20 juta unduhan. Klaim terbaik di kelas itu tetap perlu dibaca hati-hati karena berasal dari pengujian sendiri, sementara model yang ukurannya lebih besar masih memimpin di sebagian papan peringkat multimodal. Google juga menyebutkan batas model ini secara terbuka: belum ada safety tuning maupun moderasi keluaran karena mitigasinya ditempatkan pada data latih, ia mendukung lebih dari 100 bahasa tetapi performanya tidak setara antara bahasa yang satu dan yang lain.

Untuk produk yang berurusan dengan dokumen dan media, rilis ini relevan karena menghapus satu tahap di rantai pemrosesan. Pencarian di dalam kumpulan PDF, arsip hasil transkripsi, atau perpustakaan video biasanya memerlukan beberapa model berbeda, seperti pembuat keterangan gambar, transkripsi ucapan, lalu embedding teks, dan masing-masing berpotensi mengirim data ke layanan awan. Dengan satu model Apache 2.0 berukuran di bawah satu gigabita, seluruh tahap itu bisa dijalankan di mesin sendiri, yang berguna untuk data nasabah atau dokumen internal yang tidak boleh keluar dari infrastruktur sendiri. Langkah uji yang masuk akal adalah membandingkannya pada data sendiri terhadap model embedding yang sudah dipakai, lalu memeriksa kebutuhan memori dan biaya penyimpanan vektor setelah pemotongan dimensi, sebelum memakainya di jalur produksi.

Sumber asli

Google (blog resmi)blog.google

Sumber pendukung

Fakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan

Bagikan WhatsApp X LinkedIn Telegram Email

Baca juga