Lewati ke isi

Edisi harian · terbit setiap pagi

Berita AI pilihan, ditulis ulang dalam bahasa Indonesia, setiap pagi.

Kirim tips
Terkini
Open Source

Aleph Alpha rilis Kolibri, model open-weight MoE 78 miliar parameter berlisensi Apache 2.0 untuk sektor teregulasi

Perusahaan AI Jerman Aleph Alpha merilis Kolibri, model bahasa open-weight dwibahasa Inggris-Jerman berarsitektur Mixture-of-Experts. Total parameternya 78,1 miliar, tetapi hanya 3,46 miliar yang aktif per token, dengan konteks hingga 1.048.576 token dan lisensi Apache 2.0. Targetnya adalah penerapan berdaulat di sektor teregulasi seperti administrasi publik, industri, dan dirgantara.

Bagikan WhatsApp X LinkedIn Telegram Email
Ilustrasi rubrik Open Source: Aleph Alpha rilis Kolibri, model open-weight MoE 78 miliar parameter berlisensi Apache 2.0 untuk sektor teregulasi
Ilustrasi: Jekardah AI News, dibuat otomatis sesuai rubrik.

Perusahaan AI Jerman Aleph Alpha merilis Kolibri (Kolibri-1), model bahasa open-weight dwibahasa Inggris-Jerman yang dibangun dengan arsitektur Mixture-of-Experts (MoE). Total parameternya 78,1 miliar, tetapi hanya 3,46 miliar atau sekitar 4,4 persen yang aktif per token, sehingga biaya inferens jauh lebih hemat dibanding model padat berukuran serupa. Model ini menerima konteks hingga 1.048.576 token, memungkinkan pengguna mengatur tingkat reasoning effort per permintaan, dan dipublikasikan dengan lisensi Apache 2.0 di Hugging Face. Menurut ForkLog, perilisannya sengaja bertepatan dengan Hari Persatuan Jerman, 3 Oktober.

Penekanan utama Aleph Alpha adalah kedaulatan teknologi. Seluruh alur produksi, mulai dari data, arsitektur, infrastruktur pelatihan, post-training, hingga evaluasi, dikerjakan secara ujung-ke-ujung oleh tim di Jerman, dengan pelatihan berjalan di infrastruktur di Jerman dan Finlandia. Desain model disesuaikan dengan EU General-Purpose AI Code of Practice, EU AI Act, dan GDPR, sementara jalur datanya menyunting data pribadi sebelum pelatihan. Pasar sasarannya jelas: sektor-sektor teregulasi seperti administrasi publik, industri, dan dirgantara yang membutuhkan kontrol penuh atas model dan datanya.

Dari sisi arsitektur, Kolibri menumpuk 50 blok transformer dengan lebar model 2.560. Setiap layer MoE menilai 384 expert dengan router sigmoid, mengirim tiap token ke enam expert teratas, dan selalu menjalankan satu shared expert. Perhatiannya bersifat hibrida: hanya setiap blok kelima memakai full attention tanpa enkode posisi, sementara 40 blok lainnya memakai sliding-window attention atas 512 token sebelumnya, sehingga sebagian besar KV cache berukuran tetap dan hanya sepuluh layer yang tumbuh mengikuti panjang konteks. Tokenizer UniBPE-nya juga lebih efisien untuk bahasa Jerman, 4,90 byte per token dibanding 4,35 milik tokenizer GPT-5, artinya sekitar 11,2 persen token lebih hemat pada teks web Jerman.

Bagi para developer, sisi paling praktis adalah kemudahan penerapannya. Checkpoint FP8 berukuran sekitar 78 GB dan bisa berjalan pada satu GPU B200, B300, atau H200, atau dua H100 SXM5, dilayani melalui vLLM lengkap dengan parser reasoning dan tool call bawaan. Pelatihan awalnya menutup 20 triliun token pada 768 GPU B200, dilanjutkan tahap mid-training 3,44 triliun token dengan sekuens 65.536 serta tahap long-context 201 miliar token pada sekuens 262.144. Bagi organisasi yang mencari model terbuka yang sejak awal dirancang patuh regulasi Eropa, Kolibri kini menjadi pilihan baru yang layak dipertimbangkan.

Sumber asli

MarkTechPostmarktechpost.com

Sumber pendukung

Fakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan

Bagikan WhatsApp X LinkedIn Telegram Email

Baca juga