LightOn rilis LightOnOCR-3, keluarga model OCR open-weight 0,8B sampai 4B dengan kotak pembatas dan data grafik
LightOn merilis keluarga LightOnOCR-3 pada 8 Oktober 2026 dalam tiga ukuran, yaitu 0,8B, 1B, dan 4B parameter, dengan lisensi Apache 2.0 sehingga boleh dipakai untuk riset maupun komersial. Selain menyalin teks halaman, model ini bisa mengeluarkan koordinat kotak pembatas berlabel untuk setiap wilayah dokumen, deskripsi gambar, dan data angka dari grafik. Model 4B mencatat skor keseluruhan 86,3 pada tolok ukur olmOCR-Bench, sedikit di bawah Infinity Parser Pro yang berukuran 35,1B.
LightOn, laboratorium AI asal Prancis, merilis generasi ketiga model pengenalan karakter optis atau OCR miliknya pada 8 Oktober 2026. Keluarga LightOnOCR-3 hadir dalam tiga ukuran parameter, yaitu 0,8B, 1B, dan 4B, dan semuanya dirilis dengan lisensi Apache 2.0 lewat Hugging Face, sehingga bobotnya bisa diunduh, dijalankan di server sendiri, dan dipakai untuk keperluan komersial tanpa biaya lisensi. Model 1B masih memakai arsitektur generasi sebelumnya, sedangkan varian 0,8B dan 4B memakai arsitektur vision-language Qwen3.5.
Perubahan terbesar bukan pada kemampuan menyalin teks, melainkan pada keluaran struktur. Ketiga model menyediakan dua mode: dengan prompt teks kosong, model menyalin isi halaman seperti generasi sebelumnya; dengan prompt grounding, model mengembalikan koordinat kotak pembatas berlabel untuk setiap wilayah dokumen, deskripsi gambar, serta data angka yang dibaca dari gambar atau grafik dalam bentuk tabel HTML. LightOn memilih penanda ringkas yang ditulis sebaris alih-alih membungkus setiap wilayah dengan HTML atau JSON, agar tambahan token akibat informasi tata letak tetap kecil.
Pada 512 halaman uji olmOCR-Bench, LightOnOCR-3-4B mencatat skor keseluruhan 86,3, varian 0,8B mencatat 85,5, dan varian 1B mencatat 84,5. Sebagai pembanding, Infinity Parser Pro yang berukuran 35,1B mencatat 87,6 dan Chandra 2 yang berukuran 4B mencatat 85,8. LightOn juga menyebut varian 0,8B dan 4B menghasilkan 9 sampai 14 persen lebih sedikit token keluaran dibanding Chandra-OCR-2 dan Infinity-Parser2-Pro untuk halaman yang sama pada mode grounding. Data pelatihan grounding untuk pembelajaran penguatan diverifikasi manual, dengan dua kumpulan anotasi berisi 983 halaman rata-rata 31,5 kotak per halaman dan 1.654 halaman rata-rata 13,0 kotak per halaman.
LightOn menyebut motivasi utama rilis ini adalah mengurangi kebutuhan rangkaian pipeline bertingkat yang biasanya dipakai untuk membangun data pelatihan OCR sendiri, karena tidak ada satu sistem pun yang cukup andal untuk semua jenis dokumen. Model yang kuat pada makalah ilmiah, misalnya, justru lemah pada manuskrip. Seperti biasa, klaim kecepatan dan presisi berasal dari pihak pembuat model dan baru diuji pada tolok ukur yang mereka pilih sendiri, sehingga hasil pada berkas nyata masih perlu diverifikasi pengguna. Lisensi Apache 2.0 dan ukuran model yang kecil membuat pengujian itu relatif murah untuk dilakukan.
Sumber asli
Hugging Face Blog, oleh LightOn AIhuggingface.coSumber pendukung
Fakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan