Tim Grok: Modelnya Sudah Sangat Pintar, yang Sering Gagal Justru Harness Agennya
Larsen Cundric, yang mengerjakan bot Grok di SpaceXAI, menyebut Grok 4.7 "insanely good" dan menilai hambatan terbesar kini ada di keandalan sistem di sekitar model. Pengguna lebih sering meminta agen yang menuntaskan tugas daripada model yang lebih pintar.
Larsen Cundric, yang menurut profil X-nya mengerjakan bot Grok di SpaceXAI, menyebut Grok 4.7 "insanely good" dan menilai model bukan lagi hambatan utama. Menurutnya, yang kini menentukan adalah keandalan harness, yaitu seluruh sistem yang membungkus model agar bisa bekerja sebagai agen.
Ia bercerita telah membaca hampir semua komentar di unggahan "Week 1 at SpaceXAI" miliknya, dan menemukan hal yang mengejutkan. Hanya sedikit orang yang meminta Grok dibuat lebih pintar. Permintaan terbanyak justru agar agen dan bot menuntaskan pekerjaannya: tidak berhenti di tengah jalan, tidak kehilangan browser, tidak lupa sedang mengerjakan apa, dan tidak macet sambil menunggu pengguna sadar.
Cundric menyebut itu masalah yang bagus karena berarti orang sudah memakai Grok untuk pekerjaan nyata. Tugas berikutnya adalah membuat tool, browser, memori, state, retry, dan penanganan galat seandal kemampuan modelnya, dan ia mengaku sedang menggarap sebagian di antaranya. Unggahannya mendapat sekitar 1.600 suka dan hampir 400 ribu tayangan hingga Senin malam.
Grok 4.7 dirilis pada 21 September 2026 setelah sedikitnya lima kali tertunda sejak akhir Juli, menurut Decrypt. Model berparameter 2,1 triliun itu, 40 persen lebih besar dari Grok 4.6, dilatih tambahan dengan data SpaceX dan dijual dengan harga yang sama: US$2 per juta token input dan US$6 per juta token output. Di tolok ukur GDPval ia mencetak 1695, di bawah Claude Fable 5.1 dengan 1735.
Sumber asli
Larsen Cundric di Xx.comSumber pendukung
Fakta, angka, nama, dan kutipan dalam naskah ini telah dicocokkan dengan sumber-sumber di atas. Naskah ditulis ulang oleh redaksi, bukan salinan. Laporkan kesalahan


