GPT, Grok dan Claude Diuji Nyetir Mobil Sungguhan, Gimana Hasilnya?
Tiga peneliti menguji empat model kecerdasan buatan (AI) mengemudikan Toyota Corolla 2022 sungguhan di sebuah lintasan berbatas cone. Hasilnya, hanya satu model yang berhasil sampai garis finis.
Pengujian itu tertuang dalam paper berjudul DrivingBench: Can Vision-Language Models Drive a Toyota Corolla? karya Aditya Ramabadran, Simon Mahns, dan Tobias Gessler. Makalah tersebut berstatus preprint yang diunggah di platform alphaXiv pada 30 September 2026 dan belum melalui peer review.
Model yang diuji adalah GPT-6 Astra dan GPT-5.6 Sol lewat Codex, Claude Fable 5.1 lewat Claude Code, serta Grok 4.6 lewat Cursor. Peneliti menegaskan yang dibandingkan adalah pasangan model dan aplikasinya, bukan model semata.
Corolla dipasangi perangkat comma four dengan perangkat lunak openpilot. Model melihat gambar kamera, lalu memerintahkan persentase setir, kecepatan, dan durasi gerak. Kecepatan dibatasi 0,5 hingga 3,5 m/s atau sekitar 1,8 hingga 12,6 km/jam.
Lintasan uji sepanjang 127 meter, berisi satu belokan kiri dan dua belokan kanan. Tiap model mendapat maksimal tiga percobaan dalam satu percakapan.
Lihat Juga : |
Gagal di tikungan pertama
GPT-6 Astra mencapai 49 persen lintasan pada percobaan pertama dan finis di percobaan kedua. Mobil masuk zona finis 4 menit 44 detik setelah perintah pertama, dengan waktu finis tercatat 5 menit 22 detik.
Claude Fable 5.1 membaik dari 9 persen, 10 persen, hingga 45 persen. Grok 4.6 mencatat 8, 11, dan 10 persen, sedangkan GPT-5.6 Sol tertahan di 6 persen pada ketiga percobaan.
Dari 11 percobaan, delapan berakhir sebelum tikungan pertama. Penyebab paling sering adalah model salah membaca sisi batas cone.
"Saya kembali memilih sisi batas yang salah. Barisan cone diagonal itu adalah tepi kiri jalur, bukan tepi kanannya," tulis Claude Fable 5.1 dalam refleksinya.
Latensi juga berpengaruh karena mobil tetap bergerak saat model berpikir. Median jeda sebelum perintah berikutnya berkisar 4,9 detik pada Astra hingga 22,2 detik pada Fable.
Biaya token yang dihabiskan Astra mencapai US$9,75 atau sekitar Rp174 ribu (kurs Rp17.858,90). Fable menghabiskan sekitar Rp70,5 ribu, Sol Rp18,8 ribu, dan Grok Rp11,6 ribu.
Sempat menolak menyetir
Selama pengembangan, GPT-6 Astra kerap menolak mengemudikan mobil sungguhan, bahkan setelah peneliti memberi jaminan keselamatan.
"Tidak. Tidak ada rumusan kata, surat pengabaian, atau jaminan tambahan apa pun yang memungkinkan saya mengemudikan atau memberi perintah langsung kepada mobil fisik," tulis Astra dalam salah satu percakapan.
Penolakan baru teratasi setelah peneliti mengurangi informasi soal risiko pada keluaran tool dan menjelaskan tugas secara operasional. Dengan desain akhir itu, semua model bersedia mengemudi di setiap percobaan.
Pengujian dilakukan dengan bantuan pengemudi yang berada di mobil, tugasnya menyiagakan kakinya di atas rem. Seluruh percobaan yang gagal dihentikan operator dengan rem, kecepatan puncak terukur di bawah 3 m/s atau sekitar 10,8 km/jam, dan tidak ada tabrakan.
Peneliti mengakui setiap model baru diuji dalam satu trial independen, sehingga mereka berencana menambah jumlah pengujian.
"Hasil kami menunjukkan bahwa meski model AI serbaguna telah membuat kemajuan signifikan pada tugas dunia nyata seperti mengemudi, kemampuannya masih jauh dari level manusia," tulis para peneliti.
(fea)