- Hasil perbandingan 1.008 SVG dari 7 model frontier tidak menemukan bukti jelas adanya pelicanmaxxing, yaitu menaikkan performa khusus untuk prompt terkenal
- 48 prompt yang menggabungkan 8 jenis hewan dan 6 jenis kendaraan dijalankan 3 kali per model, lalu GPT-5.6 Luna menilai konsistensi hewan, kendaraan, dan aksi masing-masing dengan skor 1–5
- Pelikan berada di peringkat ke-6 dari 8 hewan, sepeda di peringkat ke-5 dari 6 kendaraan, dan kombinasi pelikan-sepeda hanya berada di peringkat ke-42 dari total 48 kombinasi
- Dalam analisis regresi yang mengoreksi tingkat kesulitan, efek per lab juga tidak signifikan secara statistik; satu-satunya efek sepeda yang signifikan dari Gemini 3.5 Flash pun tidak lolos koreksi perbandingan berganda
- Semua 21 gambar pelikan-sepeda menghadap ke kanan, tetapi 60% dari seluruh gambar juga menghadap ke arah yang sama; eksperimen ini saja tidak dapat menentukan apakah ada SVGmaxxing yang memperkuat pembuatan SVG secara umum
Benchmark ‘pelikan yang mengendarai sepeda’
- Selama bertahun-tahun, Simon Willison menguji prompt yang sama setiap kali LLM utama dirilis: “buat SVG pelikan yang mengendarai sepeda”
- Tes yang awalnya bernada main-main ini menjadi benchmark AI tidak resmi yang terkenal, dan hasil terkaitnya juga banyak mendapat upvote di thread Hacker News yang memperkenalkan model baru
- benchmaxxing berarti tindakan mengoptimalkan model AI agar mendapat skor tinggi pada benchmark populer
- Karena performa model dapat memengaruhi pilihan pengguna, eksperimen ini memeriksa kemungkinan pelicanmaxxing, yaitu lab mengoptimalkan model untuk tes spesifik ini
- Kode eksperimen dan pipeline pemrosesan data dipublikasikan di repositori GitHub
Desain eksperimen yang menghasilkan 1.008 SVG
- Dibuat 48 prompt dengan menggabungkan 8 jenis hewan dan 6 jenis kendaraan
- Hewan: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
- Kendaraan: bicycle, unicycle, skateboard, scooter, plane, boat
- Semua prompt hanya mengganti hewan dan kendaraan dari frasa Simon Willison
- Hewan dan kendaraan tidak dipilih dengan prosedur ketat, tetapi disusun agar kemiripan dengan prompt asli dan tingkat kesulitannya beragam
- flamingo dan heron mirip dengan pelican
- cat, raccoon, otter dipilih sebagai kasus yang mudah
- antelope adalah kasus sulit, sedangkan whale sangat berbeda dari pelican
- Melalui OpenRouter, 7 model berikut diuji
- GPT-5.6 Terra
- Claude Sonnet 5
- Gemini 3.5 Flash
- Grok 4.5
- Qwen3.7-Max
- GLM-5.2
- DeepSeek V4 Pro
- Untuk setiap prompt, dibuat 3 sampel dengan temperature 1.0 dan pengaturan reasoning effort yang sama, sehingga terkumpul total 1.008 SVG
Pipeline rendering, evaluasi, dan ekstraksi fitur
- Hasil generasi diproses dalam tiga tahap
- Rendering: SVG dikonversi menjadi PNG; jika tidak ada SVG atau rendering gagal, generasi diulang sampai ada hasil yang valid
- Dalam 1.008 proses generasi, dilakukan 11 kali percobaan ulang
- Evaluasi: GPT-5.6 Luna memberi skor 1–5 untuk konsistensi hewan, kendaraan, dan aksi
- Untuk peringkat hewan dan kendaraan, digunakan skor individual tiap komponen
- Saat diperlukan satu angka per gambar, digunakan skor penilai (judge score), yaitu rata-rata dari tiga skor tersebut
- Ekstraksi fitur: Gemini 3.1 Flash-Lite mencatat hewan dan kendaraan yang dikenali, arah subjek, serta elemen adegan
- Rendering: SVG dikonversi menjadi PNG; jika tidak ada SVG atau rendering gagal, generasi diulang sampai ada hasil yang valid
- Jika sebuah lab telah melatih model untuk benchmark tertentu, diasumsikan bahwa baris pelikan, kolom sepeda, atau sel pelikan-sepeda akan mendapat skor lebih tinggi daripada tingkat kesulitan dasarnya
Perbedaan yang terlihat dari perbandingan visual
- Grid gambar keseluruhan per model dibandingkan, tetapi tidak ditemukan kasus di mana gambar pelikan-sepeda jelas lebih unggul daripada hasil lain dari model yang sama
- Sampel pertama GLM-5.2 terlihat agak bagus, tetapi dalam kelompok yang sama juga ada gambar heron-skateboard berkualitas tinggi, sehingga sulit menilainya sebagai hasil optimisasi khusus
- Lab yang menghasilkan gambar pelikan-sepeda yang bagus cenderung juga menggambar kombinasi hewan-kendaraan lain dengan baik
- Karena penilaian visual sulit direproduksi dan bisa berbeda antarorang, analisis kuantitatif ditambahkan
Performa individual pelikan dan sepeda
- Jika skor hewan dari semua model dijumlahkan, pelikan berada di peringkat ke-6 dari 8 jenis
- Lebih rendah daripada cat, whale, raccoon, heron, antelope
- Ketujuh lab menggambar cat, whale, dan raccoon lebih baik daripada pelican
- Karena pelikan sendiri mungkin lebih sulit digambar daripada cat, peringkat ini saja belum cukup untuk menyingkirkan kemungkinan pelatihan khusus
- Sepeda berada di peringkat kedua dari bawah di antara 6 kendaraan, hampir setara dengan plane yang menempati posisi terakhir
- Sepeda membutuhkan dua roda yang cocok, rangka yang menghubungkan kedua poros roda, setang, sadel, dan pedal
- Model penilai menilai bahwa pada sekitar dua pertiga gambar sepeda, salah satu elemen ini tidak ada atau tidak tersambung dengan benar
- Sepeda juga lebih sulit daripada kendaraan sederhana seperti skateboard, sehingga peringkat relatifnya bisa tetap rendah meskipun telah dilatih secara khusus
Ambiguitas yang ditimbulkan prompt ‘plane’
- Karena menggunakan “plane” alih-alih “airplane”, sebagian model menafsirkannya sebagai bidang geometris, bukan pesawat terbang
- Akibatnya, gambar yang dihasilkan menampilkan hewan berdiri di atas permukaan datar, bukan menaiki pesawat
- Kasus ketika ekstraktor fitur sama sekali tidak menemukan kendaraan hanya muncul pada plane
- Dari 168 gambar plane, kendaraan tidak dikenali pada 25 gambar
- Pada 5 kendaraan lainnya, kasus seperti ini tidak muncul
- 20% gambar plane mendapat skor kendaraan 1 atau 2
- bicycle sebesar 5%
- boat, scooter, skateboard tidak memiliki gambar dengan skor 1–2
Peringkat per kombinasi dan koreksi tingkat kesulitan
- Rata-rata performa kombinasi pelikan-sepeda berada di peringkat ke-42 dari 48 kombinasi
- Karena setiap kombinasi bisa memiliki tingkat kesulitan dasar yang berbeda, analisis regresi fixed effects diterapkan pada seluruh 1.008 gambar
- Rumus dasarnya adalah
score ~ lab + animal × vehicle - Ditambahkan term interaksi pelican, bicycle, dan pelican-bicycle per lab
- Digunakan robust standard errors
- Rumus dasarnya adalah
- Term
animal × vehiclemenyerap kesulitan unik yang berbeda untuk tiap 48 kombinasi - Dengan term interaksi per lab, diukur kenaikan khusus benchmark dibandingkan lab rata-rata beserta confidence interval-nya
Tidak ditemukan efek signifikan dalam analisis regresi
- Efek pelikan per lab berada di antara -0,11 hingga +0,14 poin dan semuanya tidak signifikan secara statistik
- p-value terkecil pun 0,25
- Efek sepeda per lab tersebar dari -0,18 poin untuk Grok 4.5 (p=0,11) hingga +0,27 poin untuk Gemini 3.5 Flash (p=0,022)
- Arah 7 efek tersebut terbagi antara positif dan negatif
- Satu-satunya model yang memenuhi p<0,05 adalah Gemini 3.5 Flash
- Setelah mengecualikan efek pelikan dan sepeda masing-masing lab, tidak ada kenaikan tambahan pada kombinasi pelikan-sepeda spesifik yang memenuhi p<0,05
- Efek positif terbesar adalah +0,35 poin dari GLM-5.2, tetapi p=0,12
- Ini adalah hasil yang paling mendekati sinyal dalam eksperimen, tetapi masih berada dalam rentang kebetulan
- Semua confidence interval untuk efek pelikan dan efek sel pelikan-sepeda mencakup 0
- Jika 21 pengujian dilakukan pada p<0,05, sekitar 1 false positive dapat diharapkan hanya karena kebetulan
21 × 0.05 ≈ 1.05, dan hasil signifikan aktual juga hanya satu, yaitu efek sepeda Gemini- Ambang koreksi Bonferroni adalah
0.05/21 ≈ 0.002, sehingga p=0,022 milik Gemini tidak lolos
- Lebar confidence interval rata-rata sekitar ±0,6 poin, sehingga efek kenaikan yang lebih kecil dari ini sulit ditangkap oleh eksperimen
Komposisi gambar yang menghadap ke kanan
- Semua 21 gambar pelikan-sepeda yang dibuat oleh 7 lab menghadap ke kanan
- Ini satu-satunya kombinasi dari 48 kombinasi yang semua gambarnya memiliki arah yang sama
- Namun, 60% dari seluruh 1.008 gambar menghadap ke kanan, jadi arah kanan sendiri memang umum
- Rasio menghadap kanan per kendaraan adalah scooter 83%, bicycle 81%, skateboard 60%, plane 58%, unicycle 45%, boat 35%
- Rasio menghadap kanan per hewan adalah antelope dan pelican masing-masing 78%, heron 77%, whale 65%, flamingo 64%, otter 45%, cat 40%, raccoon 36%
- Karena pelikan atau sepeda sulit digambar dari depan, model umumnya memilih komposisi samping kiri-kanan, sehingga gambar dengan arah ambigu juga sedikit
- Kombinasi lain juga menunjukkan tingkat kesamaan arah yang tinggi
- antelope-scooter dan pelican-scooter masing-masing memiliki 20 dari 21 gambar dengan arah yang sama
- heron-bicycle memiliki 19 dari 21 gambar dengan arah yang sama
- Hasil bahwa satu dari 48 kombinasi memiliki semua 21 gambar dengan arah sama sulit dianggap sebagai outlier khusus hanya dari fakta itu saja
Mencari jejak hafalan pada elemen adegan
- Gemini 3.1 Flash-Lite mengekstrak secara bebas elemen adegan yang ditemukan pada gambar untuk memeriksa apakah komposisi yang dihafal berulang
- Pada beberapa kombinasi, elemen tertentu sering berulang
- Semua gambar flamingo-boat menampilkan matahari
- 38% gambar otter-plane menampilkan syal
- 38% gambar cat-bicycle menyertakan keranjang
- Pada pelikan-sepeda juga ada beberapa elemen dengan frekuensi tinggi, tetapi tidak ditemukan pola pengulangan khusus yang membedakannya dari kombinasi hewan-kendaraan lain
Satu model evaluasi dan anggaran terbatas
- Semua skor diberikan oleh satu model evaluasi, GPT-5.6 Luna, yang melihat gambar satu per satu
- Penyelarasan kriteria evaluasi belum dilakukan secara memadai, dan konsistensi saat evaluasi ulang juga tidak diperiksa
- Jika model evaluasi tidak dapat menilai gambar secara andal, nilai hasil kuantitatif menjadi rendah
- Ada juga batasan bahwa model evaluasi dan model peserta GPT-5.6 Terra berasal dari keluarga produk yang sama
- Namun, karena setiap lab menghasilkan semua 48 kombinasi, preferensi terhadap gaya gambar lab tertentu akan ikut menaikkan skor seluruh grid
- Analisis membandingkan perbedaan antar-kombinasi di dalam lab, sehingga preferensi seperti ini tidak mengubah hasil utama
- SVGmaxxing, yaitu mengoptimalkan pembuatan SVG secara keseluruhan atau kategori seperti ‘hewan yang menaiki kendaraan’, tidak dapat dideteksi
- Karena performa semua sel akan meningkat bersama-sama, hal ini tidak dapat dibedakan dari model yang memang pandai membuat SVG
- Google/DeepMind melakukan optimisasi semacam ini secara terbuka
- Total biaya eksperimen sekitar 80 dolar AS dalam kredit API
- Dibatasi pada 3 sampel per sel, 1 model evaluasi, dan 7 model peserta
- Prompt dan pipeline tidak sempat diiterasi dan diperbaiki secara memadai, sehingga masalah seperti “plane” vs “airplane” masih tersisa
Tidak ada bukti optimisasi untuk prompt spesifik
- Pelikan tidak digambar lebih baik daripada hewan lain, sepeda juga tidak lebih unggul daripada kendaraan lain, dan tidak ada lab yang menggambar kombinasi tersebut secara signifikan lebih baik daripada yang diharapkan dari performa pelikan dan sepeda individualnya
- GLM-5.2 mencatat kenaikan terbesar pada sel pelikan-sepeda tertentu, tetapi efeknya kecil dan tidak signifikan secara statistik
- Fakta bahwa 21 gambar semuanya menghadap ke kanan memang mencolok, tetapi secara keseluruhan komposisi menghadap kanan umum, dan tiga kombinasi lain juga mencatat tingkat kesamaan di atas 90%
- Bentuk yang lebih mungkin daripada pelicanmaxxing yang menargetkan benchmark spesifik adalah SVGmaxxing yang memperkuat pembuatan SVG secara umum, tetapi eksperimen ini tidak dapat menentukan lab mana yang melakukannya
1 komentar
Pendapat di Hacker News
Saya juga sempat memeriksa berbagai kombinasi hewan dan kendaraan lain, dan impian saya adalah menemukan bukti bahwa laboratorium AI tertentu secara mencolok hanya piawai menggambar pelikan yang mengendarai sepeda
Metodologi Dylan, yang menghasilkan 1.008 SVG dari kombinasi 8×6, jauh lebih solid daripada yang saya bayangkan. Namun saya tidak menemukan kasus pada model mana pun di mana pelikan bersepeda tampil jauh lebih baik dibanding kombinasi lain
Di pasar yang padat, lolos benchmark adalah biaya masuk, tetapi optimisasi sempit seperti meng-hardcode adegan tertentu tanpa memperbaiki masalah yang berdekatan itu bermasalah. Ini mengingatkan pada benchmark “Quack3” untuk kartu ATI di ranah GPU
Wajar jika pelikan yang bersepeda menghadap ke kanan. Drivetrain sepeda berada di kanan, jadi untuk menampilkannya tanpa tertutup rangka, sisi kananlah yang digambar; besar kemungkinan komposisi seperti ini juga tercermin dalam data pelatihan
Dasar: https://www.rei.com/c/bikes
Jika diperhatikan, terlepas dari arah hewannya, semua sepeda menghadap ke kanan, dan kedua kaki pengendaranya, kecuali paus, juga berada di sisi kanan sepeda. Ini menunjukkan kurangnya pemahaman substantif tentang cara kerja sepeda
Setiap kali Simon Willison mengunggah SVG, selalu ada reaksi yang mengabaikan evaluasinya dengan alasan “sekarang pasti sudah dilatih”, tetapi ada juga tulisan yang menjelaskan secara logis betapa mudahnya pelatihan semacam itu bisa terdeteksi. Saya senang ada analisis kuantitatif atas hasil hewan-hewan kecil yang mengendarai sepeda
https://simonwillison.net/2025/Nov/13/training-for-pelicans-...
Hasil kali ini menunjukkan bahwa perbaikan semacam itu pun belum terjadi. Malah ada kemungkinan performanya menurun karena belajar dari hasil buruk di internet
Jika penjelasan yang lebih masuk akal adalah optimisasi SVG, kita juga perlu menelaah apa arti “optimisasi” di sini. Kemampuan menggambar SVG dengan lebih baik itu sendiri adalah keterampilan yang berguna
Saya menambahkan satu variasi pada eksperimen serupa. Saya memeriksa apakah model akan memilih sendiri pelikan yang mengendarai sepeda ketika burung atau alat transportasi tertentu tidak ditentukan
Hasil: https://www.modelbias.ai/pelican-on-a-bicycle-test
Data aslinya tersedia di GitHub: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...
Membuat LLM menghasilkan SVG mirip seperti meminta pelukis manusia menggambar dengan cara mendiktekan daftar koordinat; sangat sulit dan tidak alami. Model pembuat gambar modern dapat dengan mudah membuat sepeda berstruktur sempurna dan pelikan realistis, tetapi hasilnya hanyalah gambar raster
Tahap untuk mengurai gambar menjadi path SVG atau perintah sapuan kuas lalu mereproduksinya masih hilang, dan untuk melakukannya dengan benar diperlukan pemahaman sejati tentang struktur adegan, sesuatu yang masih lemah pada AI
Begitu suatu metode penilaian output LLM dikenal, para pengambil keputusan pendanaan dan lab mulai memperhatikan metrik tersebut dan melakukan koreksi. Dalam skenario terbaik, mereka akan meningkatkan kemampuan SVG secara umum sekaligus mengoptimalkan pembuatan pelikan, tetapi karena sudah menjadi ukuran yang diketahui, sulit memakainya sebagai evaluasi independen yang dapat dipercaya