- 7 frontier modelde 1.008 SVG karşılaştırıldığında, ünlü bir prompt’a göre performansı artırma anlamına gelen pelicanmaxxing için belirgin kanıt bulunmadı
- 8 hayvan ve 6 taşıtın kombinasyonundan oluşan 48 prompt, her modelde 3 kez çalıştırıldı; GPT-5.6 Luna hayvan, taşıt ve eylem tutarlılığını ayrı ayrı 1–5 puanla değerlendirdi
- Pelikan 8 hayvan arasında 6., bisiklet 6 taşıt arasında 5. oldu; pelikan-bisiklet kombinasyonu da 48 kombinasyon içinde yalnızca 42. sırada kaldı
- Zorluk düzeltmesi yapılan regresyon analizinde de laboratuvar bazlı etkiler istatistiksel olarak anlamlı değildi; anlamlı görünen tek etki olan Gemini 3.5 Flash’ın bisiklet etkisi de çoklu karşılaştırma düzeltmesini geçemedi
- Pelikan-bisiklet görsellerinin 21’inin tamamı sağa bakıyordu, ancak tüm görsellerin %60’ı da aynı yöndeydi; yalnızca bu deneyle SVG üretimini genel olarak güçlendirme anlamındaki SVGmaxxing olup olmadığını ayırt etmek mümkün değil
‘Bisiklete binen pelikan’ benchmark’ı
- Simon Willison yıllardır başlıca LLM’ler çıktığında aynı prompt’u deniyor: “bisiklete binen bir pelikanın SVG’sini oluştur”
- Şaka yollu başlayan bu test, ünlü bir gayriresmî yapay zeka benchmark’ına dönüştü; yeni modelleri tanıtan Hacker News başlıklarında da ilgili sonuçlar çok oy alıyor
- benchmaxxing, yapay zeka modellerini popüler benchmark’larda yüksek puan alacak şekilde optimize etme davranışını ifade eder
- Model performansı kullanıcı tercihlerini etkileyebildiği için, laboratuvarların bu belirli teste göre modeli optimize etme, yani pelicanmaxxing yapma olasılığı test edildi
- Deney kodu ve veri işleme pipeline’ı GitHub deposunda yayımlandı
1.008 SVG üreten deney tasarımı
- 8 hayvan ve 6 taşıt birleştirilerek 48 prompt oluşturuldu
- Hayvanlar: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
- Taşıtlar: bicycle, unicycle, skateboard, scooter, plane, boat
- Tüm prompt’larda Simon Willison’ın cümlesinde yalnızca hayvan ve taşıt değiştirildi
- Hayvanlar ve taşıtlar katı bir prosedürle seçilmedi; ancak özgün örneğe benzerlik ve zorluk derecesi çeşitlilik gösterecek şekilde kurgulandı
- flamingo ve heron, pelican’a benzer
- cat, raccoon, otter kolay örnekler olarak seçildi
- antelope zor; whale ise pelican’dan çok farklı bir örnek
- OpenRouter üzerinden şu 7 model test edildi
- GPT-5.6 Terra
- Claude Sonnet 5
- Gemini 3.5 Flash
- Grok 4.5
- Qwen3.7-Max
- GLM-5.2
- DeepSeek V4 Pro
- Her prompt için temperature 1.0 ve aynı akıl yürütme çabası ayarıyla 3 örnek üretildi; toplamda 1.008 SVG elde edildi
Render, değerlendirme ve özellik çıkarımı pipeline’ı
- Üretilen sonuçlar üç aşamada işlendi
- Render: SVG, PNG’ye dönüştürüldü; SVG yoksa veya render başarısız olursa geçerli bir sonuç çıkana kadar yeniden üretildi
- 1.008 üretim sürecinde 11 kez yeniden denendi
- Değerlendirme: GPT-5.6 Luna, hayvan, taşıt ve eylem tutarlılığını ayrı ayrı 1–5 puanla puanladı
- Hayvan ve taşıt sıralamalarında her öğenin kendi puanı kullanıldı
- Görsel başına tek bir sayısal değer gerektiğinde üç puanın ortalaması olan değerlendirici puanı (judge score) kullanıldı
- Özellik çıkarımı: Gemini 3.1 Flash-Lite’ın tanıdığı hayvan ve taşıt, öznenin yönü ve sahne öğeleri kaydedildi
- Render: SVG, PNG’ye dönüştürüldü; SVG yoksa veya render başarısız olursa geçerli bir sonuç çıkana kadar yeniden üretildi
- Bir laboratuvar belirli bir benchmark’ı öğrenmişse pelikan satırının, bisiklet sütununun veya pelikan-bisiklet hücresinin doğal zorluğundan daha yüksek puan alacağı varsayıldı
Görsel karşılaştırmada görülen farklar
- Model bazında tüm görsel ızgaraları karşılaştırıldı; ancak pelikan-bisiklet görsellerinin aynı modelin diğer sonuçlarından belirgin biçimde üstün olduğu bir örnek bulunmadı
- GLM-5.2’nin ilk örneği biraz iyi görünüyordu; fakat aynı grupta yüksek kaliteli bir heron-skateboard görseli de üretildiği için bunun özel optimizasyon sonucu olduğuna karar vermek zordu
- İyi pelikan-bisiklet görselleri üreten laboratuvarlar, diğer hayvan-taşıt kombinasyonlarını da iyi çizme eğilimindeydi
- Görsel değerlendirme yeniden üretmesi zor ve kişiden kişiye değişebileceği için nicel analiz eklendi
Pelikan ve bisikletin ayrı ayrı performansı
- Tüm modellerin hayvan puanları toplandığında pelikan 8 tür arasında 6. oldu
- cat, whale, raccoon, heron, antelope’tan daha düşük puan aldı
- 7 laboratuvarın tamamı cat, whale ve raccoon’u pelican’dan daha iyi çizdi
- Pelikanın kendisi cat’ten daha zor çiziliyor olabilir; bu nedenle yalnızca bu sıralama, ayrı bir öğrenme olasılığını dışlamak için yeterli değil
- Bisiklet, 6 taşıt arasında sondan ikinci oldu ve son sıradaki plane ile neredeyse aynı seviyedeydi
- Bisiklet için birbirine uyan iki tekerlek, iki aksı bağlayan bir kadro, gidon, sele ve pedal gerekir
- Değerlendirme modeli, bisiklet görsellerinin yaklaşık üçte ikisinde bu öğelerden birinin eksik olduğunu veya düzgün bağlanmadığını düşündü
- Bisiklet de skateboard gibi daha basit taşıtlardan daha zor olduğundan, ayrı olarak öğrenilmiş olsa bile göreli sıralaması düşük kalabilir
‘plane’ prompt’unun yarattığı belirsizlik
- “airplane” yerine “plane” kullanılması nedeniyle bazı modeller bunu uçak değil geometrik düzlem olarak yorumladı
- Bunun sonucunda hayvanın bir uçağa binmesi yerine düz bir yüzey üzerinde durduğu görseller üretildi
- Özellik çıkarıcının hiçbir taşıt bulamadığı örnekler yalnızca plane’de görüldü
- 168 plane görselinin 25’inde taşıt tanınmadı
- Diğer 5 taşıtta böyle bir örnek yoktu
- Plane görsellerinin %20’si taşıt puanında 1 veya 2 aldı
- Bicycle için bu oran %5’ti
- Boat, scooter, skateboard’da 1–2 puanlı görsel yoktu
Kombinasyon sıralaması ve zorluk düzeltmesi
- Pelikan-bisiklet kombinasyonunun ortalama performansı 48 kombinasyon içinde 42. oldu
- Kombinasyonların doğal zorluğu farklı olabileceği için 1.008 görselin tamamına sabit etkili regresyon analizi uygulandı
- Temel formül
score ~ lab + animal × vehicle - Laboratuvar bazlı pelican, bicycle ve pelican-bicycle etkileşim terimleri eklendi
- Dayanıklı standart hatalar kullanıldı
- Temel formül
animal × vehicleterimi, 48 kombinasyonun her birindeki özgün zorluğu soğurur- Laboratuvar bazlı etkileşim terimleriyle ortalama laboratuvara kıyasla benchmark’a özgü artış ve güven aralığı ölçüldü
Regresyon analizinde anlamlı etki bulunmadı
- Laboratuvar bazlı pelikan etkileri -0,11 puan ile +0,14 puan arasında değişti ve hiçbiri istatistiksel olarak anlamlı değildi
- En küçük p değeri bile 0,25 idi
- Laboratuvar bazlı bisiklet etkileri Grok 4.5’in -0,18 puanından (p=0,11) Gemini 3.5 Flash’ın +0,27 puanına (p=0,022) kadar dağıldı
- 7 etkinin yönü pozitif ve negatif olarak bölündü
- p<0,05 koşulunu sağlayan tek model Gemini 3.5 Flash oldu
- Her laboratuvarın pelikan ve bisiklet etkileri çıkarıldıktan sonra, belirli pelikan-bisiklet kombinasyonunda ek kazanımın hiçbiri p<0,05 koşulunu sağlamadı
- En büyük pozitif etki GLM-5.2’nin +0,35 puanı idi; ancak p=0,12’ydi
- Deneyde sinyale en yakın sonuçtu, fakat rastlantı sınırında kaldı
- Pelikan etkisi ve pelikan-bisiklet hücre etkisi için tüm güven aralıkları 0’ı içerdi
- 21 test p<0,05 ile yapıldığında yalnızca şans eseri yaklaşık 1 yanlış pozitif beklenir
21 × 0.05 ≈ 1.05; gerçekten anlamlı çıkan sonuç da yalnızca Gemini’nin bisiklet etkisiydi- Bonferroni düzeltme eşiği
0.05/21 ≈ 0.002; Gemini’nin p=0,022 değeri bunu geçemedi
- Güven aralığı genişliği ortalama yaklaşık ±0,6 puan olduğundan, bundan daha küçük artış etkilerini bu deneyle yakalamak zordu
Sağa bakan görsel kompozisyonu
- 7 laboratuvarın ürettiği 21 pelikan-bisiklet görselinin tamamı sağa bakıyordu
- 48 kombinasyon içinde tüm görsellerin yönünün aynı olduğu tek kombinasyon buydu
- Ancak 1.008 görselin tamamının %60’ı da sağa baktığı için sağ yön zaten yaygındı
- Taşıtlara göre sağa bakma oranları scooter %83, bicycle %81, skateboard %60, plane %58, unicycle %45, boat %35 idi
- Hayvanlara göre sağa bakma oranları antelope ve pelican için ayrı ayrı %78, heron %77, whale %65, flamingo %64, otter %45, cat %40, raccoon %36 idi
- Pelikanı veya bisikleti önden çizmek zor olduğundan modeller genelde sol-sağ yan kompozisyonu seçiyor; bu yüzden yönü belirsiz görseller de az
- Diğer kombinasyonlarda da yüksek yön tutarlılığı görüldü
- antelope-scooter ve pelican-scooter kombinasyonlarında 21 görselin 20’si aynı yöndeydi
- heron-bicycle’da 21 görselin 19’u aynı yöndeydi
- 48 kombinasyondan birinde 21 görselin tamamının aynı yönde olması tek başına özel bir aykırı değer sayılmak için yeterli değil
Sahne öğelerinde ezber izi arama
- Gemini 3.1 Flash-Lite’ın görselde bulduğu sahne öğeleri serbest biçimde çıkarıldı ve ezberlenmiş kompozisyonların tekrarlanıp tekrarlanmadığı incelendi
- Bazı kombinasyonlarda belirli öğeler sıkça tekrarlandı
- flamingo-boat görsellerinin tamamında güneş vardı
- otter-plane görsellerinin %38’inde atkı göründü
- cat-bicycle görsellerinin %38’inde sepet bulunuyordu
- Pelikan-bisiklet’te de bazı öğelerin sıklığı yüksekti; ancak diğer hayvan-taşıt kombinasyonlarından ayrışan özel bir tekrar örüntüsü bulunmadı
Tek değerlendirme modeli ve sınırlı bütçe
- Tüm puanlar tek bir değerlendirme modeli olan GPT-5.6 Luna tarafından, her görsele tek tek bakılarak verildi
- Değerlendirme ölçütü hizalaması yeterince yapılmadı ve yeniden değerlendirmede tutarlılık da kontrol edilmedi
- Değerlendirme modeli çizimleri güvenilir biçimde yargılayamıyorsa nicel sonuçların değeri düşer
- Değerlendirme modeli ile katılımcı model GPT-5.6 Terra’nın aynı ürün ailesinden olması da bir kısıt
- Ancak her laboratuvar 48 kombinasyonun tamamını ürettiği için, belirli bir laboratuvarın çizim tarzı tercih edilse bile tüm ızgaranın puanı birlikte yükselir
- Analiz, laboratuvar içindeki kombinasyon farklarını karşılaştırdığı için bu tür bir tercih temel sonucu değiştirmez
- Belirli bir prompt değil de SVG üretiminin tamamını veya “taşıta binen hayvan” gibi bir kategoriyi optimize eden SVGmaxxing tespit edilemez
- Tüm hücrelerin performansı birlikte artacağı için, sadece SVG’yi iyi üreten bir modelden ayırt edilemez
- Google/DeepMind bu tür optimizasyonu açıkça yapıyor
- Tüm deneyin maliyeti yaklaşık 80 dolar API kredisi oldu
- Hücre başına 3 örnek, 1 değerlendirme modeli ve 7 katılımcı modelle sınırlı kaldı
- Prompt’lar ve pipeline yeterince yinelenerek iyileştirilemedi; bu yüzden “plane” ve “airplane” gibi sorunlar kaldı
Belirli prompt optimizasyonuna dair kanıt yok
- Pelikan diğer hayvanlardan daha iyi çizilmedi, bisiklet de diğer taşıtlardan üstün değildi; hiçbir laboratuvar, ayrı pelikan ve bisiklet performansından beklenen seviyeye kıyasla bu kombinasyonu anlamlı biçimde daha iyi çizmedi
- GLM-5.2 belirli pelikan-bisiklet hücresinde en büyük artışı kaydetti, ancak etki küçük ve istatistiksel olarak anlamlı değil
- 21 görselin tamamının sağa bakması dikkat çekici, fakat genel olarak sağ yönlü kompozisyon yaygın ve diğer üç kombinasyon da %90’ın üzerinde uyum oranı gösterdi
- Yalnızca belirli benchmark’ı hedefleyen pelicanmaxxing yerine, SVG üretimini genel olarak güçlendiren SVGmaxxing daha olası bir biçim; ancak bu deneyle hangi laboratuvarın bunu yaptığını ayırt etmek mümkün değil
1 yorum
Hacker News yorumları
Başka hayvan ve taşıt kombinasyonlarını da ara sıra kontrol ettim; hayalim, belirli bir yapay zeka laboratuvarının özellikle bisiklete binen pelikanı çizmede olağanüstü iyi olduğuna dair kanıt bulmaktı.
Dylan’ın 8×6 kombinasyonla 1.008 SVG üretme metodolojisi düşündüğümden çok daha sağlam. Ancak hiçbir modelde bisiklete binen pelikanın diğer kombinasyonlardan belirgin biçimde daha iyi çıktığı bir durum bulamadım.
Kalabalık bir pazarda benchmark’ı geçmek giriş ücretidir; ancak yalnızca belirli bir sahneyi hardcode edip komşu problemleri iyileştirmeyen dar optimizasyonlar sorunludur. GPU alanındaki ATI kartlarına yönelik “Quack3” benchmark’ını hatırlatıyor.
Bisiklete binen pelikanın sağa bakması doğal. Bisikletin aktarma sistemi sağ tarafta olduğundan, kadro tarafından kapanmadan göstermek için sağ yandan çizilir; eğitim verilerinde de bu kompozisyonun yansımış olma ihtimali yüksek.
Kaynak: https://www.rei.com/c/bikes
Dikkatli bakınca, hayvanın yönünden bağımsız olarak tüm bisikletlerin sağa baktığı ve balina hariç binicilerin iki bacağının da bisikletin sağ tarafında yer aldığı görülüyor. Bu, bisikletin nasıl çalıştığına dair ciddi bir gerçek anlayış eksikliğine işaret ediyor.
Simon Willison her SVG yayımladığında, “artık kesin eğitilmiştir” diyerek değerlendirmeyi göz ardı eden tepkiler geliyordu; ancak böyle bir eğitimin ne kadar kolay tespit edilebileceğini mantıksal olarak açıklayan bir yazı da vardı. Küçük hayvanların bisiklete bindiği sonuçların nicel analizini görmek sevindirici.
https://simonwillison.net/2025/Nov/13/training-for-pelicans-...
Bu sonuçlar, böyle bir iyileşmenin henüz gerçekleşmediğini gösteriyor. Hatta çevrimiçi kötü sonuçları öğrenerek performansın düşmüş olması da mümkün.
Daha makul açıklama SVG optimizasyonuysa, burada “optimizasyon”un ne anlama geldiğini de irdelemek gerekir. SVG’yi daha iyi çizme becerisi başlı başına faydalı bir yetenektir.
Benzer bir deneye bir varyasyon daha ekledim. Belirli bir kuş ya da ulaşım aracı belirtilmediğinde de modelin kendiliğinden bisiklete binen pelikanı seçip seçmediğini kontrol ettim.
Sonuç: https://www.modelbias.ai/pelican-on-a-bicycle-test
Orijinal veri GitHub’da açık: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...
LLM ile SVG yaptırmak, bir insan ressama koordinat listesini okuyup resim çizdirmek gibi; çok zor ve doğal olmayan bir iş. Günümüz görüntü üretim modelleri yapısı kusursuz bisikletler ve gerçekçi pelikanlar kolayca üretebiliyor, ama sonuç yalnızca raster görüntü oluyor.
Görüntüyü SVG yollarına veya fırça darbesi komutlarına ayırıp yeniden üretme aşaması eksik; bunu doğru yapmak sahne yapısına dair gerçek bir anlayış gerektiriyor, ancak yapay zeka bu konuda hâlâ zayıf.
LLM çıktısını puanlama yöntemi olarak bilindiği andan itibaren, fon karar vericileri ve laboratuvarlar bu metriğe ilgi gösterip kalibre etmeye başlar. En iyi durumda SVG yetkinliğini genel olarak geliştirirken pelikan üretimini de birlikte optimize ederler; ancak artık bilinen bir ölçüt hâline geldiği için güvenilir bağımsız değerlendirme olarak kullanılması zorlaşır.