XKCD 1425 (Görevler) 10. yılında
(simonwillison.net)- XKCD 1425 “Tasks”, görünüşte kolay görünen işlerin gerçekte bambaşka bir zorluk seviyesine sahip olabileceğini anlatan, yazılım geliştirme sezgisi üzerine bir karikatür ve 24 Eylül 2024 itibarıyla 10. yılına girdi
- Karikatürdeki “fotoğrafın bir kuş olup olmadığını doğrulamak” örneği o dönemde doktora düzeyinde zor bir problemdi, ancak bugün vision LLM, CLIP, ResNet+ImageNet gibi yöntemlerle kolayca çözülebilen bir görev haline geldi
- Belirli örnekler teknolojik ilerlemeyle değişmiş olsa da, hangi problemlerin kolay hangilerinin zor olduğunu değerlendirmek için hâlâ derin deneyim gerekiyor
- LLM'lerin matematik veya olgusal bilgi sorgulama gibi zayıf alanları olduğundan, hangi işleri güvenilir biçimde devredebileceğini sezgisel olarak değerlendirmek daha da zorlaştı
- Claude Artifact'in görsel analiz kısıtı örneğinde olduğu gibi, yapay zeka destekli programlamada yalnızca model yeteneklerini değil, CSP header gibi web güvenliği kısıtlarını da birlikte anlamak gerekiyor
XKCD 1425'in 10 yıl sonra da bıraktığı soru
- XKCD 1425 “Tasks”, yazılım geliştirmede hangi işlerin kolay, hangilerinin zor olduğunu deneyim olmadan değerlendirmenin ne kadar güç olduğunu gösteren bir karikatür
- Karikatürün en bilinen örneği olan “fotoğrafın bir kuş olup olmadığını doğrulamak”, geçmişte doktora düzeyinde bir problemdi; bugün ise çeşitli bilgisayarlı görü teknikleriyle kolayca çözülebiliyor
- Örneğin kendisi teknolojik ilerlemeyle değişmiş olsa da, kolay problemlerle zor problemleri ayırt etme becerisi hâlâ ciddi deneyim gerektiriyor
LLM'lerin ve yapay zeka destekli programlamanın yarattığı yeni zorluklar
- LLM'lerin hangi görevleri güvenilir biçimde çözebileceğini değerlendirmek sezgisel değil
- LLM'ler bilgisayar sistemi olmalarına rağmen matematikte zayıf
- Olgusal bilgi sorgulamada da istikrarlı değiller
- Yapay zeka destekli programlama araçları yaygınlaştıkça, daha fazla insan kendi özel yazılımlarını oluşturmaya başladı
- Yeni ortaya çıkan yapay zeka destekli acemi programcılar, kolay görevlerle zor görevler arasındaki farkı hızlıca öğrenmek zorunda
- Claude'un kendisi görsel analiz yapabilse de, Claude Artifact içinde görsel analiz aracı geliştirilemediğine dair bir örnek var
- Bunu anlamak için, Artifacts sunulurken kullanılan CSP header'larının üretilen kodun harici LLM API çağrıları yapmasını engellediğini bilmek gerekiyor
1 yorum
Hacker News görüşleri
AI/ML’de etkileyici sayılan çıtanın ne kadar çok yer değiştirdiği şaşırtıcı
10 yıl önce GAN makalesi çıktığında, üretilen görüntü kalitesinin inanılmaz olduğu düşünülerek herkes heyecanlanmıştı: https://arxiv.org/abs/1406.2661
Bu süre içindeki ilerleme miktarı gerçekten inanılması güç düzeyde
Örneğin bir çocuk temel aritmetik yapabiliyor ve bilgisayar da temel aritmetik yapabiliyor; o halde çocuk konuşabiliyorsa bilgisayarın da doğal olarak konuşabileceğini düşünüyorlar
Oysa bilgisayarların yetenekleri tamamen farklı bir yoldan ulaşılan sonuçlar. İlginç biçimde LLM’lerde yeteneklerin hatları insana daha çok yaklaştı, ama sonuca ulaşma biçimleri hâlâ tamamen farklı
En korkunç örnek, müşterinin normalize etmemizi istediği, kullanıcıların oluşturduğu yaklaşık 180 bin metin tarifti. Porsiyon ayarlama, besin bilgisi hesaplama vb. için miktarları, birimleri, malzemeleri, adımları ve benzerlerini çıkarmak gerekiyordu
Ön işleme için dağ gibi regex ve tek tek normalleştirme yapan bir stajyer ordusundan oluşan bir araç zinciri gerekiyordu; stajyerlerin yarattığı karmaşayı düzeltmek de çok daha fazla zaman alıyordu
LLM olsaydı neredeyse anında bitecek bir iş olurdu. Tam bir çöp yığınını kullanılabilir veriye çevirmemiz gereken sayısız işte LLM muhtemelen bunu öylece yapardı
O günlerin acısı, bu gidişatı görüp o sıralarda NVDA almış olmakla biraz hafifledi
Eskiden yeni makine öğrenimi modellerini arka plan bilgisi olan uygulayıcılar tartıştığı için, görünüşte küçük bir iyileştirmenin neden önemli olduğunu ve makul beklentilerin ne olduğunu anlayabiliyorlardı
Şimdi ise yeni makine öğrenimi, daha doğrusu “AI” modellerini teknik arka planı bilmeyen ama pazarlama abartısını bilen genel kitle değerlendiriyor. Dil ile ilgili benchmark’ları ezip geçen harika bir dil modeli verseniz bile beklentiler saçma derecede yüksek olduğu için sonuç hep hayal kırıklığı oluyor
Bir dil modelinin, bir zamirin hangi nesneye işaret ettiğini anlamak gibi dilbilgisi ve sözdiziminde görece “basit” işleri yapabilmesi hâlâ beni şaşırtıyor. Ama çoğu insan dili ya da bilgisayarları hiç bu açıdan düşünmediği için bunun ne kadar zor ve etkileyici olduğunu göremiyor
Bu karikatür bana hep biraz tuhaf gelmiştir. İnsanlar navigasyon problemini çözmek için binlerce yıl harcadı
Bu karikatür, bir işin nihayet “çözüldüğü” ve başka bir işin daha yeni başladığı kısa bir dönemde var oldu
Model eğitmenin çok enerji harcadığını düşünüyorsanız, uydu takımlarını ayakta tutmak için roket filoları fırlatmayı da düşünmek gerekir
Kariyerim boyunca toplantıda ortaya atılan anlık bir gereksinimin proje tahminlerini aylarca değiştirdiği birkaç kez oldu
Örneğin perakende siteleri veya uygulamalarındaki mağaza bulucular genelde mevcut konum ile mağaza arasındaki kuş uçuşu mesafeyi hesaplayıp belirli bir aralıktaki mağazaları mesafeye göre gösterir
Puget Sound’un batısında, Seattle yakınlarındaki Kingston gibi yerlerde bu sorun olur. Walgreens mağaza bulucu, Kingston yakınında yapılan aramada 10 mağaza gösteriyor; bunların 9’u Puget Sound’un karşı yakasında, Seattle tarafında. Arabayla giderseniz tek yön yaklaşık 20 dolar ve 30 dakikalık bir feribota binmeniz gerekiyor
Batıda gösterilen tek mağaza Bainbridge Island mağazası; bu da Kingston’da yaşayan birinin gitmeye değecek bir yer değil. Gerçekte Silverdale mağazası yol mesafesi açısından daha yakın, ama kuş uçuşu mesafede biraz daha uzak
Silverdale, Bremerton’daki 3 mağaza ve Port Orchard’daki 1 mağaza, zaman ve yol masrafı açısından Kingston’a Seattle tarafındaki mağazalardan çok daha yakın, ama haritada görünmeleri için “load more” düğmesine basmak gerekiyor
Yerel stok kontrolü de benzer: Bir ürünün “yakında” olduğu söyleniyor, ama gerçekte çoğu zaman yalnızca Puget Sound’un karşı tarafındaki mağazalarda bulunuyor
Buna karşılık dışarıdan daha basit görünen bir iş, kolayca çözülüp API olarak sunulmadığı için yıllar sürebiliyordu. Elbette artık mümkün
Yani geliştirici olmayanların, mevcut teknolojinin hangi işleri önemsiz hale getirdiğini ve hangi işleri çözemediğini bilmesi zordur. Zamanla iki kategorinin dağılımı değişir, ama sıradan insanların bunu kolayca bilememesi değişmez
Bugün yaptığımız her şey de baştan yeniden inşa edilecek olsa aşırı derecede zor olurdu; ancak pratikte baştan yeniden inşa etmemiz gerekmediği için yapılması zor işler değildir
“İyi yaşlanmadı” denebilir belki ama asıl mesele olan “kolay olanla fiilen imkânsız olan arasındaki farkı açıklamak zordur” noktası bence daha da güçlendi.
Neredeyse ironik biçimde, zor işler ile kolay işler yer değiştirdi. 10 yıl önce bunu kim tahmin edebilirdi?
https://en.wikipedia.org/wiki/DeepFace
Yanlış hatırlamıyorsam birkaç hafta ya da ay sonra Yahoo/Flickr tarafından bu problem, yani kuş tanıma üzerine bir makale çıktı ve o andan itibaren her şey bir gecede patlamış gibi göründü. Aslında öyle olmadığını biliyorum ama bana öyle görünmüştü.
LLM’lerin güvenilir biçimde çözebildiği ve çözemediği işleri anlamak hâlâ çok zor ve sezgisel değil.
Geçenlerde kızım bir sunum hazırlarken “Baba, sebzelerle HELLO kelimesi yapılmış bir fotoğraf bulabilir misin?” diye sordu.
“Tabii ki, bu tam ChatGPT’lik iş” diye düşündüm ama ChatGPT uzay kıyafeti giymiş bir kedinin martini içtiği bir görsel oluşturabilse de, sebzelerle HELLO yapılmış bir görseli kesinlikle oluşturamadı.
Sonunda alfabenin her harfini sebzelerle ayrı ayrı oluşturmasını istedim; kızım da bunları birleştirip sunumda kullanacağı kelimeyi yaptı.
STRAWBERRY kelimesindeki harfleri doğru sayamamasıyla tamamen aynı neden. Meyve ya da sebze kavramını bilmemesinden de, metafor veya meme gibi karmaşık kavramları anlayamamasından da değil.
Model “hello”yu tek tek harflerden oluşan bir kelime olarak değil, tek bir token olarak; gpt-4o’da ID’si 24912 olan bir token olarak görür. Bu token’ın anlamını ve diğer token’larla ilişkisini bilir ama kelimeyi oluşturan harflerin kendisi hakkında temelde bilgisi yoktur. Ayrı olarak öğrenmiş olması ya da eğitim verisindeki tesadüfi ek ilişkilerden yararlanması istisna.
Replicate’te flux-pro kullanıp “vegetables spelling out the word "HELLO"” yazınca çıkan sonuç: https://ibb.co/1RVKmdk
https://ideogram.ai/assets/image/lossless/response/v_LgyXI1Q...
https://ideogram.ai/assets/image/lossless/response/V4RRDJZJS...
İlk görseldeki havuç biraz komik.
Bonus Hacker News: https://ideogram.ai/assets/image/lossless/response/SW0B7y4jR...
https://i.imgur.com/mvnusFd.jpeg
Prompt’u yukarıdaki yorumdan aynen kopyaladım: https://chatgpt.com/share/66f530b0-3fb8-800a-8af9-8a3e48a31a...
Fotoğrafta yaygın kuş renkleri olup olmadığını algılayıp piyasaya sürmek yeterli. Rakipleri ezdikten sonra sonra düzeltirsiniz.
Derin öğrenmenin bağlamını ve temellerini kavramak için bu eğitim serisini takip ettim; ilk ders tam da bu karikatürdeki kuş ayırt ediciyi yapmakla ilgiliydi.
Gerçekten kolay ve eğlenceliydi, tüm kurs da harika. Programlama geçmişi olan ve derin öğrenmeye sağlam bir giriş yapmak isteyen herkese şiddetle tavsiye ederim.
https://course.fast.ai/
Kimse değinmiyor ama LLM’ler isteğin ilk kısmında da en az ikinci kısmında olduğu kadar ilerledi.
ChatGPT
is_point_in_national_parkfonksiyonunu yazıyor ve ilgili shapefile’ı da yaklaşık 30 saniyede söylüyor. Karikatürde söylenen “birkaç saat”ten yüzlerce kat hızlı yani.Görsel LLM’ler gerçekten şaşırtıcı.
20 binden fazla görseli açıklayıp kataloglayan bir projemiz vardı.
İnsanların yaptığı geleneksel yöntemle aylar ve muazzam bir maliyet gerektirecek bir işti. Açıklamaların müşterinin okuyabileceği kalitede olması gerekiyordu.
OpenAI’nin görsel API’si bunu görsel başına birkaç sente yaptı; toplam maliyet muhtemelen 200 doların bile altında kaldı.
Bu tür yanlış anlamaların büyük ölçüde ortadan kalkacağı kadar teknoloji okuryazarlığının kritik eşiğe ulaşacağı bir gün gelip gelmeyeceğini merak ediyorum
10 yıl önce olsaydı evet derdim, ama şimdi UX/UI’daki gelişmelerin ve her şeyin uygulamalaşmasının ortalama insanı ayrıntılardan kopardığını düşünüyorum
Tek tek ürünler açısından bu iyi bir şey, ancak genel olarak gerçekçi olmayan beklentilere yol açabilir. Genç insanların “neden x basitçe y yapmıyor?” diye sorduğunu duydum; eskiden bunun ancak teknolojiyle hiç arası olmayan ebeveyn kuşağından duyulacak türden bir soru olduğunu düşünürdüm
80’lerde bilgisayarlar birçok insan için neredeyse sihir gibiydi, ama çoğunun bilgisayarlarla fiilen etkileşime girmesi gerekmiyordu. Bilgisayarlara dair beklentilerinin, benim dünya dışı yaşama dair beklentilerim kadar az etkisi vardı
Ancak teknolojiye yönelik büyüsel düşünmenin hem bireysel hem de toplumsal olarak daha büyük sonuçlar doğurmasından korkuyorum
@simonw, eğer bunu okuyorsan senden küçük bir ricada bulunabilir miyim diye merak ediyorum
Herkese açık şekilde paylaşılabilecek bir kodlama işini canlı yayınlaman çok büyük bir istek mi olur?
Özellikle günümüz ekosistemi olan Python, SQLite verileri ve JavaScript çevresinde öğrenilecek gerçekten çok şey olacağını düşünüyorum