1 puan yazan GN⁺ 2024-09-26 | 1 yorum | WhatsApp'ta paylaş
  • XKCD 1425 “Tasks”, görünüşte kolay görünen işlerin gerçekte bambaşka bir zorluk seviyesine sahip olabileceğini anlatan, yazılım geliştirme sezgisi üzerine bir karikatür ve 24 Eylül 2024 itibarıyla 10. yılına girdi
  • Karikatürdeki “fotoğrafın bir kuş olup olmadığını doğrulamak” örneği o dönemde doktora düzeyinde zor bir problemdi, ancak bugün vision LLM, CLIP, ResNet+ImageNet gibi yöntemlerle kolayca çözülebilen bir görev haline geldi
  • Belirli örnekler teknolojik ilerlemeyle değişmiş olsa da, hangi problemlerin kolay hangilerinin zor olduğunu değerlendirmek için hâlâ derin deneyim gerekiyor
  • LLM'lerin matematik veya olgusal bilgi sorgulama gibi zayıf alanları olduğundan, hangi işleri güvenilir biçimde devredebileceğini sezgisel olarak değerlendirmek daha da zorlaştı
  • Claude Artifact'in görsel analiz kısıtı örneğinde olduğu gibi, yapay zeka destekli programlamada yalnızca model yeteneklerini değil, CSP header gibi web güvenliği kısıtlarını da birlikte anlamak gerekiyor

XKCD 1425'in 10 yıl sonra da bıraktığı soru

  • XKCD 1425 “Tasks”, yazılım geliştirmede hangi işlerin kolay, hangilerinin zor olduğunu deneyim olmadan değerlendirmenin ne kadar güç olduğunu gösteren bir karikatür
  • Karikatürün en bilinen örneği olan “fotoğrafın bir kuş olup olmadığını doğrulamak”, geçmişte doktora düzeyinde bir problemdi; bugün ise çeşitli bilgisayarlı görü teknikleriyle kolayca çözülebiliyor
  • Örneğin kendisi teknolojik ilerlemeyle değişmiş olsa da, kolay problemlerle zor problemleri ayırt etme becerisi hâlâ ciddi deneyim gerektiriyor

LLM'lerin ve yapay zeka destekli programlamanın yarattığı yeni zorluklar

  • LLM'lerin hangi görevleri güvenilir biçimde çözebileceğini değerlendirmek sezgisel değil
    • LLM'ler bilgisayar sistemi olmalarına rağmen matematikte zayıf
    • Olgusal bilgi sorgulamada da istikrarlı değiller
  • Yapay zeka destekli programlama araçları yaygınlaştıkça, daha fazla insan kendi özel yazılımlarını oluşturmaya başladı
  • Yeni ortaya çıkan yapay zeka destekli acemi programcılar, kolay görevlerle zor görevler arasındaki farkı hızlıca öğrenmek zorunda
  • Claude'un kendisi görsel analiz yapabilse de, Claude Artifact içinde görsel analiz aracı geliştirilemediğine dair bir örnek var
    • Bunu anlamak için, Artifacts sunulurken kullanılan CSP header'larının üretilen kodun harici LLM API çağrıları yapmasını engellediğini bilmek gerekiyor

1 yorum

 
GN⁺ 2024-09-26
Hacker News görüşleri
  • AI/ML’de etkileyici sayılan çıtanın ne kadar çok yer değiştirdiği şaşırtıcı
    10 yıl önce GAN makalesi çıktığında, üretilen görüntü kalitesinin inanılmaz olduğu düşünülerek herkes heyecanlanmıştı: https://arxiv.org/abs/1406.2661
    Bu süre içindeki ilerleme miktarı gerçekten inanılması güç düzeyde

    • Aklımda kalan bir şaka var: Sıradan insanlar bilgisayarların yeteneklerini insan eşdeğerine çevirerek yanlış anlıyor
      Örneğin bir çocuk temel aritmetik yapabiliyor ve bilgisayar da temel aritmetik yapabiliyor; o halde çocuk konuşabiliyorsa bilgisayarın da doğal olarak konuşabileceğini düşünüyorlar
      Oysa bilgisayarların yetenekleri tamamen farklı bir yoldan ulaşılan sonuçlar. İlginç biçimde LLM’lerde yeteneklerin hatları insana daha çok yaklaştı, ama sonuca ulaşma biçimleri hâlâ tamamen farklı
    • 10-15 yıl önce işimde bugünkü LLM’ler olsaydı ne kadar emekten tasarruf edeceğimi anlatamam
      En korkunç örnek, müşterinin normalize etmemizi istediği, kullanıcıların oluşturduğu yaklaşık 180 bin metin tarifti. Porsiyon ayarlama, besin bilgisi hesaplama vb. için miktarları, birimleri, malzemeleri, adımları ve benzerlerini çıkarmak gerekiyordu
      Ön işleme için dağ gibi regex ve tek tek normalleştirme yapan bir stajyer ordusundan oluşan bir araç zinciri gerekiyordu; stajyerlerin yarattığı karmaşayı düzeltmek de çok daha fazla zaman alıyordu
      LLM olsaydı neredeyse anında bitecek bir iş olurdu. Tam bir çöp yığınını kullanılabilir veriye çevirmemiz gereken sayısız işte LLM muhtemelen bunu öylece yapardı
      O günlerin acısı, bu gidişatı görüp o sıralarda NVDA almış olmakla biraz hafifledi
    • OpenAI ChatGPT’yi çıkardıktan sonra herkes para beklentisiyle araştırmasını kapattığı için, ilerleme hızı birden azalmış gibi geliyor
    • Beklentilerdeki değişimin kitlenin değişimiyle yakından ilgili olduğu görünüyor
      Eskiden yeni makine öğrenimi modellerini arka plan bilgisi olan uygulayıcılar tartıştığı için, görünüşte küçük bir iyileştirmenin neden önemli olduğunu ve makul beklentilerin ne olduğunu anlayabiliyorlardı
      Şimdi ise yeni makine öğrenimi, daha doğrusu “AI” modellerini teknik arka planı bilmeyen ama pazarlama abartısını bilen genel kitle değerlendiriyor. Dil ile ilgili benchmark’ları ezip geçen harika bir dil modeli verseniz bile beklentiler saçma derecede yüksek olduğu için sonuç hep hayal kırıklığı oluyor
      Bir dil modelinin, bir zamirin hangi nesneye işaret ettiğini anlamak gibi dilbilgisi ve sözdiziminde görece “basit” işleri yapabilmesi hâlâ beni şaşırtıyor. Ama çoğu insan dili ya da bilgisayarları hiç bu açıdan düşünmediği için bunun ne kadar zor ve etkileyici olduğunu göremiyor
    • “İnsanlar 1 yıl içinde yapılabilecekleri abartır, 5 ya da 10 yıl içinde yapılabilecekleri ise küçümser” sözü yapay zeka beklentilerine de iyi uyuyor gibi görünüyor
  • Bu karikatür bana hep biraz tuhaf gelmiştir. İnsanlar navigasyon problemini çözmek için binlerce yıl harcadı
    Bu karikatür, bir işin nihayet “çözüldüğü” ve başka bir işin daha yeni başladığı kısa bir dönemde var oldu
    Model eğitmenin çok enerji harcadığını düşünüyorsanız, uydu takımlarını ayakta tutmak için roket filoları fırlatmayı da düşünmek gerekir

    • Bunu, teknik olmayan insanların neyi zor gördüğü arasındaki farktan bahsediyor diye yorumladım
      Kariyerim boyunca toplantıda ortaya atılan anlık bir gereksinimin proje tahminlerini aylarca değiştirdiği birkaç kez oldu
    • Navigasyon problemlerinde de çoğu uygulamanın hâlâ düzgün ele almadığı zorluklar var
      Örneğin perakende siteleri veya uygulamalarındaki mağaza bulucular genelde mevcut konum ile mağaza arasındaki kuş uçuşu mesafeyi hesaplayıp belirli bir aralıktaki mağazaları mesafeye göre gösterir
      Puget Sound’un batısında, Seattle yakınlarındaki Kingston gibi yerlerde bu sorun olur. Walgreens mağaza bulucu, Kingston yakınında yapılan aramada 10 mağaza gösteriyor; bunların 9’u Puget Sound’un karşı yakasında, Seattle tarafında. Arabayla giderseniz tek yön yaklaşık 20 dolar ve 30 dakikalık bir feribota binmeniz gerekiyor
      Batıda gösterilen tek mağaza Bainbridge Island mağazası; bu da Kingston’da yaşayan birinin gitmeye değecek bir yer değil. Gerçekte Silverdale mağazası yol mesafesi açısından daha yakın, ama kuş uçuşu mesafede biraz daha uzak
      Silverdale, Bremerton’daki 3 mağaza ve Port Orchard’daki 1 mağaza, zaman ve yol masrafı açısından Kingston’a Seattle tarafındaki mağazalardan çok daha yakın, ama haritada görünmeleri için “load more” düğmesine basmak gerekiyor
      Yerel stok kontrolü de benzer: Bir ürünün “yakında” olduğu söyleniyor, ama gerçekte çoğu zaman yalnızca Puget Sound’un karşı tarafındaki mağazalarda bulunuyor
    • Tam da meseleye yakın olan şey bu. Sıradan insanlar için navigasyon gibi işler çok daha karmaşık görünür, ama bugün herkes bunu birkaç saat içinde yapabiliyor
      Buna karşılık dışarıdan daha basit görünen bir iş, kolayca çözülüp API olarak sunulmadığı için yıllar sürebiliyordu. Elbette artık mümkün
    • Bence mesele GPS değil, GIS. Yani sorun navigasyon değil, “bu nokta bu çokgenin içinde mi?” problemi; bu da biraz daha kolay sayılır
    • Bu gözlem karikatürün ana fikriyle çelişmiyor. Genel olarak hangi işlerin zor olduğundan değil, mevcut teknolojiyle neyin zor olduğundan bahsediyor
      Yani geliştirici olmayanların, mevcut teknolojinin hangi işleri önemsiz hale getirdiğini ve hangi işleri çözemediğini bilmesi zordur. Zamanla iki kategorinin dağılımı değişir, ama sıradan insanların bunu kolayca bilememesi değişmez
      Bugün yaptığımız her şey de baştan yeniden inşa edilecek olsa aşırı derecede zor olurdu; ancak pratikte baştan yeniden inşa etmemiz gerekmediği için yapılması zor işler değildir
  • “İyi yaşlanmadı” denebilir belki ama asıl mesele olan “kolay olanla fiilen imkânsız olan arasındaki farkı açıklamak zordur” noktası bence daha da güçlendi.
    Neredeyse ironik biçimde, zor işler ile kolay işler yer değiştirdi. 10 yıl önce bunu kim tahmin edebilirdi?

    • Bence iyi yaşlandı. Aslında o problem, yayımlandıktan 5 yıl sonra kolaylaştı.
    • xkcd’nin kendi alternatif metnine bakmaya değer: 60’larda Marvin Minsky, birkaç lisans öğrencisine yaz boyunca kamerayla bir sahnedeki nesneleri tanımlayan bir program yaptırdı. Yaz sonuna doğru problemin çözüleceğini düşünmüştü ama yarım yüzyıl sonra hâlâ aynı problemle uğraşıyoruz.
    • 2014’te bile, yeni araştırmanın kendisinden ziyade, kuşları tanımlamak için çok miktarda kuş öğrenme verisi gerektiği açıktı.
      https://en.wikipedia.org/wiki/DeepFace
    • Kişisel olarak, tam da bu karikatürün yapay zeka devrimini tetiklediği düşüncesini aklımdan atamıyorum.
      Yanlış hatırlamıyorsam birkaç hafta ya da ay sonra Yahoo/Flickr tarafından bu problem, yani kuş tanıma üzerine bir makale çıktı ve o andan itibaren her şey bir gecede patlamış gibi göründü. Aslında öyle olmadığını biliyorum ama bana öyle görünmüştü.
    • Her bir işin gerektirdiği hesaplama miktarı ve enerjiye bakınca, insanlara basit görünen problemlerin hâlâ çözmesi daha zor tarafta olduğu sözü doğru.
  • LLM’lerin güvenilir biçimde çözebildiği ve çözemediği işleri anlamak hâlâ çok zor ve sezgisel değil.
    Geçenlerde kızım bir sunum hazırlarken “Baba, sebzelerle HELLO kelimesi yapılmış bir fotoğraf bulabilir misin?” diye sordu.
    “Tabii ki, bu tam ChatGPT’lik iş” diye düşündüm ama ChatGPT uzay kıyafeti giymiş bir kedinin martini içtiği bir görsel oluşturabilse de, sebzelerle HELLO yapılmış bir görseli kesinlikle oluşturamadı.
    Sonunda alfabenin her harfini sebzelerle ayrı ayrı oluşturmasını istedim; kızım da bunları birleştirip sunumda kullanacağı kelimeyi yaptı.

    • ChatGPT’nin gerçekte nasıl çalıştığını bilince bu tür hikâyeler hep eğlenceli oluyor. Tokenizasyonu bilirseniz bunun neden ChatGPT’ye uygun bir iş olmadığını hemen anlarsınız.
      STRAWBERRY kelimesindeki harfleri doğru sayamamasıyla tamamen aynı neden. Meyve ya da sebze kavramını bilmemesinden de, metafor veya meme gibi karmaşık kavramları anlayamamasından da değil.
      Model “hello”yu tek tek harflerden oluşan bir kelime olarak değil, tek bir token olarak; gpt-4o’da ID’si 24912 olan bir token olarak görür. Bu token’ın anlamını ve diğer token’larla ilişkisini bilir ama kelimeyi oluşturan harflerin kendisi hakkında temelde bilgisi yoktur. Ayrı olarak öğrenmiş olması ya da eğitim verisindeki tesadüfi ek ilişkilerden yararlanması istisna.
    • flux.1 ile mümkün. Bildiğim kadarıyla şu anda metin işleme konusunda en iyi görüntü modeli.
      Replicate’te flux-pro kullanıp “vegetables spelling out the word "HELLO"” yazınca çıkan sonuç: https://ibb.co/1RVKmdk
    • Ideogram v2 ilk denemede şöyle çıktı:
      https://ideogram.ai/assets/image/lossless/response/v_LgyXI1Q...
      https://ideogram.ai/assets/image/lossless/response/V4RRDJZJS...
      İlk görseldeki havuç biraz komik.
      Bonus Hacker News: https://ideogram.ai/assets/image/lossless/response/SW0B7y4jR...
    • Grok 2 Mini Beta oldukça iyi başardı.
      https://i.imgur.com/mvnusFd.jpeg
    • Az önce ChatGPT 4o ile denedim; yalnızca ilk prompt ile gayet yeterli bir sonuç verdi.
      Prompt’u yukarıdaki yorumdan aynen kopyaladım: https://chatgpt.com/share/66f530b0-3fb8-800a-8af9-8a3e48a31a...
  • Fotoğrafta yaygın kuş renkleri olup olmadığını algılayıp piyasaya sürmek yeterli. Rakipleri ezdikten sonra sonra düzeltirsiniz.

  • Derin öğrenmenin bağlamını ve temellerini kavramak için bu eğitim serisini takip ettim; ilk ders tam da bu karikatürdeki kuş ayırt ediciyi yapmakla ilgiliydi.
    Gerçekten kolay ve eğlenceliydi, tüm kurs da harika. Programlama geçmişi olan ve derin öğrenmeye sağlam bir giriş yapmak isteyen herkese şiddetle tavsiye ederim.
    https://course.fast.ai/

  • Kimse değinmiyor ama LLM’ler isteğin ilk kısmında da en az ikinci kısmında olduğu kadar ilerledi.
    ChatGPT is_point_in_national_park fonksiyonunu yazıyor ve ilgili shapefile’ı da yaklaşık 30 saniyede söylüyor. Karikatürde söylenen “birkaç saat”ten yüzlerce kat hızlı yani.

  • Görsel LLM’ler gerçekten şaşırtıcı.
    20 binden fazla görseli açıklayıp kataloglayan bir projemiz vardı.
    İnsanların yaptığı geleneksel yöntemle aylar ve muazzam bir maliyet gerektirecek bir işti. Açıklamaların müşterinin okuyabileceği kalitede olması gerekiyordu.
    OpenAI’nin görsel API’si bunu görsel başına birkaç sente yaptı; toplam maliyet muhtemelen 200 doların bile altında kaldı.

    • OpenAI’nin açıklamalarının doğru olup olmadığını insan kontrolünden geçirip geçirmediklerini merak ediyorum.
  • Bu tür yanlış anlamaların büyük ölçüde ortadan kalkacağı kadar teknoloji okuryazarlığının kritik eşiğe ulaşacağı bir gün gelip gelmeyeceğini merak ediyorum
    10 yıl önce olsaydı evet derdim, ama şimdi UX/UI’daki gelişmelerin ve her şeyin uygulamalaşmasının ortalama insanı ayrıntılardan kopardığını düşünüyorum
    Tek tek ürünler açısından bu iyi bir şey, ancak genel olarak gerçekçi olmayan beklentilere yol açabilir. Genç insanların “neden x basitçe y yapmıyor?” diye sorduğunu duydum; eskiden bunun ancak teknolojiyle hiç arası olmayan ebeveyn kuşağından duyulacak türden bir soru olduğunu düşünürdüm
    80’lerde bilgisayarlar birçok insan için neredeyse sihir gibiydi, ama çoğunun bilgisayarlarla fiilen etkileşime girmesi gerekmiyordu. Bilgisayarlara dair beklentilerinin, benim dünya dışı yaşama dair beklentilerim kadar az etkisi vardı
    Ancak teknolojiye yönelik büyüsel düşünmenin hem bireysel hem de toplumsal olarak daha büyük sonuçlar doğurmasından korkuyorum

  • @simonw, eğer bunu okuyorsan senden küçük bir ricada bulunabilir miyim diye merak ediyorum
    Herkese açık şekilde paylaşılabilecek bir kodlama işini canlı yayınlaman çok büyük bir istek mi olur?
    Özellikle günümüz ekosistemi olan Python, SQLite verileri ve JavaScript çevresinde öğrenilecek gerçekten çok şey olacağını düşünüyorum