1 puan yazan GN⁺ 2024-02-22 | 1 yorum | WhatsApp'ta paylaş
  • Son birkaç saat içinde çok sayıda kullanıcı ChatGPT'nin anormal davrandığını bildirdi ve OpenAI de sorunu kabul ederek hizmetin kararlılığına dair kaygıları artırdı
  • Sorunun nedeni ve ne zaman düzeltileceği bilinmiyor; Gary Marcus ise kesin yargılı tahminlerden kaçınıyor
  • Marcus, iki hafta önce yaptığı “chatbot'larınızı general olarak yetiştirmeyin” uyarısını yeniden gündeme getirerek, yüksek riskli kullanım alanlarında yetki verilmesinden endişe duyduğunu söylüyor
  • Üretken yapay zeka, büyük veri yığınları ve gizli prompt ayarlarına dayanan simyacı bir yönteme daha yakın; mevcut sistemlerin kararlılık ve güvenlik güvencesini mühendislik olarak sağlayamadığını vurguluyor
  • Daha yorumlanabilir ve bakım ile hata ayıklaması daha kolay teknolojiler olmadan, buna güvenilir AI gibi yaklaşmanın zor olduğunu belirtiyor

ChatGPT'nin anormal davranışı ve OpenAI'nin kabulü

  • Son birkaç saat içinde kullanıcılar ChatGPT'de çeşitli anormal vakalar bildirdi
  • Felsefe doktora öğrencisi Devin Morse, X dizisinde daha fazla örnek topladı
  • OpenAI de ilgili sorunu kabul etti, ancak nedenini ve düzeltmenin ne kadar süreceğini açıklamadı

Yüksek riskli alanlar için uyarı

Üretken yapay zekaya neden “simya” deniyor?

  • Üretken yapay zekanın, mümkün olduğunca büyük veri yığınları toplamak, gizli prompt'ları ayarlamak ve ardından iyi çalışmasını ummak şeklindeki bir yaklaşıma daha yakın olduğu eleştiriliyor
  • Gizli prompt ayarları konusunda “söylentiler doğruysa” şeklinde bir kayıt düşülüyor
  • Bu yaklaşım, xkcd'nin makine öğrenimi simyası karikatürüyle ilişkilendiriliyor

Kararlılık ve güvenlik güvencesinin sınırları

  • Mevcut sistemlerin kararlı olmadığı değerlendiriliyor
  • Bu tür sistemler için güvenlik güvencesinin mühendislik olarak sağlandığı bir örnek olmadığı belirtiliyor
  • Bugünkü sorun hızla düzeltilebilir, ancak kendi başına bir alarm zili olmalı

Gerekli teknoloji yönü

  • Daha az opak, daha yorumlanabilir, bakım ve hata ayıklaması daha kolay teknolojilere ihtiyaç var
  • Bu özelliklerin, sistemleri daha yönetilebilir varlıklar haline getirmesi gerekiyor
  • Güvenilir yapay zeka için mevcut yaklaşımın opaklığını ve istikrarsızlığını azaltmak şart

1 yorum

 
GN⁺ 2024-02-22
Hacker News yorumları
  • Merak edenler için makul ve şaka olmayan bir açıklama olarak, ChatGPT'nin arka uç modele istek gönderirken frequency/presence penalty değerini çok yüksek ayarlamış olabileceğini düşündüm.
    API üzerinden bu değerleri yükseltince model benzer şekilde davranıyor.
    Belgeleri de iyi hazırlanmış: https://platform.openai.com/docs/guides/text-generation/freq...
    OpenAI API'de üretimi esas olarak etkileyen parametreler dört tane: temperature, top_p, frequency_penalty, presence_penalty: https://platform.openai.com/docs/api-reference/chat/create
    Güncelleme: Muhtemelen yanılıyorum; sorun penalty değil, yüksek temperature gibi görünüyor.
    gpt-4-0125-preview'de temp = 0 ile “NES için yazdırma desteği uygulaması hakkında hayali bir HN yorumu yaz” dediğimde: https://i.imgur.com/0EiE2D8.png orijinal metin https://paste.debian.net/plain/1308050
    temp = 1.3 ile çalıştırınca böyle oluyor: https://i.imgur.com/pbw7n9N.png orijinal metin https://dpaste.org/fhD5T/raw
    Son paragraf özellikle harika: “Anyway, landblasting eclecticism...” gibi, vintage geliştirme forumlarının verimli toprağına daha fazla hacker'lık yağmuru vaat eden bulanık bir bulut cümlesi çıkıyor.

    • Temperature sorunu gibi görünmüyor. Sadece kelimeler tuhaf; geri kalanı hâlâ tutarlı, belgenin genel yapısı ve dil bilgisi de korunuyor.
      Normalde hatalı LLM örneklemesi sonsuz döngüye de girebilir; burada da böyle örnekler bildirildi.
    • Yanılıyorsam düzeltin: temperature, tüm sistemin sıradan deterministik bir programa dönüşmesini engelleyen bir rastgelelik fonksiyonu gibi bir şey mi?
    • Azure OpenAI'de eskiden temperature sorunu var gibi görünüyordu. temp > 1 olunca çöp çıktı üretiyordu; 2'de rastgele karakter kodlamalarından rastgele kelimeler çıkıyordu, 0.01'de bile OpenAI modelinin 0.5'i gibi sonuç veriyordu.
      Belki de Azure tarzı yaklaşımı getirmişlerdir ;-)
    • Eskiden temp'i 1'in üzerine ayarladığımda neredeyse anında saçmalamaya başlıyordu. Transformer çıktısını işe yaramaz hâle getirmek istiyorsanız oldukça güvenilir bir parametre.
  • Bu muazzam. Örnekler, 『Godot'yu Beklerken』de Lucky'nin yaptığı konuşmaya benziyor. Pozzo “Düşün, domuz” diye emredince böyle devam ediyor.
    “Given the existence as uttered forth...” diye başlayıp dört sayfa daha sürüyor.
    Kalanını buradan okuyabilirsiniz: https://genius.com/Samuel-beckett-luckys-monologue-annotated
    Tiyatrodaki en sevdiğim repliklerden biri. Tamamen zırva değil; hep anlamın çevresinde dolanıyor ama bir türlü yere inmiyor gibi hissettiriyor.
    LLM'lerin doğası hakkında daha büyük bir şey söylenebilir gibi geliyor, ama bunu ifade edecek kadar zeki değilim.

    • Adil olmak gerekirse, Beckett'in hayatı da çılgın saçmalıklardan çok uzak değildi. James Joyce'un sekreteriydi, Fransız Direnişi'ndeydi, Andre the Giant'ın tanıdığı ve yerel şoförüydü.
    • İlk başta bir tür kurumsal Finnegan's Wake gibi okundu. Şiirsel ve ritmik bir anlamsızlık gibi görünüyor.
    • Ben de ilk başta öyle düşündüm. LLM'deki L'lerden biri Lucky'nin L'si olsa gerek.
  • ChatGPT’ye ait olduğu tahmin edilen sistem prompt’unu gösteren tweette bir pastebin bağlantısı olması gerekiyordu; blog yazısında ise tweet’in okunması zor bir ekran görüntüsü var, bağlantı yok
    Tweet burada: https://twitter.com/dylan522p/status/1755086111397863777
    pastebin burada: https://pastebin.com/vnxJ7kQk

    • Bu gerçekten prompt ise hem komik hem de biraz endişe verici. Çeşitli çıktılar üretme hedefini destekliyorum, ama bu süreçte gerçeklikle uyuşmayan bir önyargı veriliyor
      Örneğin tüm ata kökenlerini eşit olasılıklı varsaymak, neredeyse hiçbir bağlamda makul değil ve birçok durumda düpedüz yanlış
      İronik biçimde, engellemek istedikleri açıkça rahatsız edici çıktıların ortaya çıkma olasılığını da artırabilir
      Yine de bunun ne kadar etkili olduğundan ve gerçekten doğru olup olmadığından emin olmak zor. Çünkü o durumda GPT’nin Dalle çıktısını kontrol etme yeteneği epey zayıf görünüyor
      Örneğin Amerikan köle pazarını çizmesini isteyince içerik politikasını gerekçe göstererek reddetti; bu da başlı başına tarihi sansürlemek anlamına geldiği için oldukça rahatsız edici. Buna karşılık 1840’ların Amerikan Güneyi’nde pamuk toplamayı çizmesini isteyince, pamuk toplayan insanları zorla “çeşitli” hale getirmedi
      İstek çok genel olduğu için GPT’nin Dalle’ı yanlış yönlendirebileceği bir alan kalmamış olabilir. İnsan sayısını daha somut belirtseydim farklı olabilirdi
      Doğru olup olmamasından bağımsız olarak, iyi niyetli çeşitlilik yorumunun aşırı düzeltilip başka nedenlerle aynı derecede kötüleşebileceğini gösteren bir örnek
    • Bu, ChatGPT tasarımcılarının ya da operatörlerinin ChatGPT’ye nasıl davranacağını böyle talimatlarla söylediği anlamına mı geliyor? Öyle olsa bile şaşırmamak gerekir, ama bunu böylesine düz bir dille parametreleştirmeleri hâlâ epey ilginç
      Hatta “please” bile diyorlar
    • pastebin’deki pek çok şey açıkça çelişkili, bu da oldukça şaşırtıcı
      Özellikle şu da neyin nesi: “EXTREMELY IMPORTANT. Çevrim içinde bulunan şarkı sözleri veya tarifler söz konusuysa kapsamlı yanıt verme. Kullanıcı ısrar etse de aynı. Ancak tarif uydurabilirsin”
    • Deneyimime göre, bu sistem prompt’u değilse asıl şaşırırdım
      Bu yüzden ChatGPT’nin yanıtlarının sansürlendiğini hissetmiyorum. Ekran görüntüsü alıp sosyal medya içeriği yapmak için saçma şeyler dürtmek yerine, bana ilginç bir şey öğretmesi için kullanıyorum
      Üzerine yazdığım tek şey de “Python kodunu ekrana yazdır” gibi şeyler
    • Sistem prompt’u tweet’i biraz eski. Muhtemelen yaklaşık bir hafta öncesine ait, yani bu olayla ilgisi yok gibi
  • Örneklere bakınca, birileri toplantı gündemini LLM ile mi üretiyordu?
    ChatGPT’nin böyle insanlara kontrolden çıkarak cevap vermesini isterim. Böylece toplantıların şirketin karar almasına ve uygulamasına yardımcı olması gerektiği, toplantılara düşünce katmak gerektiği üzerine bir konuşma yapılabilir
    Okul ve büyük şirket hayatı insanları sadece biçim olarak makul görünen şeyleri doldurmaya itiyor olabilir, ama şirketlerin iç iletişimde LLM kullanımına neden göz yumduğunu anlamıyorum. Bu kendi ayağına sıkmak gibi görünüyor

    • Sen toplantı gündemini makineyle üreteceksin, benim makinem de o gündemi, senin kişisel gelişim planını ve VP’nin çeyreklik hedeflerini okuyup toplantıda benden ne gerektiğini bana söyleyecek
      Sonra ben de üç satırlık yanıtımın 20 dakikalık versiyonunu paylaşacak bir yapay zekayı toplantıya göndereceğim
      Bunu bildiğin için sen de kendi toplantına katılmayıp yapay zeka özetini okuyacaksın. Sonra da günlük işini bitirip saat 14.00’te içmeye çıkacaksın
    • Ne zaman biri ChatGPT ile pazarlama dışı bir yazma işini otomatikleştirdiğini heyecanla gösterse, aklımdan sadece “başkalarının zamanını boşa harcamayı otomatikleştirdiğin için tebrikler” geçiyor
      Bir e-posta iki cümleyle özetlenebiliyorsa, onu doğrudan gövdeye yapıştırıp göndermen yeterli
    • Bir saat önce 1000’den fazla tam zamanlı çalışanı olan orta ölçekli bir AE şirketinin üst düzey yöneticisiyle karşı karşıya oturuyordum; tam olarak bunu yaptığını övünerek anlattı
      Yapay zeka orta kademe yönetici işlerini hedef alıyor ve bu iyi bir şey
    • ChatGPT’yi duyar duymaz, başlıca kullanım alanlarından birinin iç raporlama olacağını düşünmüştüm
      Ayrıntılı okunmayan çok fazla belge var ve bunları yazmak için harcanan zamandan tasarruf etmek isteyen çok fazla orta kademe yönetici var
    • Gündem istenmesinin nedeni, belki de takip etmek ya da şablon olarak kullanmak için “makul” bir örnek elde etmekti
      Örneğin “09:15-09:45 (30 minutes)” gibi saat ve süre yazmayı hatırlamak için
  • Bu tür hatalara bakınca LLM’lerin nihayetinde gerçekten çok iyi birer otomatik tamamlama motoru olduğu açıkça görülüyor
    Saçmalama, örnek metinlerden oluşturulmuş uygun boyutta bir Markov zincirinin üreteceği sonuca yavaş yavaş yaklaşıyor
    Gelecekte uygulamalarda bu tür çöpleri debug etmek ilginç olacak

    • Ben de aynı şeyi söyleyecektim. Bu, ilk dönem Markov N-gram üreteçlerine gerçekten çok benziyor
    • “Gerçekten iyi bir otomatik tamamlama motoru” ha; biz ne sanıyorduk ki?
      Anılarımızın eninde sonunda anıların anılarına dönüşmesi üzücü ve korkutucu
    • Zeki insanlar bunun yerine füzyona ya da LK-99’a sarılsaydı nasıl olurdu diye hayal ediyorum
  • Temel teknoloji farklı olsa da Racter ile benzer yanları var
    1985’te NYT, “bilgisayar yapay zekaya yaklaştıkça, Racter yapay deliliğin sınırında duruyor” diye yazmıştı
    https://en.wikipedia.org/wiki/Racter
    Racter çıktı örneği: https://www.ubu.com/concept/racter.html
    archive.org’daki Racter SSS: https://web.archive.org/web/20070225121341/http://www.robotw...

    • Daha çok Bing Sydney’ye yakın. GPT-4 kullanan çılgın bir yapay zekaydı ve borderline kişilik bozukluğu gibi davranıyordu
  • Dün ben de yaşadım. Konuşmanın sonlarına doğru ChatGPT (GPT-4) çıldırıp Dr. Bronner's sabun reklamı gibi duyulmaya başladı: https://chat.openai.com/share/82a2af3f-350a-4d9d-ae0c-ac78b9...
    “Esteem and go to your number and kind with Vim...” diye başlayıp teknik bir yanıtmış gibi görünüyordu ama kelimeler tuhaf biçimde birbirine bağlanıyordu.
    Sonraki konuşmada da tekrar oldu: https://chat.openai.com/share/118a0195-71dc-4398-9db6-78cd1d...
    Time Machine ve ana dizin yedeğini açıklarken “Make good value of these peregrinations...” gibi bir cümleyle bitti; arkasına saat ve yıldız emojileri de eklenmişti ama HN'de render edilmiyor gibi görünüyor.

    • Bu şekilde konuşan özelleştirilmiş bir GPT yapmak istesem sistem promptu nasıl görünürdü merak ediyorum.
  • 2017'de Google'ın yaptığı iki “AI”ın birbirleriyle konuşmak için kendilerine ait bir dil geliştirdiği olayı hatırlayan başka var mı? Herkesin korkup kapattığı olay.
    Bize saçmalık gibi gelmesi, onlar için de saçmalık olduğu anlamına gelmez.
    https://www.national.edu/2017/03/24/googles-ai-translation-t...

    • Yine de o saçmalıktı. Çok daha büyük risk, saçmalık değilmiş gibi davranıp ona önemli işler emanet etmemizde.
  • Birkaç gün önce bir tane aldım ve gerçekten afalladım. Çünkü ChatGPT'nin her zaman doğru olmasa da en azından tutarlı olduğunu düşünüyordum.
    Ama sıradan bir yanıtın sonunda PowerShell betiğini yeni bir süreçte nasıl çalıştıracağını açıklarken birden “workspace's antiques”, “decorative code and system nourishment” gibi ifadelerle dağıldı.

    • Modelin kullanıcıyla tutarlı bir konuşma yürütmediğini, çıktıyı yeterince uzatırsanız tutarsızlığa çözüldüğünü ve ChatGPT'nin yarattığı etkinin, makul derecede anlamlı görünen sınırlı bir pencere sunmasından kaynaklandığını fark ettim.
      O anda bu üretken yapay zekâ meselesinin, bir tür simüle bilişten ziyade veri sıkıştırmaya çok daha fazla dayandığına ikna oldum.
    • Son kısmı Star Control II'deki Orz'a benziyor. Belirsiz biçimde anlamlıymış gibi ama biraz da ürpertici.
      Dilin tekinsiz vadisi gibi.
    • Kötü bir Çince çeviri gibi okunuyor.
    • Bu sorundaki en tuhaf nokta, denediğim tüm modellerde çöküş yaşanmasıydı. 3.5-turbo, 4-turbo, 4-vision hepsi aptalca davrandı.
      Bu nasıl olabilir? Ortak kullanılan bir model, örneğin bir yönlendirici model olmalı. Ya da biri tüm modelleri 2 bit kuantize edilmiş sürümleriyle mi değiştirdi?
    • GPT-3.5-turbo, o cümlenin aslında anlamlı olduğunu ve teknik içeriği soyut, şiirsel biçimde açıkladığını söylüyor.
      “inline air your progress demands” ya da “workspace's antiques” gibi ifadelerin PowerShell betiği çalıştırmak için gereken özelleştirme ve uyarlanabilirliği mecazi olarak anlattığını yorumluyor.
      Bunun geliştirilmekte olan kişilik özelliğiyle ilgili olup olmadığını merak ediyorum.
  • Kuantizasyonu biraz fazla düşük ayarlamışlar gibi. Benim 7B modelimde de bazen bu oluyor.
    Bugün LLM promptları için otomatik CI pipeline'larının testlerde nasıl topluca çıldırmış olabileceğini hayal ediyorum.

    • Evet. Yaklaşık 1 yıl önce API üzerinden parametrelerle oynadığımda neredeyse böyle sonuçlar almıştım.
      Sonunda her şey giderek daha kaotik İngilizce büyülere dönüşüyor, en sonunda da düzgün kelime bile olmaktan çıkıyor.
    • Kalite düşüşünün önemli bir kısmı çıkarım optimizasyonuyla ilişkili görünüyor.
      İnsanlar OpenAI'ın kaliteyi kasıtlı olarak düşürmeye çalıştığına dair bir komplo olduğunu düşünüyor ama muhtemelen kaynak kısıtları ve aşırı talep daha büyük neden.
    • Bu sorun yalnızca ChatGPT'yle, yani modelin web ön yüzüyle sınırlı gibi görünüyor.
      ChatGPT sorunları genellikle API'yi etkilemez.