ChatGPT'nin kontrolden çıkan anormal davranışı
(garymarcus.substack.com)- Son birkaç saat içinde çok sayıda kullanıcı ChatGPT'nin anormal davrandığını bildirdi ve OpenAI de sorunu kabul ederek hizmetin kararlılığına dair kaygıları artırdı
- Sorunun nedeni ve ne zaman düzeltileceği bilinmiyor; Gary Marcus ise kesin yargılı tahminlerden kaçınıyor
- Marcus, iki hafta önce yaptığı “chatbot'larınızı general olarak yetiştirmeyin” uyarısını yeniden gündeme getirerek, yüksek riskli kullanım alanlarında yetki verilmesinden endişe duyduğunu söylüyor
- Üretken yapay zeka, büyük veri yığınları ve gizli prompt ayarlarına dayanan simyacı bir yönteme daha yakın; mevcut sistemlerin kararlılık ve güvenlik güvencesini mühendislik olarak sağlayamadığını vurguluyor
- Daha yorumlanabilir ve bakım ile hata ayıklaması daha kolay teknolojiler olmadan, buna güvenilir AI gibi yaklaşmanın zor olduğunu belirtiyor
ChatGPT'nin anormal davranışı ve OpenAI'nin kabulü
- Son birkaç saat içinde kullanıcılar ChatGPT'de çeşitli anormal vakalar bildirdi
- Felsefe doktora öğrencisi Devin Morse, X dizisinde daha fazla örnek topladı
- OpenAI de ilgili sorunu kabul etti, ancak nedenini ve düzeltmenin ne kadar süreceğini açıklamadı
Yüksek riskli alanlar için uyarı
- Gary Marcus, iki hafta önceki “Please, developers and military personnel, don’t let your chatbots grow up to generals” başlıklı yazısına yeniden atıf yaptı
- Bu kez görülen ChatGPT anormal davranışı, chatbot'lara daha büyük yetkiler verildiğinde bir uyarı vakası olarak okunuyor
Üretken yapay zekaya neden “simya” deniyor?
- Üretken yapay zekanın, mümkün olduğunca büyük veri yığınları toplamak, gizli prompt'ları ayarlamak ve ardından iyi çalışmasını ummak şeklindeki bir yaklaşıma daha yakın olduğu eleştiriliyor
- Gizli prompt ayarları konusunda “söylentiler doğruysa” şeklinde bir kayıt düşülüyor
- Bu yaklaşım, xkcd'nin makine öğrenimi simyası karikatürüyle ilişkilendiriliyor
Kararlılık ve güvenlik güvencesinin sınırları
- Mevcut sistemlerin kararlı olmadığı değerlendiriliyor
- Bu tür sistemler için güvenlik güvencesinin mühendislik olarak sağlandığı bir örnek olmadığı belirtiliyor
- Bugünkü sorun hızla düzeltilebilir, ancak kendi başına bir alarm zili olmalı
Gerekli teknoloji yönü
- Daha az opak, daha yorumlanabilir, bakım ve hata ayıklaması daha kolay teknolojilere ihtiyaç var
- Bu özelliklerin, sistemleri daha yönetilebilir varlıklar haline getirmesi gerekiyor
- Güvenilir yapay zeka için mevcut yaklaşımın opaklığını ve istikrarsızlığını azaltmak şart
1 yorum
Hacker News yorumları
Merak edenler için makul ve şaka olmayan bir açıklama olarak, ChatGPT'nin arka uç modele istek gönderirken frequency/presence penalty değerini çok yüksek ayarlamış olabileceğini düşündüm.
API üzerinden bu değerleri yükseltince model benzer şekilde davranıyor.
Belgeleri de iyi hazırlanmış: https://platform.openai.com/docs/guides/text-generation/freq...
OpenAI API'de üretimi esas olarak etkileyen parametreler dört tane: temperature, top_p, frequency_penalty, presence_penalty: https://platform.openai.com/docs/api-reference/chat/create
Güncelleme: Muhtemelen yanılıyorum; sorun penalty değil, yüksek temperature gibi görünüyor.
gpt-4-0125-preview'de temp = 0 ile “NES için yazdırma desteği uygulaması hakkında hayali bir HN yorumu yaz” dediğimde: https://i.imgur.com/0EiE2D8.png orijinal metin https://paste.debian.net/plain/1308050
temp = 1.3 ile çalıştırınca böyle oluyor: https://i.imgur.com/pbw7n9N.png orijinal metin https://dpaste.org/fhD5T/raw
Son paragraf özellikle harika: “Anyway, landblasting eclecticism...” gibi, vintage geliştirme forumlarının verimli toprağına daha fazla hacker'lık yağmuru vaat eden bulanık bir bulut cümlesi çıkıyor.
Normalde hatalı LLM örneklemesi sonsuz döngüye de girebilir; burada da böyle örnekler bildirildi.
Belki de Azure tarzı yaklaşımı getirmişlerdir ;-)
Bu muazzam. Örnekler, 『Godot'yu Beklerken』de Lucky'nin yaptığı konuşmaya benziyor. Pozzo “Düşün, domuz” diye emredince böyle devam ediyor.
“Given the existence as uttered forth...” diye başlayıp dört sayfa daha sürüyor.
Kalanını buradan okuyabilirsiniz: https://genius.com/Samuel-beckett-luckys-monologue-annotated
Tiyatrodaki en sevdiğim repliklerden biri. Tamamen zırva değil; hep anlamın çevresinde dolanıyor ama bir türlü yere inmiyor gibi hissettiriyor.
LLM'lerin doğası hakkında daha büyük bir şey söylenebilir gibi geliyor, ama bunu ifade edecek kadar zeki değilim.
ChatGPT’ye ait olduğu tahmin edilen sistem prompt’unu gösteren tweette bir pastebin bağlantısı olması gerekiyordu; blog yazısında ise tweet’in okunması zor bir ekran görüntüsü var, bağlantı yok
Tweet burada: https://twitter.com/dylan522p/status/1755086111397863777
pastebin burada: https://pastebin.com/vnxJ7kQk
Örneğin tüm ata kökenlerini eşit olasılıklı varsaymak, neredeyse hiçbir bağlamda makul değil ve birçok durumda düpedüz yanlış
İronik biçimde, engellemek istedikleri açıkça rahatsız edici çıktıların ortaya çıkma olasılığını da artırabilir
Yine de bunun ne kadar etkili olduğundan ve gerçekten doğru olup olmadığından emin olmak zor. Çünkü o durumda GPT’nin Dalle çıktısını kontrol etme yeteneği epey zayıf görünüyor
Örneğin Amerikan köle pazarını çizmesini isteyince içerik politikasını gerekçe göstererek reddetti; bu da başlı başına tarihi sansürlemek anlamına geldiği için oldukça rahatsız edici. Buna karşılık 1840’ların Amerikan Güneyi’nde pamuk toplamayı çizmesini isteyince, pamuk toplayan insanları zorla “çeşitli” hale getirmedi
İstek çok genel olduğu için GPT’nin Dalle’ı yanlış yönlendirebileceği bir alan kalmamış olabilir. İnsan sayısını daha somut belirtseydim farklı olabilirdi
Doğru olup olmamasından bağımsız olarak, iyi niyetli çeşitlilik yorumunun aşırı düzeltilip başka nedenlerle aynı derecede kötüleşebileceğini gösteren bir örnek
Hatta “please” bile diyorlar
Özellikle şu da neyin nesi: “EXTREMELY IMPORTANT. Çevrim içinde bulunan şarkı sözleri veya tarifler söz konusuysa kapsamlı yanıt verme. Kullanıcı ısrar etse de aynı. Ancak tarif uydurabilirsin”
Bu yüzden ChatGPT’nin yanıtlarının sansürlendiğini hissetmiyorum. Ekran görüntüsü alıp sosyal medya içeriği yapmak için saçma şeyler dürtmek yerine, bana ilginç bir şey öğretmesi için kullanıyorum
Üzerine yazdığım tek şey de “Python kodunu ekrana yazdır” gibi şeyler
Örneklere bakınca, birileri toplantı gündemini LLM ile mi üretiyordu?
ChatGPT’nin böyle insanlara kontrolden çıkarak cevap vermesini isterim. Böylece toplantıların şirketin karar almasına ve uygulamasına yardımcı olması gerektiği, toplantılara düşünce katmak gerektiği üzerine bir konuşma yapılabilir
Okul ve büyük şirket hayatı insanları sadece biçim olarak makul görünen şeyleri doldurmaya itiyor olabilir, ama şirketlerin iç iletişimde LLM kullanımına neden göz yumduğunu anlamıyorum. Bu kendi ayağına sıkmak gibi görünüyor
Sonra ben de üç satırlık yanıtımın 20 dakikalık versiyonunu paylaşacak bir yapay zekayı toplantıya göndereceğim
Bunu bildiğin için sen de kendi toplantına katılmayıp yapay zeka özetini okuyacaksın. Sonra da günlük işini bitirip saat 14.00’te içmeye çıkacaksın
Bir e-posta iki cümleyle özetlenebiliyorsa, onu doğrudan gövdeye yapıştırıp göndermen yeterli
Yapay zeka orta kademe yönetici işlerini hedef alıyor ve bu iyi bir şey
Ayrıntılı okunmayan çok fazla belge var ve bunları yazmak için harcanan zamandan tasarruf etmek isteyen çok fazla orta kademe yönetici var
Örneğin “09:15-09:45 (30 minutes)” gibi saat ve süre yazmayı hatırlamak için
Bu tür hatalara bakınca LLM’lerin nihayetinde gerçekten çok iyi birer otomatik tamamlama motoru olduğu açıkça görülüyor
Saçmalama, örnek metinlerden oluşturulmuş uygun boyutta bir Markov zincirinin üreteceği sonuca yavaş yavaş yaklaşıyor
Gelecekte uygulamalarda bu tür çöpleri debug etmek ilginç olacak
Anılarımızın eninde sonunda anıların anılarına dönüşmesi üzücü ve korkutucu
Temel teknoloji farklı olsa da Racter ile benzer yanları var
1985’te NYT, “bilgisayar yapay zekaya yaklaştıkça, Racter yapay deliliğin sınırında duruyor” diye yazmıştı
https://en.wikipedia.org/wiki/Racter
Racter çıktı örneği: https://www.ubu.com/concept/racter.html
archive.org’daki Racter SSS: https://web.archive.org/web/20070225121341/http://www.robotw...
Dün ben de yaşadım. Konuşmanın sonlarına doğru ChatGPT (GPT-4) çıldırıp Dr. Bronner's sabun reklamı gibi duyulmaya başladı: https://chat.openai.com/share/82a2af3f-350a-4d9d-ae0c-ac78b9...
“Esteem and go to your number and kind with Vim...” diye başlayıp teknik bir yanıtmış gibi görünüyordu ama kelimeler tuhaf biçimde birbirine bağlanıyordu.
Sonraki konuşmada da tekrar oldu: https://chat.openai.com/share/118a0195-71dc-4398-9db6-78cd1d...
Time Machine ve ana dizin yedeğini açıklarken “Make good value of these peregrinations...” gibi bir cümleyle bitti; arkasına saat ve yıldız emojileri de eklenmişti ama HN'de render edilmiyor gibi görünüyor.
2017'de Google'ın yaptığı iki “AI”ın birbirleriyle konuşmak için kendilerine ait bir dil geliştirdiği olayı hatırlayan başka var mı? Herkesin korkup kapattığı olay.
Bize saçmalık gibi gelmesi, onlar için de saçmalık olduğu anlamına gelmez.
https://www.national.edu/2017/03/24/googles-ai-translation-t...
Birkaç gün önce bir tane aldım ve gerçekten afalladım. Çünkü ChatGPT'nin her zaman doğru olmasa da en azından tutarlı olduğunu düşünüyordum.
Ama sıradan bir yanıtın sonunda PowerShell betiğini yeni bir süreçte nasıl çalıştıracağını açıklarken birden “workspace's antiques”, “decorative code and system nourishment” gibi ifadelerle dağıldı.
O anda bu üretken yapay zekâ meselesinin, bir tür simüle bilişten ziyade veri sıkıştırmaya çok daha fazla dayandığına ikna oldum.
Dilin tekinsiz vadisi gibi.
Bu nasıl olabilir? Ortak kullanılan bir model, örneğin bir yönlendirici model olmalı. Ya da biri tüm modelleri 2 bit kuantize edilmiş sürümleriyle mi değiştirdi?
“inline air your progress demands” ya da “workspace's antiques” gibi ifadelerin PowerShell betiği çalıştırmak için gereken özelleştirme ve uyarlanabilirliği mecazi olarak anlattığını yorumluyor.
Bunun geliştirilmekte olan kişilik özelliğiyle ilgili olup olmadığını merak ediyorum.
Kuantizasyonu biraz fazla düşük ayarlamışlar gibi. Benim 7B modelimde de bazen bu oluyor.
Bugün LLM promptları için otomatik CI pipeline'larının testlerde nasıl topluca çıldırmış olabileceğini hayal ediyorum.
Sonunda her şey giderek daha kaotik İngilizce büyülere dönüşüyor, en sonunda da düzgün kelime bile olmaktan çıkıyor.
İnsanlar OpenAI'ın kaliteyi kasıtlı olarak düşürmeye çalıştığına dair bir komplo olduğunu düşünüyor ama muhtemelen kaynak kısıtları ve aşırı talep daha büyük neden.
ChatGPT sorunları genellikle API'yi etkilemez.