wordfreq neden güncellenmeyi durdurdu
(github.com/rspeer)- wordfreq, 2021'e kadar çeşitli çevrimiçi kaynaklarda gözlemlenen dil kullanımının bir anlık görüntüsü; bu tarihten sonra veriyi güncellemek kaliteyi daha da düşürebileceği için mevcut son sürüm korunarak donduruldu
- 2021 sonrasında açık web'de insan yazısı gibi görünen yapay zeka üretimi metinler yaygınlaştı; bu da gerçek insan dil kullanımını temel alan kelime sıklığı ölçümünü zorlaştırdı
- Mevcut verilerde de spam vardı, ancak çoğu durumda tespit edilip yönetilebiliyordu; buna karşılık ChatGPT'nin “delve” örneğinde olduğu gibi üretken yapay zeka çıktıları belirli kelimelerin sıklığını anormal biçimde yükseltebilir
- Konuşma diline yakın önemli kaynaklar olan Twitter ve Reddit verilerine erişim ortadan kalktı ya da pahalı hale geldi; ayrıca Twitter'ın geçmiş verileri dağıtım koşulları nedeniyle dışarıya dağıtılamıyordu
- Doğal dil işleme alanı üretken yapay zekaya ve kapalı veri bağımlılığına kayarken, geliştirici wordfreq'in üretken yapay zekaya yardımcı olmasını ya da onunla karıştırılmasını istemiyor
Eylül 2024 ek notu
- wordfreq güncellemelerinin durdurulmasına dair belge büyük ilgi gördü ve geliştirici insanların kendi duruşunu genel olarak anladığını düşünüyor
- Açık kaynak kütüphaneler üzerinde çalışmayı tamamen bırakmış değil; çok amaçlı Unicode düzeltme aracı ftfy üzerinde çalışmayı sürdürüyor
- Verinin dondurulması mutlaka kötü bir son anlamına gelmiyor
- Pek çok kişi wordfreq'i faydalı şekilde kullandı ve mevcut son sürüm ortadan kaybolmayacak
- Güncellenirse verinin daha kötü hale gelebileceği değerlendirmesi nedeniyle artık güncellenmiyor
- Zamanla eskiyecek, ama aktif olarak daha kötüleşmeyecek
2021'e kadarki dil kullanımının anlık görüntüsü
- wordfreq verisi, 2021'e kadar çeşitli çevrimiçi kaynaklarda bulunabilen dil kullanımının anlık görüntüsüdür
- Artık güncellenmemesinin nedeni; veri kirliliği, erişim maliyeti ve doğal dil işleme alanındaki değişimlerin birlikte etkili olması
Üretken yapay zeka ile kirlenen açık web
- 2021 sonrasında insanların gerçekten kullandığı dile dair güvenilir bilgi elde etmenin zorlaştığı düşünülüyor
- wordfreq'in veri kaynaklarından biri olan açık web, OSCAR üzerinden kullanılıyordu
- Bugün geniş anlamdaki web'de büyük dil modellerinin ürettiği çok sayıda metin bulunuyor; bunlar dahil edildiğinde kelime sıklıkları çarpıtılıyor
- Eski veri kaynaklarında da spam vardı, ancak birçok durumda yönetilebilir ve tespit edilebilirdi
- Büyük dil modelleri, gerçek bir niyeti olan dil gibi görünen metinler üretiyor ve bu çıktılar birçok yere yayılıyor
- Philip Shapira'nın delve hakkındaki yazısına göre ChatGPT, “delve” kelimesini insanların kullandığından farklı biçimde takıntılı olarak kullandı ve genel sıklığı order of magnitude düzeyinde artırdı
Kaybolan ya da pahalılaşan konuşma dili verileri
- wordfreq yalnızca resmi basılı kelimeleri ele almıyordu; daha konuşma diline yakın kullanımları özellikle Twitter ve Reddit'ten topluyordu
-
Twitter ve X
- Twitter verisi temeli en başından beri kırılgandı
- Twitter'ın “firehose” akışının bir kısmına ücretsiz erişim verdiği dönemde bile, kullanım şartları gereği toplanan veriler Luminoso dışına dağıtılamıyordu
- wordfreq içinde bu veriden üretilmiş sıklık değerleri yer alıyor, ancak toplanan veri geliştiriciye ait değildi ve artık elinde de bulunmuyor
- Bugün Twitter yok; herkese açık API kapatıldı ve site X ile değiştirildi
- X ham veri akışı sunsa bile, içinde değerli bilgi bulunabileceği düşünülmüyor
-
Reddit
- Reddit de herkese açık veri arşivleri sağlamayı bıraktı
- Bugün Reddit arşivleri satıyor ve bunun fiyatı, ifadeye göre, ancak OpenAI'nin ödeyebileceği seviyede
Üretken yapay zekadan uzak durma nedeni
- wordfreq başlangıçta korpus dilbilimi ile doğal dil işleme araçlarına yardımcı olan çalışmaların kesişimindeydi
- Geliştiricinin bildiği anlamdaki “natural language processing” alanını bugün bulmak zorlaştı; üretken yapay zekanın bu alanı yuttuğu düşünülüyor
- Başka teknikler hâlâ var, ancak ilginin ve fonun büyük kısmını üretken yapay zeka alıyor
- OpenAI ve Google'ın kontrol ettiği kapalı verilere dayanmayan NLP araştırmalarının artık nadir olduğu düşünülüyor
- wordfreq gibi birçok dilde büyük miktarda metin toplama işi geçmişte oldukça makul görülüyordu
- Bugün metin toplama araçları çoğunlukla üretken yapay zeka eğitimi için kullanılıyor ve insanların buna savunmacı tepki vermesi haklı bulunuyor
- Kitapların, yazıların, web sitelerinin ve herkese açık paylaşımların metnini toptan topluyorsanız, bunun amacının kullanıcıların sözlerini kendi sözüymüş gibi öne süren bir intihal makinesi yapmak olma ihtimalinin yüksek olduğu düşünülüyor
Güncellemeleri durdurmanın sonucu
- Geliştirici, üretken yapay zeka ile karıştırılabilecek ya da üretken yapay zekaya yardımcı olabilecek işler yapmak istemiyor
- OpenAI ve Google'ın kendi verilerini kendilerinin toplaması ve bunun bedelini çok pahalı ödemesi gerektiğini açıkça söylüyor
- wordfreq artık güncellenmiyor, ancak mevcut son sürüm korunuyor
1 yorum
Hacker News yorumları
Genel olarak katılıyorum, ama web zaten Google’ın gayriresmî SEO kuralları tarafından kirletilmişti
Tek cümlelik paragraflar, anahtar kelime tekrarları, okunabilirlikten çok “indekslenebilirliği” önemseyen yaklaşım yüzünden web, LLM’lerden önce de bu tür analizler için ideal bir kaynak değildi
Eğitim verisi olarak da aynı durum geçerliydi; sonuçta LLM’ler insanlar için yazılmış metinlerle değil, Googlebot için yazılmış metinlerle beslenip büyüdü. ML/LLM, yazı kirliliğinin ikinci yinelemesi; ilki ise insanların başka insanlar için değil, şirket botları için yazmaya başladığı zamandı
Sıklıklarda önyargı olacaktır, ama çoğu metinde bu böyledir; karbüratör bakım ders kitabında “carburetor” kelimesinin taban çizgiden çok daha fazla geçmesi kaçınılmazdır
Çeşitli kitapların, haber makalelerinin ve blogların sağlıklı bir karışımı varsa sorun yok. Buna karşılık LLM içeriği daha çok kendi kuyruğunu yiyen yılan gibi; kelime dağılımı modelinin çıktılarıyla yeniden bir kelime dağılımı istatistik modeli oluşturmaya çalışmak gibi
Gazetelerde, romanlarda, üstüne gönderilen e-postalarda vb. de cümle ve paragraf uzunluğu, gereksiz tekrar, okunabilirlik dışı metrikleri önemseme gibi kendilerine özgü üsluplar vardır
En azından başka bir insanın okuma ihtimalini hesaba katan bir insan tarafından yazılmış metinse, makine tarafından üretilmiş metinden çok daha meşru bir dil kullanımı sayılabilir
İnternetin bunu daha ne kadar kaldırabileceğini bilmiyorum; kullanımım 2018’e göre bile belirgin biçimde azaldı. Artık okunmaya değer bir şey bulmak o kadar zor ki sonunda burada çok zaman geçiriyorum
SEO spam’i yeni değil, sadece biçimi değişti
2023’te, kirlenmemiş veri kümesi referanslarını toplamak için bir alan olarak https://lowbackgroundsteel.ai/ sitesini oluşturdum
wordfreq’i de eklemeyi planlıyorum; Tumblr üzerinden kaynak göndermeniz iyi olur
Araştırırken oluşturduğum faydalı liste şöyle: 2017’de transformer mimarisinin icadı, Haziran 2018 GPT-1, Şubat 2019 GPT-2, Haziran 2020 GPT-3, Mart 2022 GPT-3.5, Kasım 2022 ChatGPT
Belirlediğiniz eşik tarihten önceki kiwix arşivlerini de eklemek iyi olabilir. Internet Archive’da bulunabiliyor; Wikipedia, Stack Overflow, Wikisource, Wikibooks ve çeşitli wiki sürümleri var
Böyle kaynakları bir araya getirmek, büyük teknoloji şirketlerinin daha fazla veriyi kazımasını yalnızca çok daha kolay hâle getirir
Mensubu olduğum doğal dil işleme topluluğu nedeniyle OP’nin hayal kırıklığına uğramış olması üzücü; bu popüler ve neredeyse aşırı ısınmış bir akımın zirvesine yakın olsa da “hepimiz böyle değiliz” demek isterim
Yapay içerikle web’in kirlenmesi meselesi zamanında gündeme gelmiş bir sorun; PageRank’i manipüle etmeye çalışan spam çiftlikleri gibi önceki örnekler de vardı
Bu yüzden, insanların elle küratörlüğünü yaptığı yüksek kaliteli web sitesi listeleri, yani “küçük web”, yeniden değer kazanabilir
Web’in her kuşağı, kendi kuşağının düşmanca mekanizmalarını aşacak teknolojilere ihtiyaç duydu; bugünkü web de istisna değil
Eric Arthur Blair, 1984’ü “George Orwell” mahlasıyla yazdığında, kitlelerin eleştirel düşünceden uzaklaşacak şekilde otomatik üretilmiş içerik tükettiği bir durumu öngörmüştü. Şimdi bu yaşanıyor; ancak eleştirilen teknoloji iyi amaçla da kullanılabilir ve benim NLP araştırma ekibimde bunu yapmaya çalışıyoruz. Sonunda iyilik kazanacak
IRC, Usenet, Reddit, Facebook, Geocities, Yahoo, webring gibi hangi içerik sistemi olursa olsun, ana akım kullanıma ulaştığında gürültüyle kirleniyor gibi görünüyor
Küçük ve küratörlü seçenekler de yeterince büyüdüklerinde sonunda kendi başarılarının kurbanı oluyor ve spam tarafından ele geçiriliyor
Bu her zaman kalite ile nicelik arasında bir silahlanma yarışı; sonunda küratörler ezici miktara yetişemez hâle geliyor
Böyle “kırmızı çizgileri” sürekli hiç sorun değilmiş gibi aşmamız tuhaf. O meme’deki gibi: bilimkurgu yazarı “uyarı niteliğinde bir hikâye olarak Torment Nexus’u yarattı” diyor, teknoloji şirketi ise “klasik bilimkurgu romanı ‘Torment Nexus’u Yapmayın’da geçen Torment Nexus’u yaptık” diyor
Açık konuşmak gerekirse web öldü. “Yapay zeka” sayesinde artık işe yarar bir şey bulmak için arama sonuçlarını didiklemek 2005’tekinden daha fazla zaman alıyor
Bulduğum siteler de çoğunlukla çöp
Örneğin meşhur bir kablosuz kulaklığı bulmak için bile, şirketi, şirketin web sitesini ve satıcıyı zaten bildiğim hâlde en az 10 dakika gerekiyor. Çünkü her türlü ıvır zıvırın altına gömülmüş durumda
Dizüstüm “eski” bir 8 çekirdekli i7, 16 GB RAM’e sahip, buna rağmen grafik ağırlıklı “modern” sitelerde zorlanıyor. Eski siteler basit ve düzgün çalışırdı; ürünü hızla arayıp satın alabiliyordum. Dün geceyse sepete ekleyip ödeme yapmak bile gerçek bir eziyetti
Web’den, tarayıcılardan, web tasarımından, SEO’dan, aramadan, reklamlardan ve bunlara eşlik eden tüm ucuz saçmalıklardan nefret ediyorum. Artık bitti. Web kullanmadan bir şey satın almanın yolu varsa öyle yapacağım. Teknolojinin kendisinden tamamen nefret etmiyorum ama web artık çürük yumurtaya döndü
Artık o arama kutusu önce arama terimini LLM’e gönderiyor, 10-15 saniye bekletiyor, sonra da “bazı yorumlar şöyle şöyleydi” gibi işe yaramaz bir özet gösteriyor
Ancak ondan sonra, gerçek yorumlar ve sorular içinde aradığım kelimeyi içeren öğeleri görmek için bir düğmeye basabiliyorum. Bu beni Amazon’u bırakmaya götürecek gibi. Hâlâ doğrudan aramanın bir yolu varsa biri söylese iyi olur
Eskiden Trek bisiklet vites kulağını arayınca ilk sonuç istediğim şey olurdu. Artık yeni bisiklet almamı söyleyen 5 reklamı, bozuk bir üçüncü taraf bağlantısını geçmek gerekiyor; şanslıysam 1. sayfanın en altında o parçanın sayfasına bağlantı çıkıyor
Web’in çöpleşmesi gerçek
Önerilen ürün: LEEZWOO 15.6" Laptop - 16GB RAM 512GB SSD PC Laptop, Quad-Core N95 Processor Up to 3.1GHz, Laptop Computers with Touch ID, WiFi, BT4.2, for Students/Business
İsmi de ne kadar akıcı okunuyor, değil mi
Bu beceriler hâlâ duruyor. Bir süre araç çubukları ve kötü amaçlı yazılımlarla fazlasıyla kirlenmişti, o yüzden geri çekilmiştik; artık kötü amaçlı yazılım karşı tarafta olduğu için yerel uygulamalar yeniden havalı oldu. Nereye bakmanız gerektiğini bilmeniz yeterli
Tabelam burada: https://akkartik.name/freewheeling-apps
Yalnız burada sözü edilen “web” sanki yalnızca arama motorları üzerinden erişilebilen şeyleri ifade ediyor. Hâlâ eski web de var; yani milyarlarca kullanıcısı olan toplama servisleri değil, ilişkiler ve itibar aracılığıyla işleyen web. Yukarıdaki bağlantı ya da şu anda kullandığımız bu kahramanca modere edilen site gibi
“2021’den sonra insanların dil kullanımı hakkında güvenilir bilgiye sahip kimse olmadığını düşünüyorum” sözüne katılıyorum
Metin zaten bir süredir devrilme noktasını geçmişti, ama video için şu an bir dönüm noktası gibi geliyor
Özellikle küçük çocukların neyin gerçek olup neyin olmadığına dair sezgileri zayıf. Videodaki kişinin gerçek olup olmadığını sorduğumda şimdilik hâlâ oldukça emin cevap veriyorlar, ama özgüvenleri her gün azalıyor
Teknoloji kesinlikle hazır ve video içeriklerinin çoğu henüz etkilenmiş olmasa da bunun yakında değişeceğini düşünüyorum
https://www.nytimes.com/interactive/2024/01/19/technology/artificial-intelligence-image-generators-faces-quiz.html
Özenle seçilmiş örnekleri karşılaştırması bakımından biraz adaletsiz, ama uzmanların bile bu tür testlerin çoğunu geçmesi zor olur. Teknoloji yalnızca ileri gidiyor ve hızı da artıyor gibi
Şaşırtıcı olan ilerleme hızı. İnsanlık neredeyse 3 milyon yıldır, Homo sapiens yaklaşık 300 bin yıldır, şehirler-tarım-medeniyet yaklaşık 10 bin yıldır, metaller yaklaşık 4000 yıldır, Sanayi Devrimi 500 yıldır, demokrasi 200 yıldır, bilişim ise yaklaşık 50-100 yıldır var
Devrimler arasındaki aralık neredeyse üstel biçimde kısalıyor
Bugünün dünyasını çocukluğumla karşılaştırınca, hâlâ kabullenmeye çalıştığım devrimlerden biri otomasyonlu üretim. AliExpress’e girince o kadar çok şey fiilen bedava ki. 5 portlu 120 W bir şarj cihazını kendi zamanımın 2 dakikasından daha düşük bir bedelle aldım; onu bulmak, o parayı kazanmak için gereken süreden daha kısa sürdü
Bütün bunların nereye gittiğini pek bilmiyorum
Gerçek insan olsalar bile TikTok, Instagram, YouTube içerik üreticilerinin davranış kalıplarını benimseyenleri sık sık “sahteye benzer” diye işaretler hâle geliyorum
Benim sakalım da ağarmış durumda ama 2020’deki sunum videomda bile YouTube küçük resim yüzüyle dalga geçmiştim. Yapay zeka bu tür “yarı insani” davranış kalıplarını çok hızlı ve güçlü biçimde yakalıyor
İkişer genç kadının çıkıp “This is real”/“This is not real” tabelaları tuttuğu videolar dolaşıyordu; ikisi de tamamen yalan olabilir ve ben ayırt edemem. Hepsi biraz “tuhaf” davranış kalıpları gösteriyor, ama karşıma çıkan az sayıdaki influencer videosuyla tutarlı
“Artık tüm web, büyük dil modellerinin ürettiği slop ile dolu; kimse yazmadı ve hiçbir şey aktarmıyor” demek adil ve doğru
En iyi durumda bile modeli çalıştıran kişi o yazıyı yazmış olmuyor ve kelime salatası o kişinin söylemek istediğini aktaramıyor
Çoğu durumda ise içerik, kimseye değer katma niyeti olmadan sadece SEO için boca ediliyor
Belki de 2020 öncesi basılı kitaplar 10–20 yıl sonra değerli bir meta haline gelebilir
İnternet slop ile dolduğunda ve o dönemin basılı kitapları bile şüpheyle karşılandığında yani
Ayrıca çok zeki bir yapay zekanın yazdığı kitabın yazarıymış gibi davranan insan talking head’ler de çıkacak. Biz bunu neden yapıyoruz ki?
Uyarı: devlet destekli dezenformasyon yapay zekası
Bu konuda duygularım çok karışık
Bir yandan Robyn Speer’a tamamen katılıyorum. Açık web öldü ve web gerçekten çok üzücü bir halde. Birkaç gün önce kişisel blogumu gopher’a koymaya karar verdim. Sadece gopher’da çok daha az çöp olduğu için; elbette gopher’ın çözüm olduğu anlamına gelmiyor
Ama birkaç hafta önce, 97 yaşında, başka bir ülkede yaşayan ve bilgisayar ya da cep telefonu kullanmayan eşimin büyükbabasına bir video dosyası göndermem gerekti. Sonunda DVD oynatıcısı olduğunu öğrendim ve modern 4K HDR videoyu herhangi bir eski DVD oynatıcıda oynatılabilecek bir biçime çevirirken görüntü kalitesini mümkün olduğunca korumak için x264 kullandım
Sorun şu ki x264’ün dokümantasyonu yok. Düzgün dokümantasyon yazdıracak kurumsal sponsoru olan x265’in aksine, x264 neredeyse doom9 forumu üyelerinin deneme yanılmayla geliştirdiği bir şeydi. Yüzlerce anlaşılması zor flag var ve bazıları 20 yıl öncekinden farklı çalışıyor
doom9’daki 20 yıllık onlarca thread’i karıştırıp her flag’in ne yaptığını öğrenebilirdim ama pratikte bir LLM’e, bu örnekte Claude’a sordum
Claude kusursuz değildi ve birkaç ffmpeg flag’ini x264 flag’leriyle karıştırdı; ama geleneksel arama ve deneme yanılma ile birlikte işi yaklaşık 30 dakikada bitirebildim. Çıktının kalitesi de oldukça tatmin ediciydi ve çok eski DVD oynatıcıda bile oynadı
LLM’lerden önce olsaydı bu iş için bir x264 uzmanı tutmazdım. Birkaç saat daha harcardım ya da daha büyük olasılıkla o 97 yaşındaki adam torununun kızının dansını izleyemezdi. Videonun ona kocaman bir gülümseme getirdiği söylendi
LLM de önceki her şey gibi sadece bir araç. Özünde iyi ya da kötü değil. Önemli olan bizim ne yaptığımız ve onu nasıl kullandığımız
O dönemde olsaydı Nero Burning ROM ya da Handbrake kullanırdım. Kalite istediğin seviyeye kadar optimize edilmemiş olurdu ama 97 yaşındaki birinin gözüyle yeterince izlenebilir bir video çıkardı
İnsanlar olarak interneti yapay zekayla o kadar kirlettik ki artık neredeyse kullanılamaz hale mi getirdik?
Bence internet, Dünya gibi doğal bir çevre sayılabilir. Çünkü insanların paylaştığı, buluştuğu ve konuştuğu bir alan
Doğal çevreyi kirlettikten sonra şimdi interneti de kirletmiş olmamız şaşırtıcı
İnsanların kaydettiği bilgilerin çoğu dijitalleşti ve bunun büyük bir kısmı muazzam hızla insan dışı içerik üretiyor. Kullanabileceğimiz veriye devasa bir gürültü enjekte etmiş olduk
Yanıtın daha fazla insan içeriği mi yoksa yeni üretilmiş içerik mi olduğunu bilmiyorum ama bu geçiş dönemi orta vadede zorluklar yaratacak
LLM’lerde daha fazla token daha iyidir döneminin sona erip mevcut veriyi daha iyi kullanma yönüne gittiğimizi düşünmek istiyorum ama aslında önemli bir kırılma noktasının önünde duruyoruz
Ancak açık internet artık temelde işe yaramaz hale geldi ve temel nedeni reklam tabanlı iş modeli
Artık hangi yeni teknoloji olursa olsun SEO amplifikasyonuna yol açması doğa yasası gibi görünüyor. Yapay zeka, internetin Degelman M34 Manure Spreader’ı oldu https://degelman.com/products/manure-spreaders
Yakında işini kaybedecek ya da zaten kaybetmiş olan ve önceki işleriyle fiilen istihdam edilmesi zorlaşan yazarlara, yapay zeka mega şirketlerinin para ödeyip istedikleri şeyi yazdırması gerekiyor
Tek koşul şu: o çalışmadaki cümlelerden tek bir tanesi bile yapay zekayla üretilmiş olmamalı
Başta “bunun parasını devlet ödemeli” diyecektim ama bu, kayıpların toplumsallaştırılması olur; bunu geçmişte zaten yeterince yaşadık
Ancak yazarların büyük çoğunluğu yazı yazarak hiç geçimini sağlamadı. Yazmanın eşiği çok düşük, yazmayı seven insan çok fazla ve çoğu insan neredeyse hiç okumuyor
Bir sonraki token’ı bulma işi çözülmüş bir problem. Yeni düşünceyi insanlar çözebilir ve yakında yapay zeka da yapabilir; ama veriye daha fazla çöp eklemek bunu iyileştirmez