1 puan yazan GN⁺ 2024-09-19 | 1 yorum | WhatsApp'ta paylaş
  • wordfreq, 2021'e kadar çeşitli çevrimiçi kaynaklarda gözlemlenen dil kullanımının bir anlık görüntüsü; bu tarihten sonra veriyi güncellemek kaliteyi daha da düşürebileceği için mevcut son sürüm korunarak donduruldu
  • 2021 sonrasında açık web'de insan yazısı gibi görünen yapay zeka üretimi metinler yaygınlaştı; bu da gerçek insan dil kullanımını temel alan kelime sıklığı ölçümünü zorlaştırdı
  • Mevcut verilerde de spam vardı, ancak çoğu durumda tespit edilip yönetilebiliyordu; buna karşılık ChatGPT'nin “delve” örneğinde olduğu gibi üretken yapay zeka çıktıları belirli kelimelerin sıklığını anormal biçimde yükseltebilir
  • Konuşma diline yakın önemli kaynaklar olan Twitter ve Reddit verilerine erişim ortadan kalktı ya da pahalı hale geldi; ayrıca Twitter'ın geçmiş verileri dağıtım koşulları nedeniyle dışarıya dağıtılamıyordu
  • Doğal dil işleme alanı üretken yapay zekaya ve kapalı veri bağımlılığına kayarken, geliştirici wordfreq'in üretken yapay zekaya yardımcı olmasını ya da onunla karıştırılmasını istemiyor

Eylül 2024 ek notu

  • wordfreq güncellemelerinin durdurulmasına dair belge büyük ilgi gördü ve geliştirici insanların kendi duruşunu genel olarak anladığını düşünüyor
  • Açık kaynak kütüphaneler üzerinde çalışmayı tamamen bırakmış değil; çok amaçlı Unicode düzeltme aracı ftfy üzerinde çalışmayı sürdürüyor
  • Verinin dondurulması mutlaka kötü bir son anlamına gelmiyor
    • Pek çok kişi wordfreq'i faydalı şekilde kullandı ve mevcut son sürüm ortadan kaybolmayacak
    • Güncellenirse verinin daha kötü hale gelebileceği değerlendirmesi nedeniyle artık güncellenmiyor
    • Zamanla eskiyecek, ama aktif olarak daha kötüleşmeyecek

2021'e kadarki dil kullanımının anlık görüntüsü

  • wordfreq verisi, 2021'e kadar çeşitli çevrimiçi kaynaklarda bulunabilen dil kullanımının anlık görüntüsüdür
  • Artık güncellenmemesinin nedeni; veri kirliliği, erişim maliyeti ve doğal dil işleme alanındaki değişimlerin birlikte etkili olması

Üretken yapay zeka ile kirlenen açık web

  • 2021 sonrasında insanların gerçekten kullandığı dile dair güvenilir bilgi elde etmenin zorlaştığı düşünülüyor
  • wordfreq'in veri kaynaklarından biri olan açık web, OSCAR üzerinden kullanılıyordu
  • Bugün geniş anlamdaki web'de büyük dil modellerinin ürettiği çok sayıda metin bulunuyor; bunlar dahil edildiğinde kelime sıklıkları çarpıtılıyor
  • Eski veri kaynaklarında da spam vardı, ancak birçok durumda yönetilebilir ve tespit edilebilirdi
  • Büyük dil modelleri, gerçek bir niyeti olan dil gibi görünen metinler üretiyor ve bu çıktılar birçok yere yayılıyor
  • Philip Shapira'nın delve hakkındaki yazısına göre ChatGPT, “delve” kelimesini insanların kullandığından farklı biçimde takıntılı olarak kullandı ve genel sıklığı order of magnitude düzeyinde artırdı

Kaybolan ya da pahalılaşan konuşma dili verileri

  • wordfreq yalnızca resmi basılı kelimeleri ele almıyordu; daha konuşma diline yakın kullanımları özellikle Twitter ve Reddit'ten topluyordu
  • Twitter ve X

    • Twitter verisi temeli en başından beri kırılgandı
    • Twitter'ın “firehose” akışının bir kısmına ücretsiz erişim verdiği dönemde bile, kullanım şartları gereği toplanan veriler Luminoso dışına dağıtılamıyordu
    • wordfreq içinde bu veriden üretilmiş sıklık değerleri yer alıyor, ancak toplanan veri geliştiriciye ait değildi ve artık elinde de bulunmuyor
    • Bugün Twitter yok; herkese açık API kapatıldı ve site X ile değiştirildi
    • X ham veri akışı sunsa bile, içinde değerli bilgi bulunabileceği düşünülmüyor
  • Reddit

    • Reddit de herkese açık veri arşivleri sağlamayı bıraktı
    • Bugün Reddit arşivleri satıyor ve bunun fiyatı, ifadeye göre, ancak OpenAI'nin ödeyebileceği seviyede

Üretken yapay zekadan uzak durma nedeni

  • wordfreq başlangıçta korpus dilbilimi ile doğal dil işleme araçlarına yardımcı olan çalışmaların kesişimindeydi
  • Geliştiricinin bildiği anlamdaki “natural language processing” alanını bugün bulmak zorlaştı; üretken yapay zekanın bu alanı yuttuğu düşünülüyor
  • Başka teknikler hâlâ var, ancak ilginin ve fonun büyük kısmını üretken yapay zeka alıyor
  • OpenAI ve Google'ın kontrol ettiği kapalı verilere dayanmayan NLP araştırmalarının artık nadir olduğu düşünülüyor
  • wordfreq gibi birçok dilde büyük miktarda metin toplama işi geçmişte oldukça makul görülüyordu
  • Bugün metin toplama araçları çoğunlukla üretken yapay zeka eğitimi için kullanılıyor ve insanların buna savunmacı tepki vermesi haklı bulunuyor
  • Kitapların, yazıların, web sitelerinin ve herkese açık paylaşımların metnini toptan topluyorsanız, bunun amacının kullanıcıların sözlerini kendi sözüymüş gibi öne süren bir intihal makinesi yapmak olma ihtimalinin yüksek olduğu düşünülüyor

Güncellemeleri durdurmanın sonucu

  • Geliştirici, üretken yapay zeka ile karıştırılabilecek ya da üretken yapay zekaya yardımcı olabilecek işler yapmak istemiyor
  • OpenAI ve Google'ın kendi verilerini kendilerinin toplaması ve bunun bedelini çok pahalı ödemesi gerektiğini açıkça söylüyor
  • wordfreq artık güncellenmiyor, ancak mevcut son sürüm korunuyor

1 yorum

 
GN⁺ 2024-09-19
Hacker News yorumları
  • Genel olarak katılıyorum, ama web zaten Google’ın gayriresmî SEO kuralları tarafından kirletilmişti
    Tek cümlelik paragraflar, anahtar kelime tekrarları, okunabilirlikten çok “indekslenebilirliği” önemseyen yaklaşım yüzünden web, LLM’lerden önce de bu tür analizler için ideal bir kaynak değildi
    Eğitim verisi olarak da aynı durum geçerliydi; sonuçta LLM’ler insanlar için yazılmış metinlerle değil, Googlebot için yazılmış metinlerle beslenip büyüdü. ML/LLM, yazı kirliliğinin ikinci yinelemesi; ilki ise insanların başka insanlar için değil, şirket botları için yazmaya başladığı zamandı

    • Blog spam’i büyük ölçüde insanlar tarafından yazılıyordu; başka nedenlerle berbat olsa da insan yazımı metinlerin temel kelime sıklığını ölçmek için fena görünmüyordu
      Sıklıklarda önyargı olacaktır, ama çoğu metinde bu böyledir; karbüratör bakım ders kitabında “carburetor” kelimesinin taban çizgiden çok daha fazla geçmesi kaçınılmazdır
      Çeşitli kitapların, haber makalelerinin ve blogların sağlıklı bir karışımı varsa sorun yok. Buna karşılık LLM içeriği daha çok kendi kuyruğunu yiyen yılan gibi; kelime dağılımı modelinin çıktılarıyla yeniden bir kelime dağılımı istatistik modeli oluşturmaya çalışmak gibi
    • Bir noktada, belirli bir dil kullanımının kelime sıklığını saydığınız mecranın kendi özelliği olduğunu da kabul etmek gerekir
      Gazetelerde, romanlarda, üstüne gönderilen e-postalarda vb. de cümle ve paragraf uzunluğu, gereksiz tekrar, okunabilirlik dışı metrikleri önemseme gibi kendilerine özgü üsluplar vardır
      En azından başka bir insanın okuma ihtimalini hesaba katan bir insan tarafından yazılmış metinse, makine tarafından üretilmiş metinden çok daha meşru bir dil kullanımı sayılabilir
    • Bu, ikinci ve çok daha büyük ölçekli bir Eternal September gibi hissettiriyor
      İnternetin bunu daha ne kadar kaldırabileceğini bilmiyorum; kullanımım 2018’e göre bile belirgin biçimde azaldı. Artık okunmaya değer bir şey bulmak o kadar zor ki sonunda burada çok zaman geçiriyorum
    • Yine de ima edildiği kadar uç bir durum değil. Eğitim verileri kalite göstergelerine göre ağırlıklandırılıyor; gazetecilerin ya da Wikipedia katkıcılarının yazdıkları, teyzenizin brownie tarifi veya kurumsal blog spam’inden daha fazla ağırlık alıyor
    • Google’dan önce Altavista vardı; o dönemde de sayfanın altına beyaz zemin üzerine beyaz yazıyla yüzlerce kez anahtar kelime doldurmak son derece yaygındı
      SEO spam’i yeni değil, sadece biçimi değişti
  • 2023’te, kirlenmemiş veri kümesi referanslarını toplamak için bir alan olarak https://lowbackgroundsteel.ai/ sitesini oluşturdum
    wordfreq’i de eklemeyi planlıyorum; Tumblr üzerinden kaynak göndermeniz iyi olur

    • “Lansman” için tebrikler. Ben de neredeyse tam olarak böyle bir site yapmayı bir süredir arka plan işi olarak tutuyordum. Eşik tarihi nereye koyduğunuzu merak ediyorum
      Araştırırken oluşturduğum faydalı liste şöyle: 2017’de transformer mimarisinin icadı, Haziran 2018 GPT-1, Şubat 2019 GPT-2, Haziran 2020 GPT-3, Mart 2022 GPT-3.5, Kasım 2022 ChatGPT
      Belirlediğiniz eşik tarihten önceki kiwix arşivlerini de eklemek iyi olabilir. Internet Archive’da bulunabiliyor; Wikipedia, Stack Overflow, Wikisource, Wikibooks ve çeşitli wiki sürümleri var
    • İsmi zekice. Benzetmeyi sevdim
    • Bence bu, yazarın istediğinin tam tersi. Yazar artık bu karmaşanın bir parçası olmak istemiyor
      Böyle kaynakları bir araya getirmek, büyük teknoloji şirketlerinin daha fazla veriyi kazımasını yalnızca çok daha kolay hâle getirir
    • Bilgi olarak, veri kümelerim DebateSum ve OpenDebateEvidence/OpenCaseList, mevcut hâlleriyle en geç 2022’de sona erdiği için buraya giriyor
    • Yapay zeka grafikleriyle kirlenmiş bir siteye güvenilir mi bilmiyorum /s
  • Mensubu olduğum doğal dil işleme topluluğu nedeniyle OP’nin hayal kırıklığına uğramış olması üzücü; bu popüler ve neredeyse aşırı ısınmış bir akımın zirvesine yakın olsa da “hepimiz böyle değiliz” demek isterim
    Yapay içerikle web’in kirlenmesi meselesi zamanında gündeme gelmiş bir sorun; PageRank’i manipüle etmeye çalışan spam çiftlikleri gibi önceki örnekler de vardı
    Bu yüzden, insanların elle küratörlüğünü yaptığı yüksek kaliteli web sitesi listeleri, yani “küçük web”, yeniden değer kazanabilir
    Web’in her kuşağı, kendi kuşağının düşmanca mekanizmalarını aşacak teknolojilere ihtiyaç duydu; bugünkü web de istisna değil
    Eric Arthur Blair, 1984’ü “George Orwell” mahlasıyla yazdığında, kitlelerin eleştirel düşünceden uzaklaşacak şekilde otomatik üretilmiş içerik tükettiği bir durumu öngörmüştü. Şimdi bu yaşanıyor; ancak eleştirilen teknoloji iyi amaçla da kullanılabilir ve benim NLP araştırma ekibimde bunu yapmaya çalışıyoruz. Sonunda iyilik kazanacak

    • “İyi” küçük web gerçekten hiç kazandı mı?
      IRC, Usenet, Reddit, Facebook, Geocities, Yahoo, webring gibi hangi içerik sistemi olursa olsun, ana akım kullanıma ulaştığında gürültüyle kirleniyor gibi görünüyor
      Küçük ve küratörlü seçenekler de yeterince büyüdüklerinde sonunda kendi başarılarının kurbanı oluyor ve spam tarafından ele geçiriliyor
      Bu her zaman kalite ile nicelik arasında bir silahlanma yarışı; sonunda küratörler ezici miktara yetişemez hâle geliyor
    • Eleştirel düşünceden kaçınan insanlar, yapay zeka içeriği olsun ya da olmasın zaten bunu yapıyordu ve yapmaya devam edecek
    • “Sonunda iyilik kazanır” düşüncesi tehlikeli. Böyle bir şeyin gerçekten yaşanması için muhtemelen gerekli olan kararlı eylemi erteletebilir
    • Biraz farklı bir konu ama Marx da 1894’te kripto para ve NFT’lerin var olacağını öngörmüştü https://www.marxists.org/archive/marx/works/1894-c3/ch25.htm
      Böyle “kırmızı çizgileri” sürekli hiç sorun değilmiş gibi aşmamız tuhaf. O meme’deki gibi: bilimkurgu yazarı “uyarı niteliğinde bir hikâye olarak Torment Nexus’u yarattı” diyor, teknoloji şirketi ise “klasik bilimkurgu romanı ‘Torment Nexus’u Yapmayın’da geçen Torment Nexus’u yaptık” diyor
    • Ya iyiliğin kazanmasının yolu, yıkıcı biçimde değişmiş teknoloji ve inançları reddetmekse?
  • Açık konuşmak gerekirse web öldü. “Yapay zeka” sayesinde artık işe yarar bir şey bulmak için arama sonuçlarını didiklemek 2005’tekinden daha fazla zaman alıyor
    Bulduğum siteler de çoğunlukla çöp
    Örneğin meşhur bir kablosuz kulaklığı bulmak için bile, şirketi, şirketin web sitesini ve satıcıyı zaten bildiğim hâlde en az 10 dakika gerekiyor. Çünkü her türlü ıvır zıvırın altına gömülmüş durumda
    Dizüstüm “eski” bir 8 çekirdekli i7, 16 GB RAM’e sahip, buna rağmen grafik ağırlıklı “modern” sitelerde zorlanıyor. Eski siteler basit ve düzgün çalışırdı; ürünü hızla arayıp satın alabiliyordum. Dün geceyse sepete ekleyip ödeme yapmak bile gerçek bir eziyetti
    Web’den, tarayıcılardan, web tasarımından, SEO’dan, aramadan, reklamlardan ve bunlara eşlik eden tüm ucuz saçmalıklardan nefret ediyorum. Artık bitti. Web kullanmadan bir şey satın almanın yolu varsa öyle yapacağım. Teknolojinin kendisinden tamamen nefret etmiyorum ama web artık çürük yumurtaya döndü

    • Amazon’da eskiden yorumları ve SSS’yi arama kutusundan doğrudan arayabiliyordunuz; inanılmaz faydalıydı
      Artık o arama kutusu önce arama terimini LLM’e gönderiyor, 10-15 saniye bekletiyor, sonra da “bazı yorumlar şöyle şöyleydi” gibi işe yaramaz bir özet gösteriyor
      Ancak ondan sonra, gerçek yorumlar ve sorular içinde aradığım kelimeyi içeren öğeleri görmek için bir düğmeye basabiliyorum. Bu beni Amazon’u bırakmaya götürecek gibi. Hâlâ doğrudan aramanın bir yolu varsa biri söylese iyi olur
    • Genel olarak itiraz edecek pek bir şey yok
      Eskiden Trek bisiklet vites kulağını arayınca ilk sonuç istediğim şey olurdu. Artık yeni bisiklet almamı söyleyen 5 reklamı, bozuk bir üçüncü taraf bağlantısını geçmek gerekiyor; şanslıysam 1. sayfanın en altında o parçanın sayfasına bağlantı çıkıyor
      Web’in çöpleşmesi gerçek
    • Dizüstün tamamen çağ dışı kalmış gibi. Modern SEO yükünü kaldırabilecek yeni nesil bir dizüstünü Amazon’dan almalısın
      Önerilen ürün: LEEZWOO 15.6" Laptop - 16GB RAM 512GB SSD PC Laptop, Quad-Core N95 Processor Up to 3.1GHz, Laptop Computers with Touch ID, WiFi, BT4.2, for Students/Business
      İsmi de ne kadar akıcı okunuyor, değil mi
    • Daha iyi aramayı ürün olarak satan bir startup var. Temel özelliği, para verip kullandığım için ürünün ben olmamam https://kagi.com/welcome
    • Son 10 yıldır kendimi web’den yavaş yavaş koparıyorum. Bu aralar çoğunlukla yerel teknolojilerle çevrimdışı uygulamalar yapıyorum
      Bu beceriler hâlâ duruyor. Bir süre araç çubukları ve kötü amaçlı yazılımlarla fazlasıyla kirlenmişti, o yüzden geri çekilmiştik; artık kötü amaçlı yazılım karşı tarafta olduğu için yerel uygulamalar yeniden havalı oldu. Nereye bakmanız gerektiğini bilmeniz yeterli
      Tabelam burada: https://akkartik.name/freewheeling-apps
      Yalnız burada sözü edilen “web” sanki yalnızca arama motorları üzerinden erişilebilen şeyleri ifade ediyor. Hâlâ eski web de var; yani milyarlarca kullanıcısı olan toplama servisleri değil, ilişkiler ve itibar aracılığıyla işleyen web. Yukarıdaki bağlantı ya da şu anda kullandığımız bu kahramanca modere edilen site gibi
  • “2021’den sonra insanların dil kullanımı hakkında güvenilir bilgiye sahip kimse olmadığını düşünüyorum” sözüne katılıyorum
    Metin zaten bir süredir devrilme noktasını geçmişti, ama video için şu an bir dönüm noktası gibi geliyor
    Özellikle küçük çocukların neyin gerçek olup neyin olmadığına dair sezgileri zayıf. Videodaki kişinin gerçek olup olmadığını sorduğumda şimdilik hâlâ oldukça emin cevap veriyorlar, ama özgüvenleri her gün azalıyor
    Teknoloji kesinlikle hazır ve video içeriklerinin çoğu henüz etkilenmiş olmasa da bunun yakında değişeceğini düşünüyorum

    • Şöyle bir meydan okuma testi var: https://www.nytimes.com/interactive/2024/09/09/technology/ai-video-deepfake-runway-kling-quiz.html
      https://www.nytimes.com/interactive/2024/01/19/technology/artificial-intelligence-image-generators-faces-quiz.html
      Özenle seçilmiş örnekleri karşılaştırması bakımından biraz adaletsiz, ama uzmanların bile bu tür testlerin çoğunu geçmesi zor olur. Teknoloji yalnızca ileri gidiyor ve hızı da artıyor gibi
      Şaşırtıcı olan ilerleme hızı. İnsanlık neredeyse 3 milyon yıldır, Homo sapiens yaklaşık 300 bin yıldır, şehirler-tarım-medeniyet yaklaşık 10 bin yıldır, metaller yaklaşık 4000 yıldır, Sanayi Devrimi 500 yıldır, demokrasi 200 yıldır, bilişim ise yaklaşık 50-100 yıldır var
      Devrimler arasındaki aralık neredeyse üstel biçimde kısalıyor
      Bugünün dünyasını çocukluğumla karşılaştırınca, hâlâ kabullenmeye çalıştığım devrimlerden biri otomasyonlu üretim. AliExpress’e girince o kadar çok şey fiilen bedava ki. 5 portlu 120 W bir şarj cihazını kendi zamanımın 2 dakikasından daha düşük bir bedelle aldım; onu bulmak, o parayı kazanmak için gereken süreden daha kısa sürdü
      Bütün bunların nereye gittiğini pek bilmiyorum
    • Artık gerçek bir insanı ayırt edebileceğime dair güvenim yok
      Gerçek insan olsalar bile TikTok, Instagram, YouTube içerik üreticilerinin davranış kalıplarını benimseyenleri sık sık “sahteye benzer” diye işaretler hâle geliyorum
      Benim sakalım da ağarmış durumda ama 2020’deki sunum videomda bile YouTube küçük resim yüzüyle dalga geçmiştim. Yapay zeka bu tür “yarı insani” davranış kalıplarını çok hızlı ve güçlü biçimde yakalıyor
      İkişer genç kadının çıkıp “This is real”/“This is not real” tabelaları tuttuğu videolar dolaşıyordu; ikisi de tamamen yalan olabilir ve ben ayırt edemem. Hepsi biraz “tuhaf” davranış kalıpları gösteriyor, ama karşıma çıkan az sayıdaki influencer videosuyla tutarlı
    • Kötü üretilmiş şeyleri tanıyabiliriz, ama iyi olanlara kanmadığımızı nasıl bileceğiz
    • Bunu hiç düşünmemiştim. İnsanların yapay zeka içerikleriyle gerçekliği ayırt etme yeteneğini kaybetmesi korkutucu
  • “Artık tüm web, büyük dil modellerinin ürettiği slop ile dolu; kimse yazmadı ve hiçbir şey aktarmıyor” demek adil ve doğru
    En iyi durumda bile modeli çalıştıran kişi o yazıyı yazmış olmuyor ve kelime salatası o kişinin söylemek istediğini aktaramıyor
    Çoğu durumda ise içerik, kimseye değer katma niyeti olmadan sadece SEO için boca ediliyor

    • O cümle bende de çok güçlü bir etki bıraktı
  • Belki de 2020 öncesi basılı kitaplar 10–20 yıl sonra değerli bir meta haline gelebilir
    İnternet slop ile dolduğunda ve o dönemin basılı kitapları bile şüpheyle karşılandığında yani
    Ayrıca çok zeki bir yapay zekanın yazdığı kitabın yazarıymış gibi davranan insan talking head’ler de çıkacak. Biz bunu neden yapıyoruz ki?

    • Muhtemelen Sam Altman ya da Mark Zuckerberg gibi ünlü “hayırseverleri” yüceltmek için. Burada onları kahraman gören de çok kişi var çünkü
    • Bir sürü kitap biriktirip neredeyse hiç okumamanın bir tür ruhsal rahatsızlık olduğunu sanıyordum; şimdi daha fazlasını yapmam gerekecek
    • Ya da yapay zekanın yazdığı bir kitabın yazarıymış gibi davranan yapay zeka talking head de olabilir https://youtu.be/pAPGRGTqIgI
      Uyarı: devlet destekli dezenformasyon yapay zekası
  • Bu konuda duygularım çok karışık
    Bir yandan Robyn Speer’a tamamen katılıyorum. Açık web öldü ve web gerçekten çok üzücü bir halde. Birkaç gün önce kişisel blogumu gopher’a koymaya karar verdim. Sadece gopher’da çok daha az çöp olduğu için; elbette gopher’ın çözüm olduğu anlamına gelmiyor
    Ama birkaç hafta önce, 97 yaşında, başka bir ülkede yaşayan ve bilgisayar ya da cep telefonu kullanmayan eşimin büyükbabasına bir video dosyası göndermem gerekti. Sonunda DVD oynatıcısı olduğunu öğrendim ve modern 4K HDR videoyu herhangi bir eski DVD oynatıcıda oynatılabilecek bir biçime çevirirken görüntü kalitesini mümkün olduğunca korumak için x264 kullandım
    Sorun şu ki x264’ün dokümantasyonu yok. Düzgün dokümantasyon yazdıracak kurumsal sponsoru olan x265’in aksine, x264 neredeyse doom9 forumu üyelerinin deneme yanılmayla geliştirdiği bir şeydi. Yüzlerce anlaşılması zor flag var ve bazıları 20 yıl öncekinden farklı çalışıyor
    doom9’daki 20 yıllık onlarca thread’i karıştırıp her flag’in ne yaptığını öğrenebilirdim ama pratikte bir LLM’e, bu örnekte Claude’a sordum
    Claude kusursuz değildi ve birkaç ffmpeg flag’ini x264 flag’leriyle karıştırdı; ama geleneksel arama ve deneme yanılma ile birlikte işi yaklaşık 30 dakikada bitirebildim. Çıktının kalitesi de oldukça tatmin ediciydi ve çok eski DVD oynatıcıda bile oynadı
    LLM’lerden önce olsaydı bu iş için bir x264 uzmanı tutmazdım. Birkaç saat daha harcardım ya da daha büyük olasılıkla o 97 yaşındaki adam torununun kızının dansını izleyemezdi. Videonun ona kocaman bir gülümseme getirdiği söylendi
    LLM de önceki her şey gibi sadece bir araç. Özünde iyi ya da kötü değil. Önemli olan bizim ne yaptığımız ve onu nasıl kullandığımız

    • Eski DVD yazma yazılımlarının çoğunda video dönüştürme yerleşik özellik olarak yok muydu?
      O dönemde olsaydı Nero Burning ROM ya da Handbrake kullanırdım. Kalite istediğin seviyeye kadar optimize edilmemiş olurdu ama 97 yaşındaki birinin gözüyle yeterince izlenebilir bir video çıkardı
  • İnsanlar olarak interneti yapay zekayla o kadar kirlettik ki artık neredeyse kullanılamaz hale mi getirdik?
    Bence internet, Dünya gibi doğal bir çevre sayılabilir. Çünkü insanların paylaştığı, buluştuğu ve konuştuğu bir alan
    Doğal çevreyi kirlettikten sonra şimdi interneti de kirletmiş olmamız şaşırtıcı

    • Henüz öyle değilse bile çok yakında öyle olacak. Bu sorunla uğraşan insanlar da vardır ama bence artık çok yaklaşmış bir geri besleme döngüsü anına doğru gidiyoruz
      İnsanların kaydettiği bilgilerin çoğu dijitalleşti ve bunun büyük bir kısmı muazzam hızla insan dışı içerik üretiyor. Kullanabileceğimiz veriye devasa bir gürültü enjekte etmiş olduk
      Yanıtın daha fazla insan içeriği mi yoksa yeni üretilmiş içerik mi olduğunu bilmiyorum ama bu geçiş dönemi orta vadede zorluklar yaratacak
      LLM’lerde daha fazla token daha iyidir döneminin sona erip mevcut veriyi daha iyi kullanma yönüne gittiğimizi düşünmek istiyorum ama aslında önemli bir kırılma noktasının önünde duruyoruz
    • Hâlâ çok değerli küçük ve kapalı topluluklar var. Şu anda yazı paylaştığımız yer de bunlardan biri
      Ancak açık internet artık temelde işe yaramaz hale geldi ve temel nedeni reklam tabanlı iş modeli
    • Ortak malların trajedisi etrafındaki her şeyi mahveder
    • Doğru. İnterneti daha büyük bir lağım çukuruna çevirmek için pratik talimatlar da burada var https://www.youtube.com/watch?v=endHz0jo9Ck
      Artık hangi yeni teknoloji olursa olsun SEO amplifikasyonuna yol açması doğa yasası gibi görünüyor. Yapay zeka, internetin Degelman M34 Manure Spreader’ı oldu https://degelman.com/products/manure-spreaders
    • Güzel benzetme. Neyse ki çevrimiçinde yoktan “gayrimenkul” yaratmak daha kolay. Yine de Twitter ve Reddit gibi değerli alanların bir kısmını belli ölçüde kaybettik
  • Yakında işini kaybedecek ya da zaten kaybetmiş olan ve önceki işleriyle fiilen istihdam edilmesi zorlaşan yazarlara, yapay zeka mega şirketlerinin para ödeyip istedikleri şeyi yazdırması gerekiyor
    Tek koşul şu: o çalışmadaki cümlelerden tek bir tanesi bile yapay zekayla üretilmiş olmamalı
    Başta “bunun parasını devlet ödemeli” diyecektim ama bu, kayıpların toplumsallaştırılması olur; bunu geçmişte zaten yeterince yaşadık

    • Zaten bunu yapan birkaç şirket var. Ben de birkaçında ara sıra sözleşmeli işler yapıyorum ve ücret bazen ortalama bir yazarın başka yerde bekleyebileceği seviyenin çok üstüne çıkıyor
      Ancak yazarların büyük çoğunluğu yazı yazarak hiç geçimini sağlamadı. Yazmanın eşiği çok düşük, yazmayı seven insan çok fazla ve çoğu insan neredeyse hiç okumuyor
    • Kaseti kim programlayacak? https://en.wikipedia.org/wiki/Profession_(novella)
    • Yapay zeka şirketleri gerçekten de böyle insanları işe alıp özelleştirilmiş eğitim verisi oluşturuyor
    • İnsanlar zaten 10 yılı aşkın süredir gürültü üretip bunun karşılığında para alıyor. Çöp girerse çöp çıkar sözü her zaman doğru
      Bir sonraki token’ı bulma işi çözülmüş bir problem. Yeni düşünceyi insanlar çözebilir ve yakında yapay zeka da yapabilir; ama veriye daha fazla çöp eklemek bunu iyileştirmez
    • Amerikan tarihi okudun mu hiç, lol