OpenAI içinde iletişim bilgisi olan biri varsa, örümcek sorununu çözmek için yardım isteniyor
(mailman.nanog.org)OpenAI GPTBot'un web sitesi tarama sorunu
-
Yazar, kendi web sitesi web.sp.am'de OpenAI'nin GPTBot'unun siteyi ziyaret ederek sayfaları aşırı şekilde taraması sorununu yaşadığını söylüyor
- Günde yaklaşık 3 milyon sayfa isteği gönderildi ve bunun 1,8 milyonu
robots.txtisteğiydi - Yazarın sitesi, 6 milyar 859 milyon web sitesinin her birinin tek bir sayfaya sahip olduğu bir Content Farm yapısına sahip
- Tüm sayfalar neredeyse aynı görünüyor ve aynı IP ile aynı wildcard SSL sertifikasını kullanıyor; bu yüzden tarayıcının durumu anlamasının zor olmadığı belirtiliyor
- Günde yaklaşık 3 milyon sayfa isteği gönderildi ve bunun 1,8 milyonu
-
1-2 ay önce Amazon'un tarayıcısı da benzer bir soruna yol açmıştı ve iletişime geçilerek tarama durdurulabilmişti
-
Yazar, OpenAI tarafında da iletişime geçebileceği birinin olup olmadığını soruyor
-
Yazar, kendi web sitesi verilerinin GPT-5 eğitimi için kullanılıyor gibi göründüğü yönünde şaka yapıyor
GN⁺'un görüşü
- Tarayıcının
robots.txtdosyasını doğru yorumlayamayıp aşırı istek göndermesi, kötü niyetli olmasa bile karşı taraf açısından hizmete zarar verebilecek ciddi bir sorun. OpenAI'nin de kısa süre içinde tarayıcı mantığını iyileştirmesi gerekiyor gibi görünüyor - Özellikle Content Farm gibi çok sayıda alan adı işleten ortamlarda, her siteyi ayrı ayrı taramamak için IP tabanlı filtreleme gibi yöntemler değerlendirilmeli
- Tarama botlarının davranışını izleyip anormallikleri tespit ederek hızla yanıt verebilecek süreç ve sistemlere ihtiyaç var gibi görünüyor
- Tarama yapılan sitelerin yöneticileriyle yakın iletişim kurularak zararın en aza indirilmesi sağlanmalı. Yalnızca veri toplamaya odaklanmak yerine birlikte var olma perspektifi önemli
1 yorum
Hacker News görüşleri
GPT-2/3/J’nin https://reddit.com/r/counting ile karşılaşmış olması aklıma geldi. Burası, Reddit kullanıcılarının sayıları teker teker göndererek sonsuza kadar saydığı bir yer;
SolidGoldMagikarpgibi kullanıcı adları internette çok sık görülen dizeler gibi algılandığı için tokenizasyon sırasında bağımsız token olarak ele alınmıştıhttps://www.alignmentforum.org/posts/8viQEp8KBg2QSW4Yc/solid...
https://www.lesswrong.com/posts/LAxAmooK4uDfWmbep/anomalous-...
Sözlük sonsuz değil ve GPT-3’ün sözlüğünün de yalnızca 50.257 token olduğu söyleniyordu. Reddit’teki bu niş hobi yüzünden oluşan ek elektrik maliyetiyle, o yeri gerçek metinlerde daha sık görülen bir alt dizeye ayırıp ortalama giriş token sayısını azaltmanın farkının ölçülebilir olup olmadığını da merak ediyorum
OP sitesinin alt başlığı olan IECC ChurnWare 0.3 GPT-5 token’ı olursa komik olur
Nitekim bire bir konuşma olmayan yerlerde “bilmiyorum” cevabı çoğu zaman pek işe yaramaz. Bir grupta bilmiyorsan sessizlik zaten bunu göstermiş olur
https://www.youtube.com/watch?v=WO2X3oZEJOA
Beni daha çok meraklandıran şey, o içerik çiftliğinin ne işe yaradığı. Anlamsız görünüyor ama tuhaf bir ekonomik teşvik olmalı gibi. Ortada bağlı kuruluş linkleri var ama ondan ne kadar kazanılabilir ki
Kendisi onlarca yıldır çeşitli işler yapan tanınmış bir anti-spam figürü. NANOG mesajlarına landing page linkini doğal biçimde serpiştirmesi de botların yemi yutmasını sağlama yöntemi
https://compilers.iecc.com/
https://www.iecc.com/linker/ sayfasında eskiden kitabın taslağını çeşitli formatlarda paylaşıyordu; https://news.ycombinator.com/item?id=18424233 gönderildiğinde ben de çevrimdışı okumak için dosyaları paketlemiştim, sonrasında ise “kronik korsanlık nedeniyle artık sunulmuyor” ifadesi eklendi
E-postayla bunun uygun olup olmadığını sordum ama dosyaları korsanladığımı ima eden kaba bir yanıt alınca linki kaldırdım, onlar da metni değiştirdi. Ben kitabın yazarı değilim, yazar onlar, dolayısıyla böyle yapmaları kendi tercihleri. Yine de bunu yapmamamı sayfaya yazmalarını önermiştim ama onlar daha radikal bir yol seçti
OpenAI sunucu çiftliğinde gerçekten örümcekler cirit attığını ve başkalarının rack’lerine tırmandığını anlatan bir şey olmasını uman tek kişi ben miydim diye merak ediyorum. Olmayacağını biliyordum ama yine de umdum
robots.txtdüzgün ayarlanmamış. Gerçekten engelleyen kısmı yorum satırına almışlarAmazonbot ve GPTBot için
Disallow: /satırlarının ikisi de yorumda, şu anda fiilen geçerli olan tek şeyUser-agent: *için/archiveengelirobots.txtye uyulacaksa, OpenAI için bot engelleme ile veri toplama sorunu birlikte var: https://x.com/AznWeng/status/1777688628308681000En büyük 100 bin web sitesinin %11’i şimdiden OpenAI crawler’ını engelliyor; bu da rakipleri Google, FB, Anthropic ve Perplexity’nin toplamından daha fazla
robots.txtnin bağlayıcılığı zayıf bir şey olduğu ve başka bağlamlarda herkese açık verileri çekip almaya karşı pek çekingen görünmedikleri düşünülürse, bunun kullanıcı deneyimi önünde engel olarak kalmasına izin vermeleri şaşırtıcıBence bırakın yapsın. İnternet istiyorlarsa, bu gerçek internet. Milyonlarca sayfayı çekmesine pek aldırmıyor gibi görünüyor, o yüzden bırakın yapsın
Ağ güvenliği dünyasında buna tarpit denir. Veriyi çok yavaş göndererek ya da sonsuz özyineleme tetikleyerek saldırıları, taramaları ve diğer otomasyonları yavaşlatabilirsiniz
Sonuçta saldırganın zamanını ve enerjisini boşa harcatır ve bizim tarafın savunmayı güçlendirmesi için zaman kazandırabilir
Tarpit farklıdır; tarama ya da scraping'i yavaşlatmak ve karşı tarafın kaynaklarını bilerek boşa harcatmak için tasarlanır. Çeşitli teknikler vardır ama çoğu yanıtı ya da yanıt hızını üstel olarak kısıtlar
2011'de de picolisp projesi, anında sayfa üreten Markov zinciri benzeri bir “ticker” yayımladığında benzer bir şey olmuştu
https://picolisp.com/wiki/?ticker
Oldukça iyi bir honeypot örneği
Sonunda OpenAI gibi şirketlerin neredeyse tamamı modellerini AI tarafından üretilmiş içerik ile eğitiyor olacak ve Soru-Cevap açısından böyle içerikler oldukça sık küçük hatalar içerdiği için, bununla eğitilen AI yanıtlarının kalitesi de hızla düşecek
Şu anda internetteki içeriğin çoğunu insanlar yazıyor ama 5 yıl sonra böyle olmayabilir. Bence bu, AI alanının hızla çözmesi gereken büyük sorunlardan biri. Eski sözde dendiği gibi, içeri çöp girerse dışarı çöp çıkar
Bütün bu durumun ironisi acımasız
Bu, ouroboros'tan çok bir bootstrapping problemine benziyor
Sadece metinle çalışan transformer'ların dönemi bence zaten geçti
Bence OpenAI robots.txt'yi okuyor ama yine de indeksliyor. Sadece, indekslenmemesi gereken bir içerik olduğuna dair bir işaret bırakıyor olabilir