1 puan yazan GN⁺ 5 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Yaklaşık 78.000 filmlik veri sağlayan The Numbers, 5 Mart 2026'da aniden durdu; 30 yıllık sistemi hedef alan büyük ölçekli otomatik trafik ve güvenlik taramaları nedeniyle eski site terk edilerek yalnızca en temel işlevler geri getirildi
  • Toplam trafikte insanların payı yalnızca yaklaşık %10 idi; Aralık 2025'ten itibaren prompt tabanlı toplama ve ajan tipi yapay zeka trafiği hızla arttı, bu yüzden ekibin çalışma süresinin yaklaşık %90'ı eski siteyi ayakta tutmaya harcandı
  • Loglarda normal taramanın yanı sıra veriye erken erişim ya da manipülasyon amaçlı görünen arka kapı aramaları da tespit edildi, ancak gerçek kesinti nedeni ve saldırının faili doğrulanmadı
  • The Numbers verileri, Polymarket'in film gişesi tahmin pazarlarını sonuçlandırmak için ölçüt olarak kullanıldığından, yayımlanmadan önce verilere erişmek işlem avantajı sağlayabiliyor; ayrıca AI araçları eski bir sitenin açıklarını düşük maliyetle taramayı mümkün kılıyor
  • AI crawler'ları okuyucu geri getirmeden büyük maliyet ve kesintilere yol açarak açık webin karşılıklı değişim ilişkisini bozuyor; eski koda ve küçük ekiplere dayanan bağımsız arşiv, haber, forum ve referans siteleri özellikle savunmasız

Film endüstrisinin veri temelinin kaybolduğu bir hafta

  • The Numbers, gişe hasılatı, yapım bütçesi, ev videosu ve streaming verilerini doğrudan araştırıp sunan, yılda 8 milyondan fazla ziyaret alan bir film veri sitesiydi
    • Gazeteciler, akademi, film yapımcıları, tahmin pazarları ve Guinness World Records tarafından otoritatif bir kaynak olarak kullanılıyordu
    • 2026 başında veritabanında 78.396 film, 178.375 sinema gösterim kaydı ve 236.176 kişi bulunuyordu
  • Site 5 Mart 2026'da kapandıktan sonra bir haftadan uzun süre geri dönmedi ve 13 Mart'ta yeni altyapı üzerinde küçültülmüş bir sürümle yeniden açıldı
    • Geçmiş grafikler, film bazlı sayfalar ve Report Builder ortadan kalktı; geriye yalnızca güncel gişe rakamlarına odaklanan asgari işlevler kaldı
    • Ayrıntılı bir açıklama olmadan yalnızca yeniden inşa mesajı gösterilince kullanıcılar öfkelendi; hatta ücretli ürüne geçiş için kasıtlı işlev kısıtlaması yapıldığı şüphesi bile doğdu

1997'de başlayan 30 yıllık sistem

  • Matematikçi ve eski IBM yazılım geliştiricisi Bruce Nash, 17 Ekim 1997'de 300 filmi izleyen bir Geocities sitesi başlattı
    • Access veritabanından HTML üreterek Geocities'e yüklemesi ve Hollywood Stock Exchange forumunda, film hissesi alım satımında kullanılacak gişe analizlerini duyurması başlangıç noktasıydı
    • O dönemde yazılan 20. yıl değerlendirmesi bugün yalnızca Internet Archive kopyasında duruyor
  • On yıllar içinde büyüyen eski site, yaklaşık 160.000 kaynak dosyasıyla yaklaşık 2 milyon sayfa sunuyordu

AI crawler'larının yarattığı iki trafik dalgası

  • İlk 25 yıl boyunca başlıca ziyaretçiler insanlar, kurallara görece iyi uyan arama motorları ve kişisel projeler için veri toplayan araçlardı; aşırı tarayıcılar tespit edilip engellenebiliyordu
  • İlk değişim, 2024 civarında AI eğitimi için çalışan crawler'ların arama motoru taramalarına katılmasıyla başladı
    • AI crawler'ları, arama motorlarına kıyasla kurallara daha az uyma eğiliminde olduğundan, siteyi kararlı tutmak için gereken yönetim işi arttı
    • 2024'te tüm web genelinde otomatik trafik insan trafiğini geçti; sonrasında Cloudflare verilerinde botlar web sayfası isteklerinin %57,5'ine ulaştı
  • İkinci dalga Aralık 2025 civarında başladı; prompt'a yanıt vererek siteyi tarayan AI ajanları ve kullanıcıların doğrudan oluşturduğu ajanlar trafiği daha da büyüttü
    • The Numbers ziyaretlerinin yalnızca yaklaşık %10'u insanların doğrudan gezintisinden geliyordu; geri kalanı AI botları ve otomatik trafikti
    • Aralık'tan Mart başına kadar ekip, çalışma süresinin yaklaşık %90'ını eski siteyi ayakta tutmaya harcadı ve kalan zamanda yeni sistemi geliştirdi

Crawler'lara lisans yolunu gösteren yanıt

  • Ekip, LLM'lerin okuyabileceği bir yönlendirme ekleyerek veriyi doğrudan toplamak yerine lisans satın alma yöntemi hakkında yanıt vermelerini teşvik etti
    • Bunun ardından veri lisansı soruları yaklaşık 10 kat arttı
  • Trafiği hafifletmeye yönelik önlemler işe yarasa da, 30 yıllık kodu ve 160.000 dosyayı savunurken hizmeti sürdürme yönündeki yapısal yük ortadan kalkmadı

Sunucu çöküşü ve güvenlik taraması izleri

  • Sunucu 5 Mart sabaha karşı çöktü ve ekip başlangıçta neden olarak yalnızca AI trafiği yükünü düşündü
  • Loglarda normal URL'ler üzerinden gelen erişimlerin yanında arka kapı arama girişimleri de bulundu
    • Birinin site yayımlanmadan önce verilere erişmeye ya da kullanıcılara sunulan verileri manipüle etmeye çalışmış olması mümkün
    • Aylar boyunca otomatik toplama ve tarama vardı, ancak nihai kesintiye neyin yol açtığı ve bunu kimin yaptığı doğrulanamadı
  • Siber güvenlik uzmanlarının tavsiyesiyle eski sunucu bir daha açılmadı
    • Yedek geri yüklenirse, zaten uzun süredir açık arayan saldırganlara 160.000 legacy dosyası yeniden açılmış olacaktı
    • Eski sunucunun yeniden başlatıldıktan dakikalar içinde tekrar çökebileceği değerlendirilince, yeni altyapıda asgari işlevli bir sürüm kuruldu

Tahmin pazarlarının film verisine yüklediği parasal değer

  • Polymarket, film açılış hafta sonu performans pazarları işletiyor ve The Numbers'ın Daily Box Office Performance verisini pazar sonuçlandırma ölçütü olarak belirtiyor
  • Tek tek hafta sonu pazarları genelde on binlerce ila yüz binlerce dolar büyüklüğünde; aynı anda açık olan tüm film gişesi pazarlarında ise milyonlarca dolar söz konusu olabiliyor
  • Eğer The Numbers verileri yayımlanmadan önce görülebilirse, her hafta diğer yatırımcılardan önce sonucu anlayıp önden işlem yapmak mümkün olabilir
  • Tahmin pazarları neredeyse her tür veriyi parasal değere dönüştürebiliyor; düşük maliyetli AI araçları siteye sızmanın teknik eşiğini düşürüyor ve büyük ölçekli ajan botlar mevcut web altyapısının zayıflıklarını büyütüyor

AI'ın siber saldırı giriş eşiğini düşürmesi

  • Anthropic, Kasım 2025'te AI tarafından koordine edilen ilk belgelenmiş siber casusluk kampanyasını açıkladı
    • Devlet destekli bir yapı yaklaşık 30 kurumu hedef aldı ve AI işin %80-90'ını yürüttü
    • İnsanlar her kampanyada yalnızca 4 ila 6 karar noktasında devreye girdi
    • Gelişmiş siber saldırıların eşiği büyük ölçüde düştü ve düşmeye devam edecek gibi görünüyor
  • Anthropic'in önceki tehdit raporuna göre teknik yetkinliği düşük suçlular bile, geçmişte yıllarca eğitim gerektiren ransomware geliştirme gibi karmaşık işleri AI ile yapabiliyor
  • Otonom AI sızma testi aracı XBOW, yaklaşık 1.060 açık bildirerek HackerOne ABD sıralamasında 1 numaraya yükseldi
  • Bilinen açıklar barındırma ihtimali yüksek 30 yıllık bir site, AI araçlarının düşük maliyetle taraması için uygun bir saldırı yüzeyi sunuyor; geçmişte küçük siteleri koruyan uzmanlık bariyeri de ciddi biçimde zayıflamış durumda

The Numbers'ın tam yeniden inşaya başlaması

  • Kamusal site kapanmış olsa da The Numbers'ın temel gelir kaynakları etkilenmediği için işin kendisi ayakta kaldı
    • Ücretsiz site son yıllarda reklama çok bağımlı değildi
    • Toplu veri satan OpusData, film yapımcıları ve yatırımcılara yönelik karşılaştırmalı analiz raporları ve Business Report başlıca iş alanları
  • 78.396 film, 178.375 gösterim kaydı ve 236.176 kişiyi sunan bir web sitesini sıfırdan yeniden kurmak gerektiğinden, işlevler bir seferde geri getirilemiyor
  • Ekip, 2026'nın kamusal web sitesinin karşısına çıkacak kullanıcıları altı gruba ayırıyor
    • İnsanlar
    • Arama motorları
    • LLM eğitim işleri
    • Prompt tabanlı AI trafiği
    • Ajan tipi AI
    • Tahmin piyasası yatırımcıları
  • Eskiden içerik, reklam ve SEO olmak üzere üç unsura odaklanılırken artık her tasarım kararında yaklaşık 8-10 unsur dikkate alınmak zorunda
  • Yeni site, bu altı kullanıcı tipinin tamamını desteklerken OpusData hizmeti ile Business Report abonelik özelliklerini de eklemeyi ve genel kullanıcılara eski verileri daha iyi bir biçimde geri sunmayı hedefliyor

Tarama maliyeti ve geri dönmeyen ziyaretçiler

  • Cloudflare'ın platform bazlı ölçümlerinde, bir sitenin bir yönlendirilmiş ziyaretçi kazanmak için tolere ettiği tarama hacmi büyük farklar gösterdi
    • Google, ziyaretçi başına yaklaşık 5 sayfa tarıyor
    • OpenAI, 1.000'den fazla sayfa tarıyor
    • Anthropic, 38.000'den fazla sayfa tarıyor
  • Arama motorlarının içerik okuyup karşılığında okuyucu gönderdiği açık webin karşılıklı değişim ilişkisi, AI crawler'larında işlemiyor
  • Büyük ölçekli toplama, küçük sitelerin bant genişliği maliyetini yükseltebilir ve tüm hizmeti durdurabilir

Diğer sitelerin yaşadığı büyük ölçekli tarama zararı

  • Read the Docs'ta tek bir crawler, bir ay içinde sıkıştırılmış HTML olarak 73 TB indirdi ve bant genişliği maliyeti 5.000 doların üzerine çıktı
  • iFixit, Anthropic crawler'ından bir günde 1 milyon istek kaydetti
  • 7 çalışanlı 3D tarama satıcısı Triplegangers, iş saatlerinde OpenAI botu yüzünden kapandı; CEO bunu fiilen bir DDoS saldırısı olarak değerlendirdi
  • SourceHut işletmecisi, çalışma zamanının her hafta %20-100'ünü AI crawler'larıyla uğraşmaya ayırıyor ve haftada onlarca kısa kesinti yaşıyor
  • Linux haber sitesi LWN, milyonlarca IP'den gelen crawler trafiğini dağıtık hizmet engelleme saldırısı olarak değerlendiriyor
  • GNOME açık kaynak projesinin ölçtüğü trafiğin yaklaşık %97'si botlardan oluşuyordu
  • Bir üniversite kütüphanesi, katalog hizmetini korumak için 48 saat içinde 16.000 IP adresini engelledi

Wikipedia'nın yaşadığı maliyet ve okur kaybı

  • Wikimedia Foundation, Nisan 2025'te botların Wikipedia sayfa görüntülemelerinin yaklaşık %35'ini oluşturduğunu, ancak işleme maliyeti en yüksek trafikte paylarının en az %65'e çıktığını hesapladı
    • Bunun nedeni, crawler'ların insanların neredeyse hiç okumadığı sayfaları bile büyük ölçekte çekmesi ve maliyet yükünü artırması
  • Altı ay sonra Wikipedia'nın insan kaynaklı sayfa görüntülemeleri geçen yıla göre yaklaşık %8 azaldı
    • Kullanıcılar bilgiyi doğrudan Wikipedia'ya gitmek yerine AI özetlerinden giderek daha fazla alıyor
    • AI sistemleri içeriği büyük ölçekte çekerken, asıl sitenin alacağı okurları da azaltıyor

Eski internet varsayımlarının çöktüğü durum

  • AI araçları güçlü ama aynı zamanda yıkıcı; gerçek ortamda halk tarafından eşzamanlı olarak test ediliyorlar
  • Eski açık web şu varsayımlar üzerine kuruluydu, ancak bunların hiçbiri artık bugünkü durumla örtüşmüyor
    • Ziyaretçilerin çoğu insandır
    • Trafik büyük ölçüde okur sayısıyla orantılıdır
    • Site sunma maliyeti, işletmecinin elde ettiği değerle bağlantılıdır
  • Bu mesele AI'ın faydasını inkâr etmekten ayrı; bugünkü web, herkesin erişebildiği AI modellerinin gücü ve ölçeğine göre tasarlanmış değil

Tarama başına ücret ve varsayılan engelleme denemeleri

  • Cloudflare, sitelerin AI crawler'larına sayfa başına ücret uygulayabildiği pay-per-crawl modelini kullanıma sundu
  • Ardından, içerik AI yanıtlarında gerçekten kullanıldığında yayıncıya ödeme yapan pay-per-use modelini duyurdu
  • 15 Eylül'den itibaren Cloudflare müşterilerinin reklam tabanlı sayfaları, ücret ödemeyen mixed-use crawler'lara karşı varsayılan olarak engellenecek
  • Bu politikaların başarıya ulaşıp ulaşmayacağı, AI şirketlerinin teknik olarak etrafından dolanmak yerine ücretlendirme sistemine katılıp katılmayacağına bağlı

Tüm bağımsız web siteleri için bir uyarı

  • The Numbers, aşırı makine trafiği ile olası sızmalar arasında tüm sitesini kaybetti, ancak kamusal web sitesi işin tamamı olmadığı için hayatta kalabildi
  • Alman tekstil şirketi ZEGO, 37 yıl faaliyet gösterdikten sonra Mart ayındaki siber saldırı nedeniyle üretimi 6 hafta durunca iflas başvurusu yaptı
  • Bağımsız arşivler, hobi veritabanları, yerel haberler, forumlar ve referans siteleri; eski koda ve küçük ekipler ya da tekil işletmecilere dayanarak birikmiş ortak bilgiyi koruyor
  • The Numbers daha iyi bir yapıyla geri dönmeye çalışıyor; eski internet için yapılmış küçük siteleri kullanmaya ve desteklemeye devam etmek, onların hayatta kalmasıyla doğrudan bağlantılı

1 yorum

 
GN⁺ 5 시간 전
Hacker News görüşleri
  • Ciddi ciddi soruyorum: tahmin piyasaları TheNumbers.com için yeni bir gelir kaynağı olamaz mı? Saldırganlardan bazılarının, açıklanmadan önce rakamları elde edip tahmin piyasalarında kesin bilgiyle bahis yapmaya çalışmış olması mümkün.
    Bu açıkça içeriden öğrenenlerin ticareti ve son derece etik dışı; ancak PolyMarket CEO’su, içeriden öğrenenlerin ticaretinin hizmetin amacının bir parçası olduğunu daha önce söylemişti: https://youtu.be/ZN4njIQcSR4?si=ztyTtgjeHSJbNjSZ&t=1566

  • Asıl mesele yalnızca ajanların siteyi dövmesi değil, istismar edilebilir potansiyel açıklar bulunması. Sitenin kapanıp veri ve tasarımı ciddi ölçüde küçülterek geri dönmesinin nedeni de bu.
    Kötü niyetli bir kullanıcı The Numbers’ın açıklanmamış verilerine erişirse, her hafta yanıtı diğer işlemcilerden önce bilip önden işlem yapabilir.

    • Tahmin piyasası işlemcileri sonuçları önden işlemeye çalıştıysa, bunu piyasa kapanmadan önce belirli bir işlem durdurma tampon süresi koyarak tahmin piyasası tarafı engellemeliydi.
  • Ücretsiz siteyi bozup kullanıcıları ücretli ürüne yöneltmeyi amaçlayan kasıtlı bir “al ve kaç” hamlesi olduğu yönündeki Reddit spekülasyonlarını görünce, ileride ücretsiz kaynakların daha da azalacağından endişeleniyorum.
    Eskiden, birinin benzer bir sorunu çözmekte kullanmasını umarak küçük araçları açık kaynak yayımlardım; artık bunun kazınıp eğitim verisine dönüşeceği ve sonra paraya çevrileceği gerçeği yüzünden ücretsiz web’e katkıda bulunmaya gönülsüzüm. Faydalı ücretsiz sitelerin işletmecilerinin öfkelenmesi normal.

    • Başkalarının sitelerini kazıyıp paraya çevirmek, büyük dil modeli furyasından önce de vardı; değişen şey ölçek.
      İşin rahatsız edici biçimde kullanılmasından ibaret kalmıyor; bakım maliyeti ve süresi artıyor, gerçek zarar da doğuyor.
    • Yakın zamanda 200 GitHub yıldızı alan bir açık kaynak projeyi gizliye aldım. Başka projelerin temel alıp kaynak göstermesi sorun değildi, ama büyük dil modelleri her şeyi emip işleyerek kendi ürünüymüş gibi sunuyor.
    • İnsanların sonuçta başka bir yere para ödeyerek erişeceği veriyi neden ücretsiz sunalım? Yapay zekanın ölçüsüz kullanımı yüzünden internet geneli aşırı bir açgözlülüğe sürüklenebilir; bu, Google’ın insanların arama sonuçlarının 2. sayfasına bakmama alışkanlığını kullanarak küçük siteleri öldürmesine benziyor.
    • Modelin benim yazılımımla eğitilip daha iyi hale gelmesini istediğim için mümkün olduğunca çok şeyi açık kaynak yayımlıyorum.
    • Bir sonraki AGPL’de, belki de normal GPL’de, kaynak materyal kullanılarak kapalı modellerin eğitilmesinin yasaklanması açıkça yer alacak gibi. İdeal olarak, açık ağırlıklı modeller de tüm eğitim sürecini paylaşmıyorsa yasaklanmalı.
  • Birkaç yıl önce, COVID-19 döneminde ABD hükümetinin küçük işletme desteklerini ve DOJ’nin dava açtığı sahte kredileri sorgulayan bir site işletiyordum. Yaklaşık 10 GB’lık tüm açık veri ücretsiz indirilebiliyordu ve bağışlar toplamda yaklaşık 2 bin dolardı.
    Ama yapay zeka crawler’ları, ana sayfadaki tam indirme bağlantısı yerine arama koşullarının tüm kombinasyonlarını sayfa sayfa gezerek onlarca terabayt HTML indirdi. CloudFront önbelleği ve verimli bir backend’e rağmen yalnızca aylık ağ maliyeti yaklaşık 1.000 dolar oldu; sonraki ay siteyi kapattım.

    • BigQuery’nin açık veri kümelerini kullanırsanız, kullanıcı karmaşık SQL çalıştırsa bile maliyeti kullanıcı üstlenir; sağlayıcı yalnızca depolama maliyetini öder.
    • Hetzner dedicated sunucularda inbound ve outbound sınırsızdır; sunucu açık artırmasında ayda yaklaşık 40 dolara yüksek performanslı donanım bulunabilir.
      Ancak ödemeyi kaçırırsanız sunucu yaklaşık bir hafta içinde silinebilir, bu yüzden kesinlikle gecikmeye düşmemek gerekir.
    • Bunlar yapay zeka crawler’ları değil; güvenlik hizmeti satın aldırmak ve mevcut tarayıcı tekelini güçlendirmek için kamuoyu oluşturan DDoS saldırganları olabilir.
    • AWS üzerine kurmak finansal bir saatli bomba gibidir.
    • Yapay zeka crawler’larının arama motorları gibi mevcut crawler’lardan neden daha fazla yük oluşturduğunu merak ediyorum. Daha kapsamlı mı taradılar, daha sık mı geldiler bilmek isterdim.
  • Değişen trafik bileşimine yanıt verecek açık kaynak teknik kalıplara ve kütüphanelere ihtiyaç yok mu? Milyonlarca küçük site ve içerik üreticisi, büyük ölçekli otomatik erişime karşı kendini savunacak kapasiteye sahip değil; içerik ne kadar faydalıysa o kadar agresif crawling’e maruz kalıyor, işletme maliyeti ve istikrarsızlık artıyor.
    Ajan tanımlama, hız sınırlama, trafik sınıflandırma, erişim politikaları, önbellek, doğrulama süreçleri, loglama, kaynak doğrulama ve kullanım kontrolünü içeren topluluk yönetim araçlarına ihtiyaç var. Her işletmecinin tek başına sıfırdan yapması yerine, bugünün otomasyon trafiğine uygun güçlü ortak kurallar sağlanmalı.

    • Botnetlere karşı ortak yanıt gerekli. Kimliğini açıklayan ve kurallara uyan iyi botları engellemek kolay; ancak gerçek kullanıcı gibi davranıp konut proxy’lerinin arkasına saklanan kötü niyetli botları durdurmak neredeyse imkânsız.
      Enfekte akıllı TV ve telefonların proxy erişimini açıkça satan şirketler de olduğuna göre, bunların IP veritabanını oluşturup engellemek mümkün olmaz mı? Engelleme uyarısıyla evdeki enfekte cihazların kontrol edilmesini teşvik edersek sorunu kökünden çözme ihtimali doğar: https://news.ycombinator.com/item?id=49000864
    • Topluluğun çözümü robots.txt’ye uyumdu, ama yasal zorunluluk değil centilmenlik anlaşması olduğu için yapay zeka crawler’ları bunu görmezden geldi.
      Sonunda mevcut trafik taşması kontrol araçlarına geri dönüyoruz. Önerilen araçlar Slashdot etkisini, DDoS’u ve aşırı arama motoru crawling’ini engellemek için onlarca yıldır kullanılıyor; Cloudflare gibi şirketler de bu alanda zaten öncü.
    • Bu sorunun teknokratik bir çözümü olduğunu düşünmüyorum. Varlıklı insanlar özel bir neden olmadan interneti parayla DDoS’luyor; bu yüzden sorumluları bulup para cezası veya hapis cezası vermek gerekir. Konut proxy sağlayıcılarından başlamak uygun olabilir.
  • Yapay zeka şirketleri gerçekten de maliyetleri toplumsallaştırıp kârı özelleştiriyor. The Numbers gibi siteler yapay zeka saldırısına dayanmanın maliyetini üstleniyor, ama yapay zeka şirketlerinden hiçbir karşılık almıyor.

    • Öte yandan siteye büyük dil modelleri için yönerge ekledikten sonra lisans başvurularının 10 kat arttığı söyleniyor. Gerçek sözleşme bedellerinin ödenip ödenmediği haberde yer almıyor.
      Crawler kaliteli tüm veri için lisans ücreti ödeseydi sorun olmazdı; asıl mesele, açıklanmamış verilere erişmek için açık aramaya başlamaları.
    • Sadece karşılık alamamakla kalmıyor, ek maliyet de üstleniyorlar
  • Ücretsiz herkese açık bölüm, statik site oluşturucu ile yeniden yapılmaya ve bot algılayan bir CDN ile birleştirilmeye ideal bir site gibi görünüyor. Böylece makul bir maliyetle uzun süre işletilebilir gibi.
    Mevcut ve yeni mimariyle siteyi ayakta tutmak için devreye alınan hafifletme ve ölçekleme stratejilerini de merak ediyorum.

    • Bu sorun 20 yıl önce Varnish Cache ve Coral CDN ile zaten çözülmüştü. Botlar yalnızca son dönemde web sunucularının ne kadar verimsiz hale geldiğini ortaya çıkarıyor.
      2000’lerdeki özensiz PHP siteleri bile saniyede yaklaşık 200 isteği, statik siteler 1.000’in üzerini işleyebiliyordu; Node.js ise işbirlikçi iş parçacığı modeliyle saniyede 100 bin isteği öne sürüyordu. Buna karşılık günümüz siteleri ORM ve N+1 sorunları yüzünden yüzlerce-binlerce veritabanı sorgusu çalıştırıyor, yanıtlar 500 ms’nin üzerine çıkıyor ve 1.000 eşzamanlı kullanıcı bile yük oluşturuyor.
      Dil ve veritabanından bağımsız Rus bebek önbelleği ile bağımlı verilerin doğru önbellek geçersizleştirmesi yaygınlaşamadı. Laravel’in touch event’lerini ve Redis sorgu önbelleğini bile denedim ama önbellek geçersizleştirme fiilen çözülmemiş bir sorun; bunu kendiniz uygulamaya çalışmak yerine en baştan paketler ve sharding gibi stratejileri düşünmek gerekiyor.
      Web’in, BitTorrent gibi içeriği yakındaki eşlerden alan P2P içerik adreslemeli bir depolama alanı haline gelmesi gerekirdi; ancak HTTPS/SSL ve tarayıcı güvenlik modeli buna engel oldu. Güven ağı ya da sıfır bilgi kanıtları bile gerekebilir; bu yüzden bir süre daha sıradan insan doğrulama ekranlarına mahkûm kalacağız gibi görünüyor.
    • Yaklaşım olarak neredeyse yalnızca statik yayınlamayla bile mükemmel bir güvenlik modeli oluşturulabilir ve zaten yeniden yazma zamanı gelmiş gibiydi. Büyük dil modellerinin yardımıyla artık bu, bir hafta sonu işi bile olabilir.
  • 2015’te, o dönemde gerçek zamanlı sinema bileti satış verileri sağlayan tek hizmet olan Applaudience’ı başlattım; kalibrasyon sürecinde TheNumbers.com’daki rakamlarla karşılaştırma yapardık.
    Şimdi başka bir iş yapıyorum ama kendi geliştirdiğim teknolojiler içinde hâlâ en sevdiğim bu; bir gün yeniden canlandırmak istiyorum.

  • Büyük yapay zeka şirketlerinin crawler’ları, robots.txt içinde sırasıyla ClaudeBot, Claude-SearchBot, Claude-User, GPTBot, OAI-SearchBot, PerplexityBot, Google-Extended, Google-Extended-Factual, Bingbot için Disallow: / belirtilerek engellenebilir.

    • Bu yalnızca kurallara uyan crawler’larda işe yarar. Akıllı TV’ler veya telefon uygulamaları gibi tüketici cihazlarını kullanan, hatta bazen internet bağlantısı sağlama karşılığında ödül bile veren botlar buna uymaz. Hacklenmiş diş fırçaları gibi cihazların bile devreye sokulması mümkün: https://news.ycombinator.com/item?id=49000864
    • Faydalı ama ya tamamen izin ver ya da tamamen engelle yaklaşımına yakın. Google crawl-delay destekleyip sunucunun durumuna göre ayarlamaya izin verse iyi olurdu, ancak desteklemiyor: https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec#syntax
      Engellerseniz aramadan gelen trafiğin de daha da azalacağı görülüyor.
    • ClaudeBot’ta en azından geçen aya kadar dizin URL’lerinin sonundaki eğik çizgiyi kaldıran bir hata vardı. Bağlantıda eğik çizgi olmasına rağmen onu çıkarıp istek gönderiyor, Caddy’nin yönlendirmesini aldıktan sonra doğru URL’yi yeniden istiyordu.
      Sonuç olarak çoğu alt dizin URL’sine gereksiz bir istek daha ekleniyordu.
    • İşlettiğim site ağındaki bot trafiğinin %90’ı, konut bağlantıları üzerinden gelen headless Chrome’dan oluşuyor ve pratikte engellenemiyor. Google bile bunu durduramıyor; AdSense rakamlarını bile şişiriyor.
    • Bu, yemek kutusuna “yeme” etiketi yapıştırınca benim yemeyeceğimi varsaymak kadar bir savunma.
  • Eski Rusça radyo yayınlarını arşivleyen küçük bir site olan http://radar.lv’yi işletiyorum; eskiden ABD trafiği %5’ti, ancak son dönemde trafiğin %90’ı ABD’den geliyor.
    Ayda 1 TB’a kadar kaldırabildiğim için şanslıyım ve crawl edilmesine karşı değilim; ancak gerçek ziyaretçilerin kararlılığı konusunda endişeliyim. Cloudflare’ın yakın zamanda çıkardığı ziyaret başına ödeme özelliğini açıp açmamayı düşünüyorum.
    Kişisel blogumda statik oluşturucu kullanıyorum, ama bu arşivin yıllardır güvenlik yamaları kesilmiş eski bir Drupal kullanması gibi bir sorun da var.