- Yaklaşık 78.000 filmlik veri sağlayan The Numbers, 5 Mart 2026'da aniden durdu; 30 yıllık sistemi hedef alan büyük ölçekli otomatik trafik ve güvenlik taramaları nedeniyle eski site terk edilerek yalnızca en temel işlevler geri getirildi
- Toplam trafikte insanların payı yalnızca yaklaşık %10 idi; Aralık 2025'ten itibaren prompt tabanlı toplama ve ajan tipi yapay zeka trafiği hızla arttı, bu yüzden ekibin çalışma süresinin yaklaşık %90'ı eski siteyi ayakta tutmaya harcandı
- Loglarda normal taramanın yanı sıra veriye erken erişim ya da manipülasyon amaçlı görünen arka kapı aramaları da tespit edildi, ancak gerçek kesinti nedeni ve saldırının faili doğrulanmadı
- The Numbers verileri, Polymarket'in film gişesi tahmin pazarlarını sonuçlandırmak için ölçüt olarak kullanıldığından, yayımlanmadan önce verilere erişmek işlem avantajı sağlayabiliyor; ayrıca AI araçları eski bir sitenin açıklarını düşük maliyetle taramayı mümkün kılıyor
- AI crawler'ları okuyucu geri getirmeden büyük maliyet ve kesintilere yol açarak açık webin karşılıklı değişim ilişkisini bozuyor; eski koda ve küçük ekiplere dayanan bağımsız arşiv, haber, forum ve referans siteleri özellikle savunmasız
Film endüstrisinin veri temelinin kaybolduğu bir hafta
- The Numbers, gişe hasılatı, yapım bütçesi, ev videosu ve streaming verilerini doğrudan araştırıp sunan, yılda 8 milyondan fazla ziyaret alan bir film veri sitesiydi
- Gazeteciler, akademi, film yapımcıları, tahmin pazarları ve Guinness World Records tarafından otoritatif bir kaynak olarak kullanılıyordu
- 2026 başında veritabanında 78.396 film, 178.375 sinema gösterim kaydı ve 236.176 kişi bulunuyordu
- Site 5 Mart 2026'da kapandıktan sonra bir haftadan uzun süre geri dönmedi ve 13 Mart'ta yeni altyapı üzerinde küçültülmüş bir sürümle yeniden açıldı
- Geçmiş grafikler, film bazlı sayfalar ve Report Builder ortadan kalktı; geriye yalnızca güncel gişe rakamlarına odaklanan asgari işlevler kaldı
- Ayrıntılı bir açıklama olmadan yalnızca yeniden inşa mesajı gösterilince kullanıcılar öfkelendi; hatta ücretli ürüne geçiş için kasıtlı işlev kısıtlaması yapıldığı şüphesi bile doğdu
1997'de başlayan 30 yıllık sistem
- Matematikçi ve eski IBM yazılım geliştiricisi Bruce Nash, 17 Ekim 1997'de 300 filmi izleyen bir Geocities sitesi başlattı
- Access veritabanından HTML üreterek Geocities'e yüklemesi ve Hollywood Stock Exchange forumunda, film hissesi alım satımında kullanılacak gişe analizlerini duyurması başlangıç noktasıydı
- O dönemde yazılan 20. yıl değerlendirmesi bugün yalnızca Internet Archive kopyasında duruyor
- On yıllar içinde büyüyen eski site, yaklaşık 160.000 kaynak dosyasıyla yaklaşık 2 milyon sayfa sunuyordu
AI crawler'larının yarattığı iki trafik dalgası
- İlk 25 yıl boyunca başlıca ziyaretçiler insanlar, kurallara görece iyi uyan arama motorları ve kişisel projeler için veri toplayan araçlardı; aşırı tarayıcılar tespit edilip engellenebiliyordu
- İlk değişim, 2024 civarında AI eğitimi için çalışan crawler'ların arama motoru taramalarına katılmasıyla başladı
- AI crawler'ları, arama motorlarına kıyasla kurallara daha az uyma eğiliminde olduğundan, siteyi kararlı tutmak için gereken yönetim işi arttı
- 2024'te tüm web genelinde otomatik trafik insan trafiğini geçti; sonrasında Cloudflare verilerinde botlar web sayfası isteklerinin %57,5'ine ulaştı
- İkinci dalga Aralık 2025 civarında başladı; prompt'a yanıt vererek siteyi tarayan AI ajanları ve kullanıcıların doğrudan oluşturduğu ajanlar trafiği daha da büyüttü
- The Numbers ziyaretlerinin yalnızca yaklaşık %10'u insanların doğrudan gezintisinden geliyordu; geri kalanı AI botları ve otomatik trafikti
- Aralık'tan Mart başına kadar ekip, çalışma süresinin yaklaşık %90'ını eski siteyi ayakta tutmaya harcadı ve kalan zamanda yeni sistemi geliştirdi
Crawler'lara lisans yolunu gösteren yanıt
- Ekip, LLM'lerin okuyabileceği bir yönlendirme ekleyerek veriyi doğrudan toplamak yerine lisans satın alma yöntemi hakkında yanıt vermelerini teşvik etti
- Bunun ardından veri lisansı soruları yaklaşık 10 kat arttı
- Trafiği hafifletmeye yönelik önlemler işe yarasa da, 30 yıllık kodu ve 160.000 dosyayı savunurken hizmeti sürdürme yönündeki yapısal yük ortadan kalkmadı
Sunucu çöküşü ve güvenlik taraması izleri
- Sunucu 5 Mart sabaha karşı çöktü ve ekip başlangıçta neden olarak yalnızca AI trafiği yükünü düşündü
- Loglarda normal URL'ler üzerinden gelen erişimlerin yanında arka kapı arama girişimleri de bulundu
- Birinin site yayımlanmadan önce verilere erişmeye ya da kullanıcılara sunulan verileri manipüle etmeye çalışmış olması mümkün
- Aylar boyunca otomatik toplama ve tarama vardı, ancak nihai kesintiye neyin yol açtığı ve bunu kimin yaptığı doğrulanamadı
- Siber güvenlik uzmanlarının tavsiyesiyle eski sunucu bir daha açılmadı
- Yedek geri yüklenirse, zaten uzun süredir açık arayan saldırganlara 160.000 legacy dosyası yeniden açılmış olacaktı
- Eski sunucunun yeniden başlatıldıktan dakikalar içinde tekrar çökebileceği değerlendirilince, yeni altyapıda asgari işlevli bir sürüm kuruldu
Tahmin pazarlarının film verisine yüklediği parasal değer
- Polymarket, film açılış hafta sonu performans pazarları işletiyor ve The Numbers'ın
Daily Box Office Performanceverisini pazar sonuçlandırma ölçütü olarak belirtiyor - Tek tek hafta sonu pazarları genelde on binlerce ila yüz binlerce dolar büyüklüğünde; aynı anda açık olan tüm film gişesi pazarlarında ise milyonlarca dolar söz konusu olabiliyor
- Eğer The Numbers verileri yayımlanmadan önce görülebilirse, her hafta diğer yatırımcılardan önce sonucu anlayıp önden işlem yapmak mümkün olabilir
- Tahmin pazarları neredeyse her tür veriyi parasal değere dönüştürebiliyor; düşük maliyetli AI araçları siteye sızmanın teknik eşiğini düşürüyor ve büyük ölçekli ajan botlar mevcut web altyapısının zayıflıklarını büyütüyor
AI'ın siber saldırı giriş eşiğini düşürmesi
- Anthropic, Kasım 2025'te AI tarafından koordine edilen ilk belgelenmiş siber casusluk kampanyasını açıkladı
- Devlet destekli bir yapı yaklaşık 30 kurumu hedef aldı ve AI işin %80-90'ını yürüttü
- İnsanlar her kampanyada yalnızca 4 ila 6 karar noktasında devreye girdi
- Gelişmiş siber saldırıların eşiği büyük ölçüde düştü ve düşmeye devam edecek gibi görünüyor
- Anthropic'in önceki tehdit raporuna göre teknik yetkinliği düşük suçlular bile, geçmişte yıllarca eğitim gerektiren ransomware geliştirme gibi karmaşık işleri AI ile yapabiliyor
- Otonom AI sızma testi aracı XBOW, yaklaşık 1.060 açık bildirerek HackerOne ABD sıralamasında 1 numaraya yükseldi
- Bilinen açıklar barındırma ihtimali yüksek 30 yıllık bir site, AI araçlarının düşük maliyetle taraması için uygun bir saldırı yüzeyi sunuyor; geçmişte küçük siteleri koruyan uzmanlık bariyeri de ciddi biçimde zayıflamış durumda
The Numbers'ın tam yeniden inşaya başlaması
- Kamusal site kapanmış olsa da The Numbers'ın temel gelir kaynakları etkilenmediği için işin kendisi ayakta kaldı
- Ücretsiz site son yıllarda reklama çok bağımlı değildi
- Toplu veri satan OpusData, film yapımcıları ve yatırımcılara yönelik karşılaştırmalı analiz raporları ve Business Report başlıca iş alanları
- 78.396 film, 178.375 gösterim kaydı ve 236.176 kişiyi sunan bir web sitesini sıfırdan yeniden kurmak gerektiğinden, işlevler bir seferde geri getirilemiyor
- Ekip, 2026'nın kamusal web sitesinin karşısına çıkacak kullanıcıları altı gruba ayırıyor
- İnsanlar
- Arama motorları
- LLM eğitim işleri
- Prompt tabanlı AI trafiği
- Ajan tipi AI
- Tahmin piyasası yatırımcıları
- Eskiden içerik, reklam ve SEO olmak üzere üç unsura odaklanılırken artık her tasarım kararında yaklaşık 8-10 unsur dikkate alınmak zorunda
- Yeni site, bu altı kullanıcı tipinin tamamını desteklerken OpusData hizmeti ile Business Report abonelik özelliklerini de eklemeyi ve genel kullanıcılara eski verileri daha iyi bir biçimde geri sunmayı hedefliyor
Tarama maliyeti ve geri dönmeyen ziyaretçiler
- Cloudflare'ın platform bazlı ölçümlerinde, bir sitenin bir yönlendirilmiş ziyaretçi kazanmak için tolere ettiği tarama hacmi büyük farklar gösterdi
- Google, ziyaretçi başına yaklaşık 5 sayfa tarıyor
- OpenAI, 1.000'den fazla sayfa tarıyor
- Anthropic, 38.000'den fazla sayfa tarıyor
- Arama motorlarının içerik okuyup karşılığında okuyucu gönderdiği açık webin karşılıklı değişim ilişkisi, AI crawler'larında işlemiyor
- Büyük ölçekli toplama, küçük sitelerin bant genişliği maliyetini yükseltebilir ve tüm hizmeti durdurabilir
Diğer sitelerin yaşadığı büyük ölçekli tarama zararı
- Read the Docs'ta tek bir crawler, bir ay içinde sıkıştırılmış HTML olarak 73 TB indirdi ve bant genişliği maliyeti 5.000 doların üzerine çıktı
- iFixit, Anthropic crawler'ından bir günde 1 milyon istek kaydetti
- 7 çalışanlı 3D tarama satıcısı Triplegangers, iş saatlerinde OpenAI botu yüzünden kapandı; CEO bunu fiilen bir DDoS saldırısı olarak değerlendirdi
- SourceHut işletmecisi, çalışma zamanının her hafta %20-100'ünü AI crawler'larıyla uğraşmaya ayırıyor ve haftada onlarca kısa kesinti yaşıyor
- Linux haber sitesi LWN, milyonlarca IP'den gelen crawler trafiğini dağıtık hizmet engelleme saldırısı olarak değerlendiriyor
- GNOME açık kaynak projesinin ölçtüğü trafiğin yaklaşık %97'si botlardan oluşuyordu
- Bir üniversite kütüphanesi, katalog hizmetini korumak için 48 saat içinde 16.000 IP adresini engelledi
Wikipedia'nın yaşadığı maliyet ve okur kaybı
- Wikimedia Foundation, Nisan 2025'te botların Wikipedia sayfa görüntülemelerinin yaklaşık %35'ini oluşturduğunu, ancak işleme maliyeti en yüksek trafikte paylarının en az %65'e çıktığını hesapladı
- Bunun nedeni, crawler'ların insanların neredeyse hiç okumadığı sayfaları bile büyük ölçekte çekmesi ve maliyet yükünü artırması
- Altı ay sonra Wikipedia'nın insan kaynaklı sayfa görüntülemeleri geçen yıla göre yaklaşık %8 azaldı
- Kullanıcılar bilgiyi doğrudan Wikipedia'ya gitmek yerine AI özetlerinden giderek daha fazla alıyor
- AI sistemleri içeriği büyük ölçekte çekerken, asıl sitenin alacağı okurları da azaltıyor
Eski internet varsayımlarının çöktüğü durum
- AI araçları güçlü ama aynı zamanda yıkıcı; gerçek ortamda halk tarafından eşzamanlı olarak test ediliyorlar
- Eski açık web şu varsayımlar üzerine kuruluydu, ancak bunların hiçbiri artık bugünkü durumla örtüşmüyor
- Ziyaretçilerin çoğu insandır
- Trafik büyük ölçüde okur sayısıyla orantılıdır
- Site sunma maliyeti, işletmecinin elde ettiği değerle bağlantılıdır
- Bu mesele AI'ın faydasını inkâr etmekten ayrı; bugünkü web, herkesin erişebildiği AI modellerinin gücü ve ölçeğine göre tasarlanmış değil
Tarama başına ücret ve varsayılan engelleme denemeleri
- Cloudflare, sitelerin AI crawler'larına sayfa başına ücret uygulayabildiği pay-per-crawl modelini kullanıma sundu
- Ardından, içerik AI yanıtlarında gerçekten kullanıldığında yayıncıya ödeme yapan pay-per-use modelini duyurdu
- 15 Eylül'den itibaren Cloudflare müşterilerinin reklam tabanlı sayfaları, ücret ödemeyen
mixed-usecrawler'lara karşı varsayılan olarak engellenecek - Bu politikaların başarıya ulaşıp ulaşmayacağı, AI şirketlerinin teknik olarak etrafından dolanmak yerine ücretlendirme sistemine katılıp katılmayacağına bağlı
Tüm bağımsız web siteleri için bir uyarı
- The Numbers, aşırı makine trafiği ile olası sızmalar arasında tüm sitesini kaybetti, ancak kamusal web sitesi işin tamamı olmadığı için hayatta kalabildi
- Alman tekstil şirketi ZEGO, 37 yıl faaliyet gösterdikten sonra Mart ayındaki siber saldırı nedeniyle üretimi 6 hafta durunca iflas başvurusu yaptı
- Bağımsız arşivler, hobi veritabanları, yerel haberler, forumlar ve referans siteleri; eski koda ve küçük ekipler ya da tekil işletmecilere dayanarak birikmiş ortak bilgiyi koruyor
- The Numbers daha iyi bir yapıyla geri dönmeye çalışıyor; eski internet için yapılmış küçük siteleri kullanmaya ve desteklemeye devam etmek, onların hayatta kalmasıyla doğrudan bağlantılı
1 yorum
Hacker News görüşleri
Ciddi ciddi soruyorum: tahmin piyasaları TheNumbers.com için yeni bir gelir kaynağı olamaz mı? Saldırganlardan bazılarının, açıklanmadan önce rakamları elde edip tahmin piyasalarında kesin bilgiyle bahis yapmaya çalışmış olması mümkün.
Bu açıkça içeriden öğrenenlerin ticareti ve son derece etik dışı; ancak PolyMarket CEO’su, içeriden öğrenenlerin ticaretinin hizmetin amacının bir parçası olduğunu daha önce söylemişti: https://youtu.be/ZN4njIQcSR4?si=ztyTtgjeHSJbNjSZ&t=1566
Asıl mesele yalnızca ajanların siteyi dövmesi değil, istismar edilebilir potansiyel açıklar bulunması. Sitenin kapanıp veri ve tasarımı ciddi ölçüde küçülterek geri dönmesinin nedeni de bu.
Kötü niyetli bir kullanıcı The Numbers’ın açıklanmamış verilerine erişirse, her hafta yanıtı diğer işlemcilerden önce bilip önden işlem yapabilir.
Ücretsiz siteyi bozup kullanıcıları ücretli ürüne yöneltmeyi amaçlayan kasıtlı bir “al ve kaç” hamlesi olduğu yönündeki Reddit spekülasyonlarını görünce, ileride ücretsiz kaynakların daha da azalacağından endişeleniyorum.
Eskiden, birinin benzer bir sorunu çözmekte kullanmasını umarak küçük araçları açık kaynak yayımlardım; artık bunun kazınıp eğitim verisine dönüşeceği ve sonra paraya çevrileceği gerçeği yüzünden ücretsiz web’e katkıda bulunmaya gönülsüzüm. Faydalı ücretsiz sitelerin işletmecilerinin öfkelenmesi normal.
İşin rahatsız edici biçimde kullanılmasından ibaret kalmıyor; bakım maliyeti ve süresi artıyor, gerçek zarar da doğuyor.
Birkaç yıl önce, COVID-19 döneminde ABD hükümetinin küçük işletme desteklerini ve DOJ’nin dava açtığı sahte kredileri sorgulayan bir site işletiyordum. Yaklaşık 10 GB’lık tüm açık veri ücretsiz indirilebiliyordu ve bağışlar toplamda yaklaşık 2 bin dolardı.
Ama yapay zeka crawler’ları, ana sayfadaki tam indirme bağlantısı yerine arama koşullarının tüm kombinasyonlarını sayfa sayfa gezerek onlarca terabayt HTML indirdi. CloudFront önbelleği ve verimli bir backend’e rağmen yalnızca aylık ağ maliyeti yaklaşık 1.000 dolar oldu; sonraki ay siteyi kapattım.
Ancak ödemeyi kaçırırsanız sunucu yaklaşık bir hafta içinde silinebilir, bu yüzden kesinlikle gecikmeye düşmemek gerekir.
Değişen trafik bileşimine yanıt verecek açık kaynak teknik kalıplara ve kütüphanelere ihtiyaç yok mu? Milyonlarca küçük site ve içerik üreticisi, büyük ölçekli otomatik erişime karşı kendini savunacak kapasiteye sahip değil; içerik ne kadar faydalıysa o kadar agresif crawling’e maruz kalıyor, işletme maliyeti ve istikrarsızlık artıyor.
Ajan tanımlama, hız sınırlama, trafik sınıflandırma, erişim politikaları, önbellek, doğrulama süreçleri, loglama, kaynak doğrulama ve kullanım kontrolünü içeren topluluk yönetim araçlarına ihtiyaç var. Her işletmecinin tek başına sıfırdan yapması yerine, bugünün otomasyon trafiğine uygun güçlü ortak kurallar sağlanmalı.
Enfekte akıllı TV ve telefonların proxy erişimini açıkça satan şirketler de olduğuna göre, bunların IP veritabanını oluşturup engellemek mümkün olmaz mı? Engelleme uyarısıyla evdeki enfekte cihazların kontrol edilmesini teşvik edersek sorunu kökünden çözme ihtimali doğar: https://news.ycombinator.com/item?id=49000864
Sonunda mevcut trafik taşması kontrol araçlarına geri dönüyoruz. Önerilen araçlar Slashdot etkisini, DDoS’u ve aşırı arama motoru crawling’ini engellemek için onlarca yıldır kullanılıyor; Cloudflare gibi şirketler de bu alanda zaten öncü.
Yapay zeka şirketleri gerçekten de maliyetleri toplumsallaştırıp kârı özelleştiriyor. The Numbers gibi siteler yapay zeka saldırısına dayanmanın maliyetini üstleniyor, ama yapay zeka şirketlerinden hiçbir karşılık almıyor.
Crawler kaliteli tüm veri için lisans ücreti ödeseydi sorun olmazdı; asıl mesele, açıklanmamış verilere erişmek için açık aramaya başlamaları.
Ücretsiz herkese açık bölüm, statik site oluşturucu ile yeniden yapılmaya ve bot algılayan bir CDN ile birleştirilmeye ideal bir site gibi görünüyor. Böylece makul bir maliyetle uzun süre işletilebilir gibi.
Mevcut ve yeni mimariyle siteyi ayakta tutmak için devreye alınan hafifletme ve ölçekleme stratejilerini de merak ediyorum.
2000’lerdeki özensiz PHP siteleri bile saniyede yaklaşık 200 isteği, statik siteler 1.000’in üzerini işleyebiliyordu; Node.js ise işbirlikçi iş parçacığı modeliyle saniyede 100 bin isteği öne sürüyordu. Buna karşılık günümüz siteleri ORM ve N+1 sorunları yüzünden yüzlerce-binlerce veritabanı sorgusu çalıştırıyor, yanıtlar 500 ms’nin üzerine çıkıyor ve 1.000 eşzamanlı kullanıcı bile yük oluşturuyor.
Dil ve veritabanından bağımsız Rus bebek önbelleği ile bağımlı verilerin doğru önbellek geçersizleştirmesi yaygınlaşamadı. Laravel’in touch event’lerini ve Redis sorgu önbelleğini bile denedim ama önbellek geçersizleştirme fiilen çözülmemiş bir sorun; bunu kendiniz uygulamaya çalışmak yerine en baştan paketler ve sharding gibi stratejileri düşünmek gerekiyor.
Web’in, BitTorrent gibi içeriği yakındaki eşlerden alan P2P içerik adreslemeli bir depolama alanı haline gelmesi gerekirdi; ancak HTTPS/SSL ve tarayıcı güvenlik modeli buna engel oldu. Güven ağı ya da sıfır bilgi kanıtları bile gerekebilir; bu yüzden bir süre daha sıradan insan doğrulama ekranlarına mahkûm kalacağız gibi görünüyor.
2015’te, o dönemde gerçek zamanlı sinema bileti satış verileri sağlayan tek hizmet olan Applaudience’ı başlattım; kalibrasyon sürecinde TheNumbers.com’daki rakamlarla karşılaştırma yapardık.
Şimdi başka bir iş yapıyorum ama kendi geliştirdiğim teknolojiler içinde hâlâ en sevdiğim bu; bir gün yeniden canlandırmak istiyorum.
Büyük yapay zeka şirketlerinin crawler’ları,
robots.txtiçinde sırasıylaClaudeBot,Claude-SearchBot,Claude-User,GPTBot,OAI-SearchBot,PerplexityBot,Google-Extended,Google-Extended-Factual,BingbotiçinDisallow: /belirtilerek engellenebilir.crawl-delaydestekleyip sunucunun durumuna göre ayarlamaya izin verse iyi olurdu, ancak desteklemiyor: https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec#syntaxEngellerseniz aramadan gelen trafiğin de daha da azalacağı görülüyor.
Sonuç olarak çoğu alt dizin URL’sine gereksiz bir istek daha ekleniyordu.
Eski Rusça radyo yayınlarını arşivleyen küçük bir site olan http://radar.lv’yi işletiyorum; eskiden ABD trafiği %5’ti, ancak son dönemde trafiğin %90’ı ABD’den geliyor.
Ayda 1 TB’a kadar kaldırabildiğim için şanslıyım ve crawl edilmesine karşı değilim; ancak gerçek ziyaretçilerin kararlılığı konusunda endişeliyim. Cloudflare’ın yakın zamanda çıkardığı ziyaret başına ödeme özelliğini açıp açmamayı düşünüyorum.
Kişisel blogumda statik oluşturucu kullanıyorum, ama bu arşivin yıllardır güvenlik yamaları kesilmiş eski bir Drupal kullanması gibi bir sorun da var.