1 puan yazan GN⁺ 3 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Site kesintisine yol açacak kadar istek gönderen Googlebot vakalarının önemli bir bölümü Google’dan değil, Googlebot taklidi yapan harici botlardan kaynaklanır
  • HTTP User-Agent istekte bulunan tarafından keyfi olarak belirlenebilir; bu yüzden loglardaki Googlebot/2.1 dizesi tek başına gerçek Googlebot olduğunu garanti etmez
  • Taklitçi botlar engellemeleri aşmak için Googlebot adını kullanır; bu, birden fazla barındırma sağlayıcısının sunucularını kullanan tek bir büyük ölçekli kötü amaçlı crawler kampanyası da olabilir
  • Gerçek Googlebot olup olmadığı host komutuyla veya Google’ın yayımladığı IP aralıklarıyla doğrulanmalıdır; kayıt sahibi Google LLC görünen IP’ler de Google Cloud adresi olabileceğinden ek doğrulama gerekir
  • Tüm Googlebot trafiğinin yarıdan fazlasının sahte olduğuna dair veri yok; ancak hizmeti aksatan Googlebot trafiğinin çoğunlukla taklitçi botlardan kaynaklandığı görülüyor

Googlebot trafiği hakkındaki yanlış anlamalar

  • Google arama crawler’ının aşırı trafikle sitelerde kesintiye yol açtığı veya DDoS gibi davrandığı yönünde operatör şikâyetleri var
  • Ancak bu yıkıcı trafik Google’dan değil, başka aktörlerin Googlebot adını kötüye kullanarak gönderdiği taklit istekler olabilir
  • Sunucu loglarında Googlebot dizesini görmek tek başına Google’ı trafiğin kaynağı olarak kabul etmek için yeterli değildir

User-Agent kimlik kanıtı değildir

  • Googlebot gibi görünen isteklerde genellikle aşağıdaki gibi bir değer bulunur
  • nginx loglarında da aynı dize kaydedilebilir; ancak User-Agent başlığı istekte bulunanın istediği değerle serbestçe ayarlanabilir
  • User-Agent doğrulanmış bir kimlik bilgisi değil, gönüllü bir kendini tanıtma ifadesidir; bu yüzden herkes Googlebot olduğunu iddia edebilir

Taklitçi botların kaynağı ve ölçeği

  • Taklit eden tarafın, mevcut bot engellemelerini aşmak için Googlebot User-Agent’ını kullandığı düşünülüyor
  • Örnek logdaki IP’nin Google’a değil, barındırma sağlayıcısı Virtual Machine Solutions LLC tarafından sağlanan bir sunucuya ait olduğu doğrulandı
  • Googlebot taklidi uzun süredir yaygın kullanılan bir yöntemdir ve son dönemde ölçeğinin büyüdüğü gözlemleniyor
  • Chris Siebenmann, eski bir yöntemin birden fazla yerde aynı anda popülerleşmesinden ziyade, birçok barındırma sağlayıcısında çok sayıda sunucu edinmiş tek bir kötü amaçlı crawler’ın büyük ölçekli kampanyası olabileceğini öne sürüyor

Gerçek Googlebot nasıl doğrulanır

  • Google’ın Googlebot doğrulama belgesine göre birkaç kez host komutu çalıştırılabilir veya Google’ın yayımladığı IP aralıklarıyla karşılaştırma yapılabilir
  • Büyük crawler’ların çoğu IP listelerini yayımlar, ancak belirli biçimleri ve işletim yöntemleri birbirinden farklıdır
  • JAFAR, crawler IP listelerini standartlaştırmaya yönelik bir öneridir ve hâlâ standartlaştırma süreci devam etmektedir
  • IP kayıt sahibi Google LLC olarak görünse bile bu, Google Cloud barındırma adresi olabilir; ayrı doğrulama gerekir
    • Google Cloud üzerinden yakın tarihli taklit vakaları doğrulanamadı
  • Doğrulama sonucunda gerçek Googlebot’un aşırı tarama yaptığı ortaya çıkarsa Google’ın aşırı taramaya müdahale belgesi izlenmelidir

Güvenilir bot kimlik doğrulaması

  • Basitçe bir alan daha eklemek, kötü niyetli aktörlerin o değeri dürüstçe ayarlaması için bir neden oluşturmaz
  • RFC 3514 içindeki sözde evil bit, kötü niyetli aktörlerin bu tür standartlara uymadığını hicveder
  • Web Bot Auth HTTP Signatures, ayrı bir alandan daha karmaşıktır; ancak kriptografik imzalar yoluyla güvenilir bir User-Agent uygulamaya yönelik bir yaklaşımdır

“Çoğu” ifadesinin sınırı

  • Tüm Googlebot trafiği içinde sahte olanların gerçekten yarıdan fazla olduğunu kanıtlayan veri yok
  • Ancak siteleri ciddi biçimde aksatan Googlebot trafiği vakalarının çoğu sahte Googlebot kaynaklı görünüyor
  • Gerçek Googlebot deneyimlere göre çok kararlı çalışırken, taklitçi botlar site kesinti yaşayana kadar istek gönderebilir

1 yorum

 
GN⁺ 3 시간 전
Lobste.rs yorumları
  • Bot kullanıcıları için karşılıklı TLS (mTLS) uygun görünüyor. Bot operatörlerinin geçerli bir sertifika alması zor değil; site operatörleri de alan adına göre bot istemcilerine izin verebilir
    • Yazıda açıklandığı gibi, meşru tarayıcıların çoğu tarayıcı alt ağlarını yayımlıyor. İstek imzalamayı standartlaştırmaya yönelik girişimler de oldu, ancak bildiğim kadarıyla yaygın biçimde benimsenmedi
  • googlebot olduğunu iddia eden tüm trafiği engellerseniz sorun çözülür