- Site kesintisine yol açacak kadar istek gönderen Googlebot vakalarının önemli bir bölümü Google’dan değil, Googlebot taklidi yapan harici botlardan kaynaklanır
- HTTP
User-Agentistekte bulunan tarafından keyfi olarak belirlenebilir; bu yüzden loglardakiGooglebot/2.1dizesi tek başına gerçek Googlebot olduğunu garanti etmez - Taklitçi botlar engellemeleri aşmak için Googlebot adını kullanır; bu, birden fazla barındırma sağlayıcısının sunucularını kullanan tek bir büyük ölçekli kötü amaçlı crawler kampanyası da olabilir
- Gerçek Googlebot olup olmadığı
hostkomutuyla veya Google’ın yayımladığı IP aralıklarıyla doğrulanmalıdır; kayıt sahibi Google LLC görünen IP’ler de Google Cloud adresi olabileceğinden ek doğrulama gerekir - Tüm Googlebot trafiğinin yarıdan fazlasının sahte olduğuna dair veri yok; ancak hizmeti aksatan Googlebot trafiğinin çoğunlukla taklitçi botlardan kaynaklandığı görülüyor
Googlebot trafiği hakkındaki yanlış anlamalar
- Google arama crawler’ının aşırı trafikle sitelerde kesintiye yol açtığı veya DDoS gibi davrandığı yönünde operatör şikâyetleri var
- Ancak bu yıkıcı trafik Google’dan değil, başka aktörlerin Googlebot adını kötüye kullanarak gönderdiği taklit istekler olabilir
- Sunucu loglarında Googlebot dizesini görmek tek başına Google’ı trafiğin kaynağı olarak kabul etmek için yeterli değildir
User-Agent kimlik kanıtı değildir
- Googlebot gibi görünen isteklerde genellikle aşağıdaki gibi bir değer bulunur
User-Agent: Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
- nginx loglarında da aynı dize kaydedilebilir; ancak User-Agent başlığı istekte bulunanın istediği değerle serbestçe ayarlanabilir
- User-Agent doğrulanmış bir kimlik bilgisi değil, gönüllü bir kendini tanıtma ifadesidir; bu yüzden herkes Googlebot olduğunu iddia edebilir
Taklitçi botların kaynağı ve ölçeği
- Taklit eden tarafın, mevcut bot engellemelerini aşmak için Googlebot User-Agent’ını kullandığı düşünülüyor
- Örnek logdaki IP’nin Google’a değil, barındırma sağlayıcısı Virtual Machine Solutions LLC tarafından sağlanan bir sunucuya ait olduğu doğrulandı
- Googlebot taklidi uzun süredir yaygın kullanılan bir yöntemdir ve son dönemde ölçeğinin büyüdüğü gözlemleniyor
- Chris Siebenmann, eski bir yöntemin birden fazla yerde aynı anda popülerleşmesinden ziyade, birçok barındırma sağlayıcısında çok sayıda sunucu edinmiş tek bir kötü amaçlı crawler’ın büyük ölçekli kampanyası olabileceğini öne sürüyor
Gerçek Googlebot nasıl doğrulanır
- Google’ın Googlebot doğrulama belgesine göre birkaç kez
hostkomutu çalıştırılabilir veya Google’ın yayımladığı IP aralıklarıyla karşılaştırma yapılabilir - Büyük crawler’ların çoğu IP listelerini yayımlar, ancak belirli biçimleri ve işletim yöntemleri birbirinden farklıdır
- JAFAR, crawler IP listelerini standartlaştırmaya yönelik bir öneridir ve hâlâ standartlaştırma süreci devam etmektedir
- IP kayıt sahibi Google LLC olarak görünse bile bu, Google Cloud barındırma adresi olabilir; ayrı doğrulama gerekir
- Google Cloud üzerinden yakın tarihli taklit vakaları doğrulanamadı
- Doğrulama sonucunda gerçek Googlebot’un aşırı tarama yaptığı ortaya çıkarsa Google’ın aşırı taramaya müdahale belgesi izlenmelidir
Güvenilir bot kimlik doğrulaması
- Basitçe bir alan daha eklemek, kötü niyetli aktörlerin o değeri dürüstçe ayarlaması için bir neden oluşturmaz
- RFC 3514 içindeki sözde
evil bit, kötü niyetli aktörlerin bu tür standartlara uymadığını hicveder - Web Bot Auth HTTP Signatures, ayrı bir alandan daha karmaşıktır; ancak kriptografik imzalar yoluyla güvenilir bir User-Agent uygulamaya yönelik bir yaklaşımdır
“Çoğu” ifadesinin sınırı
- Tüm Googlebot trafiği içinde sahte olanların gerçekten yarıdan fazla olduğunu kanıtlayan veri yok
- Ancak siteleri ciddi biçimde aksatan Googlebot trafiği vakalarının çoğu sahte Googlebot kaynaklı görünüyor
- Gerçek Googlebot deneyimlere göre çok kararlı çalışırken, taklitçi botlar site kesinti yaşayana kadar istek gönderebilir
1 yorum
Lobste.rs yorumları