Sorun: kimlik taklidi
Bir isteğin kendini "Googlebot" olarak tanıtması, gerçekten Googlebot olduğu anlamına gelmez. Tarayıcı kimliği (user-agent) kolayca değiştirilebilir.
Bu nedenle sunucu loglarındaki bot trafiğinin önemli bir bölümü sahte olabilir.
Kimler taklit eder?
- İçerik kazıma botları — engellenmemek için
- Rakip analiz araçları
- Zararlı tarayıcılar — güvenlik açığı arayan
- Spam botları
- Fiyat takip botları
Doğru doğrulama yöntemi
Tarayıcı kimliğine güvenmek yerine IP doğrulaması yapılır:
- İsteğin geldiği IP adresini alın
- Ters DNS sorgusu yapın — hangi alan adına ait?
- Sonucun beklenen alan adı olduğunu kontrol edin
- Doğrulama için ileri DNS sorgusu yapın — aynı IP'ye dönüyor mu?
Arama motorları ayrıca resmî IP aralıklarını yayınlar; bu listelerle eşleştirme de yapılabilir.
Neden önemli?
| Alan | Etki |
|---|---|
| Log analizi | Sahte botlar tarama verisini bozar |
| Sunucu yükü | Gereksiz kaynak tüketimi |
| Güvenlik | Zararlı taramaların tespiti |
| Bant genişliği | Maliyet artışı |
| İçerik koruması | Kazıma engelleme |
İlk satır özellikle kritiktir: Doğrulanmamış log verisiyle yapılan tarama bütçesi analizi yanlış sonuç verir.
Engelleme kararında dikkat
Bot engelleme kuralları yazarken en büyük risk, gerçek arama motoru botunu engellemektir. Bu, siteyi arama sonuçlarından silinmeye kadar götürebilir.
Bu nedenle:
- Kimlik bazlı engelleme yerine doğrulama kullanın
- Kural değişikliklerinden sonra Search Console'da tarama durumunu izleyin
- Geniş kapsamlı IP engellemelerinden kaçının
- Güvenlik duvarı kurallarını belgeleyin
Yapay zeka botları
Son dönemde yapay zeka sistemlerine ait tarayıcılar da yaygınlaştı. Bunların da taklit edildiği görülmektedir. Politika belirlerken (izin vermek veya engellemek) aynı doğrulama mantığı geçerlidir.
Pratik uygulama
Küçük sitelerde bu doğrulama genellikle gerekmez. Yüksek trafikli siteler, büyük kataloglar ve kazımaya açık içerik yayınlayan platformlar için ise sunucu düzeyinde otomatik doğrulama anlamlı bir yatırımdır.
Ne anlama gelir?
Bot doğrulama (bot verification), sitenize "Googlebot" olduğunu iddia ederek gelen bir botun gerçekten Google'a mı ait olduğunu, yoksa Googlebot kılığına girmiş sahte bir bot mu olduğunu doğrulama işlemidir. Bazı zararlı botlar, engellenmemek veya özel muamele görmek için kendilerini Googlebot gibi tanıtır. Bot doğrulama, gerçek arama motoru botlarına doğru davranırken sahtekârları tespit etmeyi sağlar.
Neden gerekir?
- Zararlı botlar Googlebot kimliğine bürünebilir (spoofing)
- Sahte botlar içerik çalabilir veya sunucuyu yorabilir
- Gerçek Googlebot'a yanlışlıkla engel koymamak gerekir
Nasıl doğrulanır?
Bir botun gerçekten Googlebot olup olmadığı, yalnızca kendini öyle tanıtmasına (user-agent) bakılarak anlaşılamaz; çünkü bu kolayca taklit edilebilir. Güvenilir doğrulama yöntemi, botun IP adresinin ters DNS sorgusuyla gerçekten Google'a ait bir alan adına çözümlenip çözümlenmediğini kontrol etmektir. Google, bunun nasıl yapılacağını resmi olarak belgeler ve doğrulanmış Googlebot IP aralıklarını yayınlar. Bu doğrulama, özellikle bot trafiğini yönetirken veya sunucu günlüklerini analiz ederken önemlidir: gerçek Googlebot'a tam erişim verilirken, onu taklit eden sahte botlar engellenebilir. Yanlışlıkla gerçek Googlebot'u engellemek siteyi taranamaz hale getireceğinden, bu ayrımı doğru yapmak kritiktir. Bot doğrulama, hem güvenlik hem SEO erişilebilirliği için gereklidir.
Gerçek örnek
Bir sitenin sunucusu, "Googlebot" olduğunu iddia eden yoğun bir trafikle yoruluyordu. Bot doğrulama (ters DNS) yapıldığında, bu trafiğin büyük kısmının Google'a ait olmayan, Googlebot kılığındaki sahte botlar olduğu görüldü. Gerçek Googlebot'a dokunmadan bu sahte botlar engellendiğinde sunucu rahatladı.
Özet
Bot doğrulama, Googlebot olduğunu iddia eden bir botun gerçekten Google'a ait olup olmadığını (genellikle ters DNS ile) doğrulamaktır. Sahte botlar Googlebot'u taklit edebilir; doğrulama, gerçek bota erişim verirken sahtekârları engellemeyi sağlar. Güvenlik ve SEO erişilebilirliği için gereklidir.