Yapay Zeka Botlarını robots.txt ile Yönetmek: GPTBot, ClaudeBot, PerplexityBot

Eğitim botu ile arama botu arasındaki farkı, hangisine izin verip hangisini kapatmanız gerektiğini ve robots.txt kurallarını örneklerle açıklıyoruz.

7 dk okuma Protan Ekibi
İçindekiler 8 başlık
  1. Kritik ayrım: Eğitim botu mu, arama botu mu?
  2. Başlıca kullanıcı aracıları
  3. Karar çerçevesi: Kime izin vermeli?
  4. Örnek robots.txt kurgusu
  5. robots.txt her botu durdurmaz
  6. llms.txt ile birlikte düşünün
  7. Kontrol listesi
  8. Kaynaklar

Yapay zeka görünürlüğü konuşulurken en çok atlanan konu, bu sistemlerin sitenize erişip erişemediğidir. Bir asistan sizi kaynak gösteremiyorsa bunun sebebi çoğu zaman içeriğinizin zayıf olması değil, tarayıcısının kapıda durdurulmuş olmasıdır. Bu yazıda yapay zeka kullanıcı aracılarını, aralarındaki kritik ayrımı ve robots.txt kararlarını ele alıyoruz.

Kritik ayrım: Eğitim botu mu, arama botu mu?

Yapay zeka şirketlerinin tarayıcıları tek tip değildir. Kabaca iki gruba ayrılır:

  • Eğitim tarayıcıları: İçeriği modelin eğitim verisine katmak için toplar. Sizi doğrudan bir cevapta kaynak göstermez.
  • Arama ve getirme tarayıcıları: Kullanıcı bir soru sorduğunda güncel içeriği çeker ve cevabın altında kaynak olarak gösterir.

Bu ayrım önemlidir, çünkü ticari olarak istediğiniz şey genellikle ikincisidir. İçeriğinizin model eğitiminde kullanılmasını istemeseniz bile, arama tarayıcılarına izin vererek yapay zeka cevaplarında kaynak gösterilebilirsiniz.

Başlıca kullanıcı aracıları

Yaygın olarak karşılaşacağınız kullanıcı aracıları şunlardır:

  • GPTBot: OpenAI'ın eğitim amaçlı tarayıcısı
  • OAI-SearchBot: OpenAI'ın arama amaçlı tarayıcısı; ChatGPT arama sonuçlarında kaynak gösterimi bununla ilgilidir
  • ChatGPT-User: Kullanıcının isteği üzerine anlık sayfa getiren aracı
  • ClaudeBot: Anthropic'in eğitim amaçlı tarayıcısı
  • Claude-SearchBot ve Claude-User: Anthropic'in arama ve kullanıcı isteğiyle getirme aracıları
  • PerplexityBot: Perplexity'nin dizinleme tarayıcısı
  • Google-Extended: Google'ın içeriğinizi üretken model eğitiminde kullanıp kullanamayacağını belirleyen kontrol
  • CCBot: Common Crawl tarayıcısı; birçok model dolaylı olarak bu arşivi kullanır

Önemli bir nokta: Google-Extended'ı kapatmak arama sonuçlarındaki veya AI Overviews alanındaki görünürlüğünüzü doğrudan engellemez, çünkü bu yüzeyler Googlebot indeksini kullanır. Yani Googlebot'u kapatmak ile Google-Extended'ı kapatmak farklı sonuçlar doğurur.

Karar çerçevesi: Kime izin vermeli?

Kararınız iş modelinize bağlıdır. Üç tipik durum:

  • Görünürlük odaklı işletmeler (ajans, B2B hizmet, yerel işletme): Hem eğitim hem arama tarayıcılarına izin vermek genellikle doğrudur. Amaç bilinirlik ve kaynak gösterilmektir.
  • İçeriği ürün olan yayıncılar: Arama tarayıcılarına izin verip eğitim tarayıcılarını kapatmak dengeli bir orta yoldur. Trafik ve atıf korunur, arşiv eğitim verisine gitmez.
  • Özel veri veya lisanslı içerik barındıranlar: Her ikisini de kapatmak ve erişimi sunucu düzeyinde denetlemek gerekebilir.

Örnek robots.txt kurgusu

Görünürlük odaklı bir kurumsal site için tipik yapı şöyledir. Her grubu ayrı bir blok olarak yazın, çünkü robots.txt'te bir tarayıcı yalnızca kendisiyle en spesifik eşleşen bloğu dikkate alır:

  • Genel bir izin bloğu ile tüm tarayıcılara sitenin kamuya açık bölümlerini açın
  • Yönetim paneli, sepet, arama sonucu ve parametreli URL'leri her tarayıcıya kapatın
  • Eğitim tarayıcılarını ayrı bloklarda ele alın ve kararınızı bilinçli verin
  • Arama tarayıcılarını (OAI-SearchBot, Claude-SearchBot, PerplexityBot) açık bırakın
  • Sitemap satırını mutlaka ekleyin

Kuralları yazdıktan sonra sunucu loglarınızdan gerçekten uygulandığını doğrulayın. Log analizini GEO metrikleri yazımızda anlatıyoruz.

robots.txt her botu durdurmaz

robots.txt bir talimat dosyasıdır, bir güvenlik önlemi değil. Kurallara uymayan tarayıcılar mevcuttur. Erişimi gerçekten kısıtlamanız gerekiyorsa çözüm sunucu veya CDN katmanındadır: Kullanıcı aracısı ve IP doğrulamasına dayalı kurallar, hız sınırlama ve bot yönetimi servisleri. robots.txt'i uyumlu botlar için niyet beyanı, sunucu katmanını ise uygulama mekanizması olarak düşünün.

llms.txt ile birlikte düşünün

robots.txt neye erişilebileceğini söyler; llms.txt ise sitenizin ne anlattığını özetleyen, dil modelleri için hazırlanmış bir dizin sunar. İkisi birbirinin alternatifi değil tamamlayıcısıdır. llms.txt tarafını ayrı bir yazıda ele aldık.

Kontrol listesi

  • robots.txt dosyanızda hangi yapay zeka aracılarının adı geçiyor, listeleyin
  • Eğitim ve arama tarayıcılarını ayrı ayrı değerlendirin
  • Kararınızı iş modelinize göre yazılı bir politikaya bağlayın
  • Sunucu loglarından kuralların uygulandığını doğrulayın
  • Yeni kullanıcı aracıları çıktığında listeyi altı ayda bir gözden geçirin

Bu kararları ve teknik uygulamayı birlikte kurgulamak isterseniz GEO danışmanlığı hizmetimiz robots.txt, llms.txt ve sunucu katmanını tek bir politika altında toplar.

Kaynaklar

Paylaş:

İlgili hizmetlerimiz

Bu konuda profesyonel desteğe mi ihtiyacınız var? Ekibimizle konuşalım.

Organik büyüme zamanı

Google'da görünür olun, organik trafiğinizi büyütün.

Teknik SEO denetimi ve önceliklendirilmiş içerik planıyla sıralamalarınızı yukarı taşıyalım. İlk görüşme ücretsiz.

Teklif Al Bizi Arayın

Size özel teklif alın

1/2

24 saat içinde size özel fiyatı iletelim.

Size nasıl yardımcı olalım? * - birden fazla seçebilirsiniz
Yükleniyor...