Robots.txt dosyaları ile ilgili bilgi edinme. robots.txt dosyası, arama motoru tarayıcılarının sitenizde erişmesini istemediğiniz yerleri gösteren ve sitenizin kök dizininde bulunan bir dosyadır. Dosya, ufak bir komut setine sahip bir protokol olan Robotları Engelleme Standardı’nı kullanır.
Robots.txt sitenin ana dizininde bulunan ismi değişmeyen, Google Botları için kılavuz bir dosyadır. Yani Google Botları sitenizi ziyaret ettiğinde, dosyanız varsa ilk Robots.txt dosyasına girecektir, yoksa işiniz zor, Robots.txt dosya içersinde bazı kodlar görecektir ve bu kodlar doğrultusunda nereleri indexleyeceğini, nerelere girmeyeceğini anlayacaktır. Sonuç olarak Robots.txt Google botları için olmazsa olmazlardandır. Şimdi biz de Robots.txt yapımını birlikte öğrenelim.
Yeni bir metin belgesi açalım ismini Robots.txt yapalım. Robots.txt dosyamız içersinde iki farklı parametremiz olacak. Bunlar ve anlamları şu şekildedir:
User-agent: Google Botu’nun adı gelecek
Disallow: Botun izinlerini gireceğimiz komutlar yer alacak
- Örnek 1:
- User-agent: *
- Allow: /
Â
- Örnek 2:
- User-agent: *
- Disallow: /
Yani bu Robots.txt kod tümünden de anlayacağımız şey, tüm Google Botları’nca sitemizin hiçbir dosyası indexlenmeyecek, taranmayacak.
- Örnek 2:
- User-agent: *
- Disallow: /cgi-bin/
- Disallow: /images/
- Disallow: /tmp/
- Disallow: /private/
- Örnek 3:
- User-agent: DeepCrawl
- Disallow: /private/
- Örnek 4:
- User-agent: *
- Disallow: /directory/dosya.html
- Örnek 5:
- User-agent: *
- Allow: /dosya1/site.html
- Disallow: /dosya1/
Kod:
User-agent: Googlebot
Disallow: /wp-content/
Disallow: /trackback/
Disallow: /wp-admin/
Disallow: /archives/
Disallow: /index.php
Disallow: /*.php$
Disallow: /*.js$
Disallow: /*.css$
Disallow: */feed/
Disallow: */trackback/
User-agent: Googlebot-Image
Disallow: /wp-includes/
User-agent: ia_archiver
Disallow: /
User-agent: duggmirror
Disallow: /


