Hoşgeldin Misafir

Robots.txt Nedir? & Nasıl Yapılır?

jrCoder

25 Eyl 2017
425 Mesaj

Aktiflik

Seviye

Deneyim

TIM / GÖREV:
1Gy7Vj.gif

Robots.txt dosyaları ile ilgili bilgi edinme. robots.txt dosyası, arama motoru tarayıcılarının sitenizde erişmesini istemediğiniz yerleri gösteren ve sitenizin kök dizininde bulunan bir dosyadır. Dosya, ufak bir komut setine sahip bir protokol olan Robotları Engelleme Standardı’nı kullanır.

Robots.txt sitenin ana dizininde bulunan ismi değişmeyen, Google Botları için kılavuz bir dosyadır. Yani Google Botları sitenizi ziyaret ettiğinde, dosyanız varsa ilk Robots.txt dosyasına girecektir, yoksa işiniz zor, Robots.txt dosya içersinde bazı kodlar görecektir ve bu kodlar doğrultusunda nereleri indexleyeceğini, nerelere girmeyeceğini anlayacaktır. Sonuç olarak Robots.txt Google botları için olmazsa olmazlardandır. ޞimdi biz de Robots.txt yapımını birlikte öğrenelim.

Yeni bir metin belgesi açalım ismini Robots.txt yapalım. Robots.txt dosyamız içersinde iki farklı parametremiz olacak. Bunlar ve anlamları şu şekildedir:

User-agent: Google Botu’nun adı gelecek
Disallow: Botun izinlerini gireceğimiz komutlar yer alacak

  • Örnek 1:
  • User-agent: *
  • Allow: /
Kodlarımızı yorumlayalım. 1. satırdaki kodumuz da bakınız Google Botları’nın isimleri gelecekti ama “*” işaretini gördünüz. Bunun anlamı, siteniz bütün Google Botları’nca istisnasız indexlenmesine izin vermişsiniz demektir.

 
  • Örnek 2:
  • User-agent: *
  • Disallow: /
Gördüğünüz gibi birinci satırdaki user-agent kodumuzun anlamı bütün Google Botları’na sitenizi indexlemesi için izin verilmesiydi. Fakat ikinci satırda “/” böyle bir karakter görüyorsunuz. Bu karakterin anlamı site üzerinde bütün dosyaların taranmaması isteniyor.

Yani bu Robots.txt kod tümünden de anlayacağımız şey, tüm Google Botları’nca sitemizin hiçbir dosyası indexlenmeyecek, taranmayacak.
  • Örnek 2:
  • User-agent: *
  • Disallow: /cgi-bin/
  • Disallow: /images/
  • Disallow: /tmp/
  • Disallow: /private/
Bütün Google botları, bu 4 dosyayı indexlemeyecektir.

  • Örnek 3:
  • User-agent: DeepCrawl
  • Disallow: /private/
DeepCrawl, bir Google botudur. Görevi ise; sitenizi uzun Aralıklarla ziyaret edip, indexlenmesi için gerekli bilgileri toplar. Bu kodların anlamı ise, ismi verilen botun ilgili private klasörünü indexlememeli.

  • Örnek 4:
  • User-agent: *
  • Disallow: /directory/dosya.html
Tüm botlar, ilgili dosyayı indexlemeyecektir. Ama directory dizinindeki dosya.html hariç diğer bütün dosyaları tarar ve indexler.

  • Örnek 5:
  • User-agent: *
  • Allow: /dosya1/site.html
  • Disallow: /dosya1/
Bu kodların anlamı ise, bütün Google Botları dosya dizininde bulunan site.html dosyası hariç diğer bütün dosyaları taramaz ve indexlemeyecektir.

Kod:
User-agent: Googlebot

Disallow: /wp-content/
Disallow: /trackback/
Disallow: /wp-admin/
Disallow: /archives/
Disallow: /index.php
Disallow: /*.php$
Disallow: /*.js$
Disallow: /*.css$
Disallow: */feed/
Disallow: */trackback/

User-agent: Googlebot-Image
Disallow: /wp-includes/

User-agent: ia_archiver
Disallow: /

User-agent: duggmirror
Disallow: /