HotForex Choose Your Pair
Home » , » Pengertian robot.txt Lengkap

Pengertian robot.txt Lengkap

Posted by JustinForex.com on Minggu, 27 Januari 2013

Analisa File Robots.txt Anda

Gunakan analisa Robots.txt kami untuk menganalisis file robots.txt Anda hari ini.

Google juga menawarkan alat serupa dalam Google Webmaster Central, dan menunjukkan kesalahan merangkak Google untuk situs Anda.

Contoh Robots.txt Format

Bolehkan pengindeksan dari segala sesuatu
Allow indexing of everything




User-agent: *
Disallow:
Larang pengindeksan segalanya
Disallow indexing of everything
User-agent: *
Disallow: /
Larang pengindeksan folder tertentu
Disawllow indexing of a psecific folder
User-agent: *
Disallow: /folder/
Larang Googlebot dari pengindeksan folder, kecuali untuk memungkinkan pengindeksan satu file dalam folder itu.
Disallow Googlebot from indexing of a folder, except for allowing the indexing of one file in that folder
User-agent: Googlebot
Disallow: /folder1/
Allow: /folder1/myfile.html

Latar Belakang Informasi tentang File Robots.txt

  •  File robots.txt menginformasikan spider mesin pencari bagaimana berinteraksi dengan mengindeks konten Anda.
    •  Oleh mesin pencarian default serakah. Mereka ingin indeks informasi berkualitas tinggi sebanyak yang mereka bisa, & akan berasumsi bahwa mereka dapat merangkak segalanya kecuali Anda memberitahu mereka jika.
    • Jika Anda menetapkan data untuk semua bot (*) dan data untuk bot tertentu (seperti Googlebot) maka perintah bot tertentu akan diikuti saat mesin yang mengabaikan perintah bot global / standar.
      • Jika Anda membuat perintah global yang Anda ingin berlaku untuk bot tertentu dan Anda memiliki aturan khusus lainnya untuk itu bot maka Anda perlu menempatkan orang perintah global dalam bagian untuk bot itu juga.
      • Bila Anda memblokir URL dari diindeks di Google melalui robots.txt, mereka masih mungkin menunjukkan halaman tersebut sebagai daftar URL hanya dalam hasil pencarian mereka. Sebuah solusi yang lebih baik untuk benar-benar memblokir indeks suatu halaman tertentu adalah dengan menggunakan robot noindex meta tag pada basis per halaman. Anda dapat memberitahu mereka untuk tidak halaman indeks, atau untuk tidak mengindeks halaman dan tidak mengikuti link keluar dengan memasukkan salah satu bit kode berikut di kepala HTML dari dokumen Anda yang Anda tidak ingin diindeks :
        • <meta name="robots" content="noindex"> <-- halaman tidak diindeks, tapi link dapat diikuti
        • <meta name="robots" content="noindex,nofollow"> <-- halaman tidak diindeks & link yang tidak diikuti
        • Harap dicatat bahwa jika Anda melakukan keduanya: memblokir mesin pencari dalam robots.txt dan melalui meta tag, maka perintah robots.txt adalah pendorong utama, karena mereka tidak mungkin merangkak halaman untuk melihat meta tag, sehingga URL mungkin masih muncul di hasil pencarian yang tercantum URL-satunya

      • Jika Anda tidak memiliki file robots.txt, log server Anda akan kembali 404 kesalahan setiap kali bot mencoba mengakses file robots.txt Anda. Anda dapat meng-upload sebuah file teks kosong bernama robots.txt di root situs Anda (misalnya: indonesiiaku.com / robots.txt) jika Anda ingin berhenti mendapatkan 404 kesalahan, tetapi tidak ingin menawarkan perintah khusus untuk bot.
      • Beberapa mesin pencari memungkinkan Anda untuk menentukan alamat dari sebuah Sitemap XML dalam file robots.txt Anda, tetapi jika situs Anda kecil & terstruktur dengan baik dengan struktur link bersih Anda tidak perlu membuat sitemap XML. Untuk situs yang lebih besar dengan beberapa divisi, situs yang menghasilkan sejumlah besar konten setiap hari, dan / atau situs dengan cepat berputar saham, XML Sitemaps dapat menjadi alat yang berguna untuk membantu untuk mendapatkan konten penting diindeks & memantau kinerja relatif kedalaman pengindeksan oleh pagetype.
  • Crawl Delay / Penundaan

    • Search engine memungkinkan Anda untuk mengatur prioritas merangkak.
      • Google tidak mendukung perintah penundaan merangkak langsung, tetapi Anda dapat menurunkan prioritas merangkak Anda di dalam Google Webmaster Central.
        • Google memiliki volume tertinggi pangsa pasar pencarian di sebagian besar pasar, dan memiliki salah satu prioritas merangkak paling efisien, sehingga Anda tidak perlu untuk mengubah prioritas merangkak Google.
      • Anda dapat mengatur Yahoo! Slurp penundaan merangkak dalam file robots.txt Anda. (Catatan: di sebagian besar pasar utama di luar Yahoo! Search Jepang didukung oleh Bing, sedangkan Google kekuatan pencarian di Yahoo! Jepang).
        • Robots.txt merangkak mereka kode penundaan terlihat seperti
          User-agent: Slurp
          Crawl-delay: 5

          where the 5 is in seconds.
      • Informasi Microsoft untuk Bing terletak here.
        • robots.txt merangkak mereka kode penundaan terlihat seperti
          User-agent: bingbot
          Crawl-delay: 10

          where the 10 is in seconds.

    Robots.txt Wildcard Matching

    Google dan Microsoft Bing memungkinkan penggunaan wildcard dalam file robots.txt.

    Untuk memblokir akses ke semua URL yang memuat tanda tanya (?), Anda dapat menggunakan entri berikut:
    User-agent: *
    Disallow: /*?
    Anda dapat menggunakan karakter $ untuk menentukan pencocokan akhir URL. Misalnya, untuk memblokir URL yang berakhir dengan sebuah asp, Anda dapat menggunakan entri berikut.:
    User-agent: Googlebot
    Disallow: /*.asp$
    Jika kurang lengkap informasi bisa klik Google dan Yahoo! Search.
    .

    URL Tips khusus

    Bagian dari membuat file robots.txt bersih dan efektif adalah memastikan bahwa situs struktur dan nama file yang dibuat berdasarkan strategi suara.
    • Hindari Tanggal di URL: Jika pada beberapa titik waktu Anda ingin menyaring arsip berbasis tanggal maka Anda tidak ingin tanggal di path file Anda dari halaman reguler Anda isi atau mudah untuk menyaring URL rutin Anda. Ada alasan lain untuk menghindari berbagai tanggal di URL juga.
    • Akhir URL Dengan Backslash : Jika Anda ingin memblokir nama file pendek dan tidak memiliki garis miring terbalik di ujung jika kemudian Anda secara tidak sengaja bisa berakhir memblokir halaman penting lainnya.
    • Pertimbangkan URL terkait jika Anda menggunakan wildcard Robots.txt
    • URL Rewriting dinamis: Yahoo! Search menawarkan URL dinamis menulis ulang, tapi karena kebanyakan mesin pencari lain tidak menggunakannya, Anda mungkin lebih baik menulis ulang URL Anda dalam file htaccess Anda daripada menciptakan tambahan penulisan ulang hanya untuk Yahoo! Search. Google menawarkan parameter penanganan pilihan & rel = kanonik, tetapi umumnya terbaik untuk memperbaiki URL publik dihadapi dengan cara yang membuat mereka sekonsisten.
    • Google menawarkan parameter penanganan pilihan & rel = kanonik, tetapi umumnya terbaik untuk memperbaiki URL publik dihadapi dengan cara yang membuat mereka sekonsisten mungkin, sehingga
      • jika Anda pernah bermigrasi antara platform Anda tidak memiliki link tersesat banyak menunjuk ke halaman yang tidak lagi ada
      • Anda tidak berakhir mengembangkan labirin kompleks Gotchas ketika Anda mengubah platform selama bertahun-tahun
    • Situs di seluruh pasar & bahasa: Search engine umumnya mencoba untuk memberikan hasil lokal dikenal dorongan peringkat, meskipun dalam beberapa kasus akan sulit untuk membangun link ke versi lokal dari situs. Google menawarkan hreflang untuk membantu mereka tahu mana URL yang setara di seluruh bahasa & pasar.

    Contoh Robot Aneh tapi nyata

    Google Membangkitkan Halaman Pencarian di Situs Anda?

    Google telah mulai memasukkan frasa pencarian ke dalam bentuk pencarian, yang mungkin buang PageRank & telah menyebabkan beberapa masalah konten duplikat. Jika Anda tidak memiliki banyak otoritas domain Anda mungkin ingin mempertimbangkan untuk memblokir Google mengindeks URL halaman pencarian Anda. Jika Anda tidak yakin URL halaman pencarian Anda, Anda dapat melakukan pencarian di situs Anda dan melihat apa URL muncul. Misalnya,
    ◦ URL pencarian default Wordpress biasanya? S =
     

      • Adding
        User-agent: *
        Disallow: /?s=
        ke file robots.txt Anda akan mencegah Google menghasilkan halaman tersebut
    •  Drupal kekuatan situs Book SEO, dan default kita Drupal URL pencarian /search/node/ 

    Isu Pembajakan? 

    Selama bertahun-tahun beberapa orang telah mencoba untuk membajak situs lain menggunakan teknik jahat dengan web proxy. Google, Yahoo! Search, Microsoft Live Search, dan Ask semua memungkinkan pemilik situs untuk otentikasi bot mereka.
    • Sementara saya percaya Google memiliki proxy tetap pembajakan sekarang, tip yang baik untuk meminimalkan risiko pembajakan adalah dengan menggunakan link absolut(like <a href="http://www.indonesiiaku.com/about.shtml">) bukan relatif Link(<a href="about.shtml">) .
    • If both the WWW and non WWW versions of your site are getting indexed you should 301 redirect the less authoritative version to the more important version.
      • Versi yang harus diarahkan adalah salah satu yang tidak peringkat serta untuk permintaan pencarian yang paling dan memiliki inbound link sedikit.
      • Back up lama. Anda htaccess sebelum perubahan itu!!

    Ingin Biarkan Indexing dari File Folder Tertentu yang Diblokir Menggunakan Pencocokan Pola?

    Bukankah kita yang rumit!

    Awalnya robots.txt hanya didukung arahan melarang, tetapi beberapa mesin pencari juga mendukung direktif memungkinkan. Yang memungkinkan direktif kurang didokumentasikan dan dapat ditangani secara berbeda oleh mesin pencari yang berbeda. Semetrical berbagi informasi tentang bagaimana Google menangani direktif memungkinkan. Penelitian mereka menunjukkan:


    Jumlah karakter yang Anda gunakan dalam jalur direktif sangat penting dalam evaluasi dari suatu Izinkan terhadap Larang a. Aturan untuk memerintah mereka semua adalah sebagai berikut:

    Pencocokan Sebuah Izinkan direktif mengalahkan Larang cocok hanya jika mengandung jumlah lebih atau sama karakter di jalan

     
Keyword: Robots.txt Tutorial , Pengertian Robot.txt , Penjelasan robot.txt , pengaturan robot.txt , cara pasang robot.txt di blog , Cara setting robot.txt







    0 komentar:

    Posting Komentar

    JustForex
    JustinChangerKami hanya melakukan penjualan USD dengan harga yang sangat Murah di bawah harga pasar.
    E Currency
    Sell USD
    Stock
    Fasapay
    Disc. Sabtu
    Rp13.500,-$500
    Rp- $0
    Zero Spread Account
    Disc. Jumat
    Rp13.000,- $0
    Rp- $0
    Zero Spread Account
    Disc. Jumat
    Rp13.000,- $0
    Rp- $0
    Zero Spread Account
    Disc. Jumat
    Rp13.000,- $0
    Rp- $0

    089-999-30330
    Mandiri: 135-00104-44949
    BCA : 011-04692-17
    BNI : 041-50229-90
    BRI : 001-00102-5597-502
    All a/n Bpk Eko Wahyudi
    Panduan Transakasi DISINI.
    Last Update : 06.00wib /9 Mei 2016