Generator dan penguji robots.txt

Dua hal dalam satu halaman: menyusun berkas dari aturan, dan menguji berkas yang sudah Anda punya. Jawabannya tidak hanya menyebut «boleh» atau «diblokir», tetapi juga baris mana yang memutuskannya.

Templat

Google mengabaikan Crawl-delay; Yandex dan Bing masih membacanya.

Cara pakai

  1. Pilih templat atau tuliskan jalur yang mau ditutup, satu per baris.
  2. Tambahkan pengecualian di bawah Allow beserta alamat peta situs Anda.
  3. Salin hasilnya atau unduh, lalu taruh di akar situs.
  4. Beralih ke Uji, tempel berkas Anda, dan periksa alamat tertentu untuk perayap tertentu.

Perlu diketahui

Aturan terpanjang yang menang, bukan yang pertama

Google maupun Yandex memilih aturan berdasarkan panjang jalur yang cocok, bukan urutannya di dalam berkas. Itulah sebabnya pasangan yang lazim, «Disallow: /wp-admin/» ditambah «Allow: /wp-admin/admin-ajax.php», bisa bekerja: jalur kedua lebih panjang, jadi ia menang untuk satu berkas itu sementara sisa foldernya tetap tertutup. Penguji yang membaca berkas dari atas ke bawah justru akan memberi jawaban sebaliknya.

Aturan di atas User-agent pertama tidak bertuan

Disallow yang ditulis sebelum baris User-agent mana pun diabaikan semua perayap: berkas ini dibaca per kelompok, dan aturan di luar kelompok tidak punya pemilik. Tampilannya terlihat benar tetapi tidak menutup apa pun, dan karena itulah ini kesalahan paling mahal dalam robots.txt. Penguji melaporkannya secara terpisah, lengkap dengan nomor barisnya.

Sumber

Pertanyaan umum

Apakah robots.txt menghapus halaman dari hasil pencarian?

Tidak, ia hanya menghentikan perayapan. Alamat yang ditutup masih bisa muncul di hasil pencarian tanpa deskripsi kalau situs lain menautkannya. Untuk menahan halaman dari indeks, biarkan halaman itu terbuka bagi perayap dan pasang tag meta noindex padanya: robot harus mengambil halamannya dulu supaya bisa melihat tag itu.

Berkasnya harus ditaruh di mana?

Hanya di akar domain: https://example.com/robots.txt. Berkas di dalam subfolder sama sekali tidak dibaca, dan setiap subdomain butuh berkasnya sendiri: untuk shop.example.com, berkas di example.com tidak berlaku.

Bagaimana cara memblokir perayap AI?

Tambahkan satu kelompok untuk tiap bot: GPTBot, ClaudeBot, PerplexityBot, dan CCBot ada dalam daftar perayap di sini. Mereka mematuhi robots.txt, tetapi larangannya berlaku per nama: kelompok dengan karakter pengganti tidak mencakup mereka kalau di berkas itu mereka juga punya kelompok sendiri.

Perlukah menyetel Crawl-delay?

Google mengabaikannya sepenuhnya; Yandex dan Bing masih membacanya. Setel hanya kalau server memang kepayahan menanggung beban perayapan, sebab selain itu ia cuma memperlambat penemuan halaman baru Anda.

Alat terkait