Generator dan penguji robots.txt
Dua hal dalam satu halaman: menyusun berkas dari aturan, dan menguji berkas yang sudah Anda punya. Jawabannya tidak hanya menyebut «boleh» atau «diblokir», tetapi juga baris mana yang memutuskannya.
Templat
Google mengabaikan Crawl-delay; Yandex dan Bing masih membacanya.
Temuan
- Gratis
- File tidak pernah meninggalkan perangkat Anda
- Tanpa pendaftaran
- Tanpa batas file
Cara pakai
- Pilih templat atau tuliskan jalur yang mau ditutup, satu per baris.
- Tambahkan pengecualian di bawah Allow beserta alamat peta situs Anda.
- Salin hasilnya atau unduh, lalu taruh di akar situs.
- Beralih ke Uji, tempel berkas Anda, dan periksa alamat tertentu untuk perayap tertentu.
Perlu diketahui
Aturan terpanjang yang menang, bukan yang pertama
Google maupun Yandex memilih aturan berdasarkan panjang jalur yang cocok, bukan urutannya di dalam berkas. Itulah sebabnya pasangan yang lazim, «Disallow: /wp-admin/» ditambah «Allow: /wp-admin/admin-ajax.php», bisa bekerja: jalur kedua lebih panjang, jadi ia menang untuk satu berkas itu sementara sisa foldernya tetap tertutup. Penguji yang membaca berkas dari atas ke bawah justru akan memberi jawaban sebaliknya.
Aturan di atas User-agent pertama tidak bertuan
Disallow yang ditulis sebelum baris User-agent mana pun diabaikan semua perayap: berkas ini dibaca per kelompok, dan aturan di luar kelompok tidak punya pemilik. Tampilannya terlihat benar tetapi tidak menutup apa pun, dan karena itulah ini kesalahan paling mahal dalam robots.txt. Penguji melaporkannya secara terpisah, lengkap dengan nomor barisnya.
Sumber
Pertanyaan umum
Apakah robots.txt menghapus halaman dari hasil pencarian?
Tidak, ia hanya menghentikan perayapan. Alamat yang ditutup masih bisa muncul di hasil pencarian tanpa deskripsi kalau situs lain menautkannya. Untuk menahan halaman dari indeks, biarkan halaman itu terbuka bagi perayap dan pasang tag meta noindex padanya: robot harus mengambil halamannya dulu supaya bisa melihat tag itu.
Berkasnya harus ditaruh di mana?
Hanya di akar domain: https://example.com/robots.txt. Berkas di dalam subfolder sama sekali tidak dibaca, dan setiap subdomain butuh berkasnya sendiri: untuk shop.example.com, berkas di example.com tidak berlaku.
Bagaimana cara memblokir perayap AI?
Tambahkan satu kelompok untuk tiap bot: GPTBot, ClaudeBot, PerplexityBot, dan CCBot ada dalam daftar perayap di sini. Mereka mematuhi robots.txt, tetapi larangannya berlaku per nama: kelompok dengan karakter pengganti tidak mencakup mereka kalau di berkas itu mereka juga punya kelompok sendiri.
Perlukah menyetel Crawl-delay?
Google mengabaikannya sepenuhnya; Yandex dan Bing masih membacanya. Setel hanya kalau server memang kepayahan menanggung beban perayapan, sebab selain itu ia cuma memperlambat penemuan halaman baru Anda.
Alat terkait
- Generator Sitemap XML Tempel daftar alamat Anda, entah dari lembar kerja, dari konsol, dari mana pun asalnya, lalu da…
- Generator Schema Markup Pilih tipenya, isi yang Anda tahu, lalu salin tag script yang siap dipasang di bagian head hala…
- Pembuat tautan UTM Isi kolomnya dan tautan tersusun sendiri. Tempel tautan yang sudah membawa tag, lalu kolomnya t…
- Cek Header HTTP Masukkan sebuah alamat dan lihat persis apa yang dijawab server: kode status, semua header, dan…