Générateur et testeur de robots.txt

Deux choses sur une page : assembler le fichier à partir de règles, et tester celui que vous avez déjà. La réponse ne dit pas seulement « autorisé » ou « bloqué », mais quelle ligne a décidé.

Modèle

Google ignore Crawl-delay ; Yandex et Bing le lisent encore.

Comment faire

  1. Choisissez un modèle ou listez les chemins à fermer, un par ligne.
  2. Ajoutez des exceptions sous Allow et l’adresse de votre sitemap.
  3. Copiez le résultat ou téléchargez-le et placez-le à la racine du site.
  4. Passez à Tester, collez votre fichier et vérifiez une adresse pour un robot précis.

Bon à savoir

C’est la règle la plus longue qui gagne, pas la première

Google comme Yandex choisissent la règle d’après la longueur du chemin correspondant, non d’après l’ordre dans le fichier. C’est pourquoi le couple habituel « Disallow: /wp-admin/ » et « Allow: /wp-admin/admin-ajax.php » fonctionne : le second chemin est plus long, il l’emporte donc pour ce fichier-là tandis que le reste du dossier demeure fermé. Un testeur qui lirait le fichier de haut en bas donnerait la réponse inverse.

Une règle placée avant le premier User-agent n’appartient à personne

Un Disallow écrit avant toute ligne User-agent est ignoré par tous les robots : le fichier se lit par groupes, et une règle hors groupe n’a pas de propriétaire. Elle a l’air parfaitement correcte et ne ferme rien : c’est l’erreur la plus coûteuse de robots.txt. Le testeur la signale à part, avec le numéro de ligne.

Questions fréquentes

robots.txt retire-t-il une page de la recherche ?

Non : il arrête seulement l’exploration. Une adresse fermée peut encore apparaître dans les résultats, sans description, si d’autres sites y renvoient. Pour la sortir de l’index, laissez-la ouverte au robot et posez-y une balise meta noindex : le robot doit charger la page pour voir cette balise.

Où doit se trouver le fichier ?

Uniquement à la racine du domaine : https://example.com/robots.txt. Un fichier dans un sous-dossier n’est pas lu, et un sous-domaine a besoin du sien : pour shop.example.com, celui d’example.com ne s’applique pas.

Comment bloquer les robots d’IA ?

Ajoutez un groupe par robot : GPTBot, ClaudeBot, PerplexityBot et CCBot figurent dans la liste proposée ici. Ils respectent robots.txt, mais l’interdiction se fait par nom : un groupe générique ne les couvre pas s’ils ont aussi leur propre groupe dans le fichier.

Faut-il régler Crawl-delay ?

Google l’ignore totalement ; Yandex et Bing le lisent encore. Ne l’utilisez que si le serveur souffre vraiment de la charge d’exploration : sinon il ne fait que retarder la découverte de vos nouvelles pages.

Outils similaires