Générateur et testeur de robots.txt
Deux choses sur une page : assembler le fichier à partir de règles, et tester celui que vous avez déjà. La réponse ne dit pas seulement « autorisé » ou « bloqué », mais quelle ligne a décidé.
Modèle
Google ignore Crawl-delay ; Yandex et Bing le lisent encore.
Remarques
- Gratuit
- Vos fichiers ne quittent pas votre appareil
- Sans inscription
- Sans limite de fichiers
Comment faire
- Choisissez un modèle ou listez les chemins à fermer, un par ligne.
- Ajoutez des exceptions sous Allow et l’adresse de votre sitemap.
- Copiez le résultat ou téléchargez-le et placez-le à la racine du site.
- Passez à Tester, collez votre fichier et vérifiez une adresse pour un robot précis.
Bon à savoir
C’est la règle la plus longue qui gagne, pas la première
Google comme Yandex choisissent la règle d’après la longueur du chemin correspondant, non d’après l’ordre dans le fichier. C’est pourquoi le couple habituel « Disallow: /wp-admin/ » et « Allow: /wp-admin/admin-ajax.php » fonctionne : le second chemin est plus long, il l’emporte donc pour ce fichier-là tandis que le reste du dossier demeure fermé. Un testeur qui lirait le fichier de haut en bas donnerait la réponse inverse.
Une règle placée avant le premier User-agent n’appartient à personne
Un Disallow écrit avant toute ligne User-agent est ignoré par tous les robots : le fichier se lit par groupes, et une règle hors groupe n’a pas de propriétaire. Elle a l’air parfaitement correcte et ne ferme rien : c’est l’erreur la plus coûteuse de robots.txt. Le testeur la signale à part, avec le numéro de ligne.
Questions fréquentes
robots.txt retire-t-il une page de la recherche ?
Non : il arrête seulement l’exploration. Une adresse fermée peut encore apparaître dans les résultats, sans description, si d’autres sites y renvoient. Pour la sortir de l’index, laissez-la ouverte au robot et posez-y une balise meta noindex : le robot doit charger la page pour voir cette balise.
Où doit se trouver le fichier ?
Uniquement à la racine du domaine : https://example.com/robots.txt. Un fichier dans un sous-dossier n’est pas lu, et un sous-domaine a besoin du sien : pour shop.example.com, celui d’example.com ne s’applique pas.
Comment bloquer les robots d’IA ?
Ajoutez un groupe par robot : GPTBot, ClaudeBot, PerplexityBot et CCBot figurent dans la liste proposée ici. Ils respectent robots.txt, mais l’interdiction se fait par nom : un groupe générique ne les couvre pas s’ils ont aussi leur propre groupe dans le fichier.
Faut-il régler Crawl-delay ?
Google l’ignore totalement ; Yandex et Bing le lisent encore. Ne l’utilisez que si le serveur souffre vraiment de la charge d’exploration : sinon il ne fait que retarder la découverte de vos nouvelles pages.
Outils similaires
- Générateur de sitemap XML Collez vos adresses — d’un tableur, de la console, peu importe — et obtenez un fichier que les…
- Générateur de données structurées Choisissez un type, remplissez ce que vous savez et copiez une balise script prête pour le head…
- Générateur de lien UTM Remplissez les champs et le lien se compose tout seul. Collez un lien déjà balisé et les champs…
- Vérifier les en-têtes HTTP Saisissez une adresse et voyez exactement ce que répond le serveur : le code de statut, tous le…