Generador y comprobador de robots.txt

Dos cosas en una página: armar el archivo a partir de reglas y comprobar el que ya tienes. La respuesta no dice solo «permitido» o «bloqueado», sino qué línea lo decidió.

Plantilla

Google ignora Crawl-delay; Yandex y Bing todavía lo leen.

Cómo usarlo

  1. Elige una plantilla o enumera las rutas a cerrar, una por línea.
  2. Añade excepciones en Allow y la dirección de tu sitemap.
  3. Copia el resultado o descárgalo y ponlo en la raíz del sitio.
  4. Cambia a Comprobar, pega tu archivo y prueba una dirección para un rastreador concreto.

Lo que conviene saber

Gana la regla más larga, no la primera

Tanto Google como Yandex eligen la regla por la longitud de la ruta coincidente, no por el orden en el archivo. Por eso funciona el par habitual «Disallow: /wp-admin/» más «Allow: /wp-admin/admin-ajax.php»: la segunda ruta es más larga, así que gana para ese archivo mientras el resto de la carpeta sigue cerrado. Un comprobador que leyera el archivo de arriba abajo daría la respuesta contraria.

Una regla por encima del primer User-agent no es de nadie

Un Disallow escrito antes de cualquier línea User-agent lo ignoran todos los rastreadores: el archivo se lee por grupos y una regla fuera de un grupo no tiene dueño. Parece perfectamente correcta y no cierra nada, y por eso es el error más caro de robots.txt. El comprobador lo señala aparte, con el número de línea.

Preguntas frecuentes

¿robots.txt saca una página de la búsqueda?

No: solo detiene el rastreo. Una dirección cerrada puede seguir apareciendo en resultados sin descripción si otros sitios enlazan a ella. Para dejarla fuera del índice, déjala abierta al rastreador y ponle una metaetiqueta noindex: el robot tiene que descargar la página para ver esa etiqueta.

¿Dónde debe estar el archivo?

Solo en la raíz del dominio: https://example.com/robots.txt. Un archivo en una subcarpeta no se lee, y un subdominio necesita el suyo propio: para shop.example.com no sirve el de example.com.

¿Cómo bloqueo a los rastreadores de IA?

Añade un grupo por bot: GPTBot, ClaudeBot, PerplexityBot y CCBot están en la lista de rastreadores de aquí. Respetan robots.txt, pero la prohibición va por nombre: un grupo con comodín no los cubre si además tienen su propio grupo en el archivo.

¿Merece la pena poner Crawl-delay?

Google lo ignora por completo; Yandex y Bing todavía lo leen. Ponlo solo si el servidor sufre de verdad con la carga de rastreo: si no, únicamente retrasa el descubrimiento de tus páginas nuevas.

Herramientas relacionadas