Generador y comprobador de robots.txt
Dos cosas en una página: armar el archivo a partir de reglas y comprobar el que ya tienes. La respuesta no dice solo «permitido» o «bloqueado», sino qué línea lo decidió.
Plantilla
Google ignora Crawl-delay; Yandex y Bing todavía lo leen.
Observaciones
- Gratis
- Los archivos no salen de tu dispositivo
- Sin registro
- Sin límite de archivos
Cómo usarlo
- Elige una plantilla o enumera las rutas a cerrar, una por línea.
- Añade excepciones en Allow y la dirección de tu sitemap.
- Copia el resultado o descárgalo y ponlo en la raíz del sitio.
- Cambia a Comprobar, pega tu archivo y prueba una dirección para un rastreador concreto.
Lo que conviene saber
Gana la regla más larga, no la primera
Tanto Google como Yandex eligen la regla por la longitud de la ruta coincidente, no por el orden en el archivo. Por eso funciona el par habitual «Disallow: /wp-admin/» más «Allow: /wp-admin/admin-ajax.php»: la segunda ruta es más larga, así que gana para ese archivo mientras el resto de la carpeta sigue cerrado. Un comprobador que leyera el archivo de arriba abajo daría la respuesta contraria.
Una regla por encima del primer User-agent no es de nadie
Un Disallow escrito antes de cualquier línea User-agent lo ignoran todos los rastreadores: el archivo se lee por grupos y una regla fuera de un grupo no tiene dueño. Parece perfectamente correcta y no cierra nada, y por eso es el error más caro de robots.txt. El comprobador lo señala aparte, con el número de línea.
Preguntas frecuentes
¿robots.txt saca una página de la búsqueda?
No: solo detiene el rastreo. Una dirección cerrada puede seguir apareciendo en resultados sin descripción si otros sitios enlazan a ella. Para dejarla fuera del índice, déjala abierta al rastreador y ponle una metaetiqueta noindex: el robot tiene que descargar la página para ver esa etiqueta.
¿Dónde debe estar el archivo?
Solo en la raíz del dominio: https://example.com/robots.txt. Un archivo en una subcarpeta no se lee, y un subdominio necesita el suyo propio: para shop.example.com no sirve el de example.com.
¿Cómo bloqueo a los rastreadores de IA?
Añade un grupo por bot: GPTBot, ClaudeBot, PerplexityBot y CCBot están en la lista de rastreadores de aquí. Respetan robots.txt, pero la prohibición va por nombre: un grupo con comodín no los cubre si además tienen su propio grupo en el archivo.
¿Merece la pena poner Crawl-delay?
Google lo ignora por completo; Yandex y Bing todavía lo leen. Ponlo solo si el servidor sufre de verdad con la carga de rastreo: si no, únicamente retrasa el descubrimiento de tus páginas nuevas.
Herramientas relacionadas
- Generador de sitemap XML Pega tus direcciones —de una hoja de cálculo, de la consola, como sea— y obtén un archivo que l…
- Generador de datos estructurados Elige un tipo, rellena lo que sepas y copia una etiqueta script lista para el head de la página…
- Generador de enlaces UTM Rellena los campos y el enlace se arma solo. Si pegas un enlace que ya lleva etiquetas, los cam…
- Ver cabeceras HTTP Escribe una dirección y verás exactamente lo que responde el servidor: el código de estado, tod…