Gerador e testador de robots.txt
Duas coisas numa página: montar o arquivo a partir de regras e testar o que você já tem. A resposta não diz apenas «permitido» ou «bloqueado», mas qual linha decidiu.
Modelo
O Google ignora o Crawl-delay; Yandex e Bing ainda o leem.
Observações
- Grátis
- Os arquivos não saem do seu dispositivo
- Sem cadastro
- Sem limite de arquivos
Como usar
- Escolha um modelo ou liste os caminhos a fechar, um por linha.
- Acrescente exceções em Allow e o endereço do seu sitemap.
- Copie o resultado ou baixe-o e coloque na raiz do site.
- Vá para Testar, cole seu arquivo e verifique um endereço para um rastreador específico.
Bom saber
Vence a regra mais longa, não a primeira
Tanto o Google quanto o Yandex escolhem a regra pelo comprimento do caminho correspondente, não pela ordem no arquivo. Por isso funciona o par habitual «Disallow: /wp-admin/» mais «Allow: /wp-admin/admin-ajax.php»: o segundo caminho é mais longo e vence para aquele arquivo, enquanto o resto da pasta continua fechado. Um testador que lesse o arquivo de cima para baixo daria a resposta oposta.
Uma regra acima do primeiro User-agent não é de ninguém
Um Disallow escrito antes de qualquer linha User-agent é ignorado por todos os rastreadores: o arquivo é lido em grupos e uma regra fora de um grupo não tem dono. Ela parece perfeitamente correta e não fecha nada — é o erro mais caro do robots.txt. O testador o aponta em separado, com o número da linha.
Perguntas frequentes
O robots.txt tira uma página da busca?
Não — ele só impede o rastreamento. Um endereço fechado ainda pode aparecer nos resultados sem descrição se outros sites o linkarem. Para deixar a página fora do índice, mantenha-a aberta ao rastreador e coloque uma meta tag noindex: o robô precisa baixar a página para ver essa tag.
Onde o arquivo deve ficar?
Somente na raiz do domínio: https://example.com/robots.txt. Um arquivo em subpasta não é lido, e um subdomínio precisa do seu próprio — para shop.example.com, o de example.com não vale.
Como bloquear rastreadores de IA?
Adicione um grupo por robô: GPTBot, ClaudeBot, PerplexityBot e CCBot estão na lista de rastreadores daqui. Eles respeitam o robots.txt, mas a proibição vale por nome — um grupo com curinga não os cobre se eles também tiverem grupo próprio no arquivo.
Vale a pena definir Crawl-delay?
O Google o ignora por completo; Yandex e Bing ainda o leem. Defina apenas se o servidor realmente sofre com a carga de rastreamento — caso contrário, só atrasa a descoberta das suas páginas novas.
Ferramentas relacionadas
- Gerador de sitemap XML Cole seus endereços — de uma planilha, do console, como vierem — e receba um arquivo que os bus…
- Gerador de dados estruturados Escolha um tipo, preencha o que souber e copie uma tag script pronta para o head da página. O q…
- Gerador de links UTM Preencha os campos e o link se monta sozinho. Cole um link que já tenha etiquetas e os campos s…
- Ver cabeçalhos HTTP Informe um endereço e veja exatamente o que o servidor responde: o código de status, todos os c…