Gerador e testador de robots.txt

Duas coisas numa página: montar o arquivo a partir de regras e testar o que você já tem. A resposta não diz apenas «permitido» ou «bloqueado», mas qual linha decidiu.

Modelo

O Google ignora o Crawl-delay; Yandex e Bing ainda o leem.

Como usar

  1. Escolha um modelo ou liste os caminhos a fechar, um por linha.
  2. Acrescente exceções em Allow e o endereço do seu sitemap.
  3. Copie o resultado ou baixe-o e coloque na raiz do site.
  4. Vá para Testar, cole seu arquivo e verifique um endereço para um rastreador específico.

Bom saber

Vence a regra mais longa, não a primeira

Tanto o Google quanto o Yandex escolhem a regra pelo comprimento do caminho correspondente, não pela ordem no arquivo. Por isso funciona o par habitual «Disallow: /wp-admin/» mais «Allow: /wp-admin/admin-ajax.php»: o segundo caminho é mais longo e vence para aquele arquivo, enquanto o resto da pasta continua fechado. Um testador que lesse o arquivo de cima para baixo daria a resposta oposta.

Uma regra acima do primeiro User-agent não é de ninguém

Um Disallow escrito antes de qualquer linha User-agent é ignorado por todos os rastreadores: o arquivo é lido em grupos e uma regra fora de um grupo não tem dono. Ela parece perfeitamente correta e não fecha nada — é o erro mais caro do robots.txt. O testador o aponta em separado, com o número da linha.

Perguntas frequentes

O robots.txt tira uma página da busca?

Não — ele só impede o rastreamento. Um endereço fechado ainda pode aparecer nos resultados sem descrição se outros sites o linkarem. Para deixar a página fora do índice, mantenha-a aberta ao rastreador e coloque uma meta tag noindex: o robô precisa baixar a página para ver essa tag.

Onde o arquivo deve ficar?

Somente na raiz do domínio: https://example.com/robots.txt. Um arquivo em subpasta não é lido, e um subdomínio precisa do seu próprio — para shop.example.com, o de example.com não vale.

Como bloquear rastreadores de IA?

Adicione um grupo por robô: GPTBot, ClaudeBot, PerplexityBot e CCBot estão na lista de rastreadores daqui. Eles respeitam o robots.txt, mas a proibição vale por nome — um grupo com curinga não os cobre se eles também tiverem grupo próprio no arquivo.

Vale a pena definir Crawl-delay?

O Google o ignora por completo; Yandex e Bing ainda o leem. Defina apenas se o servidor realmente sofre com a carga de rastreamento — caso contrário, só atrasa a descoberta das suas páginas novas.

Ferramentas relacionadas