Generatore e tester di robots.txt

Due cose in una pagina: comporre il file a partire dalle regole e mettere alla prova quello che hai già — la risposta non dice solo «permesso» o «bloccato», ma quale riga ha deciso.

Modello

Google ignora Crawl-delay; Yandex e Bing lo leggono ancora.

Come si usa

  1. Scegli un modello oppure elenca i percorsi da chiudere, uno per riga.
  2. Aggiungi le eccezioni sotto Allow e l’indirizzo della tua sitemap.
  3. Copia il risultato o scaricalo e mettilo nella radice del sito.
  4. Passa a Verifica, incolla il tuo file e prova un indirizzo preciso per un crawler preciso.

Da sapere

Vince la regola più lunga, non la prima

Sia Google sia Yandex scelgono la regola in base alla lunghezza del percorso corrispondente, non all’ordine nel file. Ecco perché funziona la coppia consueta «Disallow: /wp-admin/» più «Allow: /wp-admin/admin-ajax.php»: il secondo percorso è più lungo, quindi vince per quel singolo file mentre il resto della cartella resta chiuso. Un tester che leggesse il file dall’alto in basso darebbe la risposta opposta.

Una regola sopra il primo User-agent non è di nessuno

Un Disallow scritto prima di qualsiasi riga User-agent viene ignorato da tutti i crawler: il file si legge a gruppi, e una regola fuori da un gruppo non ha un proprietario. Sembra perfettamente a posto e non chiude nulla, ed è per questo l’errore più costoso in un robots.txt. Il tester lo segnala a parte, con il numero di riga.

Fonti

Domande frequenti

robots.txt toglie una pagina dalla ricerca?

No, ferma solo la scansione. Un indirizzo chiuso può comparire ugualmente nei risultati, senza descrizione, se altri siti lo collegano. Per tenere una pagina fuori dall’indice lasciala aperta al crawler e mettici un meta tag noindex: il robot deve poter scaricare la pagina per vedere quel tag.

Dove va messo il file?

Solo nella radice del dominio: https://example.com/robots.txt. Un file in una sottocartella non viene letto affatto, e un sottodominio ha bisogno del suo: per shop.example.com il file di example.com non vale.

Come blocco i crawler delle AI?

Aggiungi un gruppo per ciascun bot: GPTBot, ClaudeBot, PerplexityBot e CCBot sono nell’elenco dei crawler qui. Rispettano il robots.txt, ma il divieto vale per nome: un gruppo con il carattere jolly non li copre se nel file hanno anche un gruppo proprio.

Conviene impostare Crawl-delay?

Google lo ignora del tutto; Yandex e Bing lo leggono ancora. Impostalo solo se il server è davvero in difficoltà sotto il carico di scansione: altrimenti rallenta soltanto la scoperta delle tue pagine nuove.

Strumenti correlati