robots.txt 作成・テストツール

1 ページで 2 つのことができます。ルールからファイルを組み立てることと、いま使っているファイルを試すこと。答えは「許可」「拒否」だけでなく、どの行が決めたのかまで示します。

テンプレート

Google は Crawl-delay を無視しますが、Yandex と Bing は読み取ります。

使い方

  1. ひな型を選ぶか、閉じたいパスを 1 行に 1 つ書き出します。
  2. Allow に例外を、そしてサイトマップの URL を加えます。
  3. 結果をコピーするかダウンロードして、サイトのルートに置きます。
  4. 「テスト」に切り替え、自分のファイルを貼り、特定のクローラーで特定の URL を確認します。

知っておくと便利

勝つのは最も長いルールで、最初の行ではありません

Google も Yandex も、ファイル内の順番ではなく一致したパスの長さでルールを選びます。だから「Disallow: /wp-admin/」と「Allow: /wp-admin/admin-ajax.php」というお決まりの組み合わせが機能します。後者のほうが長いので、そのファイル 1 つについては後者が勝ち、フォルダーの残りは閉じたままです。上から順に読むテスターなら逆の答えを出してしまいます。

最初の User-agent より上のルールは誰のものでもありません

どの User-agent 行よりも前に書かれた Disallow は、すべてのクローラーが無視します。ファイルはグループ単位で読まれ、グループの外にあるルールには持ち主がいないからです。見た目はまったく正常なのに何も閉じていない — robots.txt で最も高くつく間違いです。テスターはこれを行番号つきで別枠に出します。

よくある質問

robots.txt でページを検索から消せますか。

消せません。止まるのはクロールだけです。他のサイトからリンクされていれば、閉じた URL も説明文なしで結果に出ることがあります。インデックスから外したいなら、クローラーには開けたまま noindex メタタグを置いてください。そのタグを見るには、ロボットがページを取得できる必要があります。

ファイルはどこに置きますか。

ドメインのルートだけです:https://example.com/robots.txt。サブフォルダーに置いても読まれません。サブドメインには専用のファイルが要り、shop.example.com に example.com のファイルは適用されません。

AI クローラーを拒否するには。

ボットごとにグループを足します。GPTBot、ClaudeBot、PerplexityBot、CCBot はこのツールの一覧にあります。いずれも robots.txt を尊重しますが、拒否は名前単位です。ファイル内にそのボット専用のグループがある場合、アスタリスクのグループは効きません。

Crawl-delay は設定すべきですか。

Google は完全に無視し、Yandex と Bing はまだ読みます。サーバーがクロール負荷に本当に耐えられないときだけ設定してください。そうでなければ、新しいページが見つかる速度を落とすだけです。

関連ツール