robots.txt 생성기와 테스터

한 페이지에서 두 가지를 합니다. 규칙으로 파일을 만들고, 지금 쓰는 파일을 검사하는 일. 답은 「허용」이나 「차단」만이 아니라 어느 줄이 그렇게 정했는지까지 알려 줍니다.

템플릿

Google은 Crawl-delay를 무시하지만 Yandex와 Bing은 읽습니다.

사용 방법

  1. 템플릿을 고르거나 막을 경로를 한 줄에 하나씩 적습니다.
  2. Allow에 예외를, 그리고 사이트맵 주소를 넣습니다.
  3. 결과를 복사하거나 내려받아 사이트 루트에 둡니다.
  4. 「검사」로 옮겨 자기 파일을 붙여넣고, 원하는 크롤러로 특정 주소를 확인합니다.

알아두면 좋은 점

이기는 것은 가장 긴 규칙이지 첫 줄이 아닙니다

Google도 Yandex도 파일 순서가 아니라 일치한 경로의 길이로 규칙을 고릅니다. 그래서 흔한 조합인 「Disallow: /wp-admin/」과 「Allow: /wp-admin/admin-ajax.php」가 작동합니다. 두 번째 경로가 더 길어 그 파일 하나에 대해서는 이기고, 폴더의 나머지는 닫힌 채로 남습니다. 파일을 위에서 아래로 읽는 검사기라면 정반대 답을 냅니다.

첫 User-agent 위의 규칙은 누구의 것도 아닙니다

어떤 User-agent 줄보다 앞에 쓴 Disallow는 모든 크롤러가 무시합니다. 파일은 그룹 단위로 읽히고, 그룹 밖의 규칙에는 주인이 없기 때문입니다. 겉보기에는 멀쩡한데 아무것도 막지 못합니다 — robots.txt에서 가장 값비싼 실수입니다. 검사기는 이것을 줄 번호와 함께 따로 알려 줍니다.

자주 묻는 질문

robots.txt로 페이지를 검색에서 지울 수 있나요?

없습니다. 막히는 것은 크롤링뿐입니다. 다른 사이트가 링크하면 막아 둔 주소도 설명 없이 결과에 나올 수 있습니다. 색인에서 빼려면 크롤러에는 열어 두고 noindex 메타 태그를 넣으세요. 로봇이 그 태그를 보려면 페이지를 받아야 합니다.

파일은 어디에 두나요?

도메인 루트에만 둡니다: https://example.com/robots.txt. 하위 폴더에 둔 파일은 아예 읽히지 않고, 서브도메인은 자기 파일이 필요합니다. shop.example.com에 example.com의 파일은 적용되지 않습니다.

AI 크롤러는 어떻게 막나요?

봇마다 그룹을 추가하세요. GPTBot, ClaudeBot, PerplexityBot, CCBot이 여기 크롤러 목록에 있습니다. 이들은 robots.txt를 지키지만 금지는 이름 단위입니다. 파일에 그 봇의 전용 그룹이 따로 있으면 별표 그룹은 적용되지 않습니다.

Crawl-delay를 설정할 만한가요?

Google은 완전히 무시하고 Yandex와 Bing은 아직 읽습니다. 서버가 크롤링 부하로 실제로 힘들 때만 설정하세요. 그렇지 않으면 새 페이지가 발견되는 속도만 늦춥니다.

관련 도구