robots.txt 생성기와 테스터
한 페이지에서 두 가지를 합니다. 규칙으로 파일을 만들고, 지금 쓰는 파일을 검사하는 일. 답은 「허용」이나 「차단」만이 아니라 어느 줄이 그렇게 정했는지까지 알려 줍니다.
템플릿
Google은 Crawl-delay를 무시하지만 Yandex와 Bing은 읽습니다.
지적 사항
- 무료
- 파일이 기기를 벗어나지 않습니다
- 회원가입 불필요
- 파일 수 제한 없음
사용 방법
- 템플릿을 고르거나 막을 경로를 한 줄에 하나씩 적습니다.
- Allow에 예외를, 그리고 사이트맵 주소를 넣습니다.
- 결과를 복사하거나 내려받아 사이트 루트에 둡니다.
- 「검사」로 옮겨 자기 파일을 붙여넣고, 원하는 크롤러로 특정 주소를 확인합니다.
알아두면 좋은 점
이기는 것은 가장 긴 규칙이지 첫 줄이 아닙니다
Google도 Yandex도 파일 순서가 아니라 일치한 경로의 길이로 규칙을 고릅니다. 그래서 흔한 조합인 「Disallow: /wp-admin/」과 「Allow: /wp-admin/admin-ajax.php」가 작동합니다. 두 번째 경로가 더 길어 그 파일 하나에 대해서는 이기고, 폴더의 나머지는 닫힌 채로 남습니다. 파일을 위에서 아래로 읽는 검사기라면 정반대 답을 냅니다.
첫 User-agent 위의 규칙은 누구의 것도 아닙니다
어떤 User-agent 줄보다 앞에 쓴 Disallow는 모든 크롤러가 무시합니다. 파일은 그룹 단위로 읽히고, 그룹 밖의 규칙에는 주인이 없기 때문입니다. 겉보기에는 멀쩡한데 아무것도 막지 못합니다 — robots.txt에서 가장 값비싼 실수입니다. 검사기는 이것을 줄 번호와 함께 따로 알려 줍니다.
자주 묻는 질문
robots.txt로 페이지를 검색에서 지울 수 있나요?
없습니다. 막히는 것은 크롤링뿐입니다. 다른 사이트가 링크하면 막아 둔 주소도 설명 없이 결과에 나올 수 있습니다. 색인에서 빼려면 크롤러에는 열어 두고 noindex 메타 태그를 넣으세요. 로봇이 그 태그를 보려면 페이지를 받아야 합니다.
파일은 어디에 두나요?
도메인 루트에만 둡니다: https://example.com/robots.txt. 하위 폴더에 둔 파일은 아예 읽히지 않고, 서브도메인은 자기 파일이 필요합니다. shop.example.com에 example.com의 파일은 적용되지 않습니다.
AI 크롤러는 어떻게 막나요?
봇마다 그룹을 추가하세요. GPTBot, ClaudeBot, PerplexityBot, CCBot이 여기 크롤러 목록에 있습니다. 이들은 robots.txt를 지키지만 금지는 이름 단위입니다. 파일에 그 봇의 전용 그룹이 따로 있으면 별표 그룹은 적용되지 않습니다.
Crawl-delay를 설정할 만한가요?
Google은 완전히 무시하고 Yandex와 Bing은 아직 읽습니다. 서버가 크롤링 부하로 실제로 힘들 때만 설정하세요. 그렇지 않으면 새 페이지가 발견되는 속도만 늦춥니다.
관련 도구
- XML 사이트맵 생성기 표에서든 콘솔에서든, 있는 그대로 주소를 붙여넣으세요. 검색엔진이 받아들이는 파일이 나옵니다. 중복과 알 수 없는 줄은 조용히 버리지 않고 알려 드립니다.
- 구조화된 데이터 생성기 유형을 고르고 아는 것을 채운 뒤, 페이지 head에 넣을 script 태그를 복사하세요. 비워 둔 것은 마크업에 아예 나오지 않습니다.
- UTM 링크 생성기 항목을 채우면 링크가 알아서 만들어집니다. 이미 태그가 붙은 링크를 붙여넣으면 그 값이 항목으로 들어옵니다 — 두 겹으로 쌓지 않고 기존 표시를 이어받습니다.
- HTTP 헤더 확인 주소를 넣으면 서버가 실제로 무엇을 돌려주는지 그대로 보입니다. 상태 코드, 모든 헤더, 그리고 주소가 넘어간다면 그 한 단계 한 단계까지.