검색용 크롤러는 검색 서비스가 결과나 답에 보여 줄 페이지를 모으려고 웹사이트를 방문하는 자동 프로그램입니다. 이름과 용도는 각 회사 문서가 밝히고 운영자는 robots.txt의 User-agent 줄에 그 이름을 적어 허용과 차단을 정합니다1.
| 항목 | 내용 |
|---|---|
| 다른 이름 | 봇, 로봇, 사용자 에이전트 이름 |
| 정하는 곳 | 이름과 용도는 각 회사 문서, robots.txt를 읽는 규칙은 RFC 93091 |
| 대표 이름 | Googlebot(Google 검색)2, OAI-SearchBot(ChatGPT 검색)3, PerplexityBot(Perplexity 검색)4, Claude-SearchBot(Claude 검색 결과 품질)5 |
| 적혀 있는 곳 | robots.txt의 User-agent 줄1, 서버 접근 기록의 사용자 에이전트 문자열 |
| 확인하는 곳 | 각 회사 크롤러 문서와 공개 IP 목록2345 |
표. 검색용 크롤러 요약. 출처: 각 회사 크롤러 문서2345, RFC 93091. 기준일: 2026-10-05 확인.
어디서 보게 되나
robots.txt를 열면 User-agent: OAI-SearchBot 같은 줄 아래에 그 크롤러에게만 적용되는 규칙이 붙어 있습니다. 이름이 적힌 묶음이 없으면 크롤러는 User-agent: * 묶음을 따라야 합니다1. 서버 접근 기록에서는 사용자 에이전트 칸에 compatible; PerplexityBot/1.0 같은 문자열로 남습니다4.
헷갈리기 쉬운 것
| 헷갈리는 말 | 차이 | 확인할 곳 |
|---|---|---|
| 학습용 크롤러 | GPTBot은 기반 모델 학습용 수집이고 ClaudeBot을 막으면 이후 자료가 학습 데이터에서 빠짐35 | 회사별 크롤러 문서 |
| 사용자 요청용 접근 | Perplexity-User는 사용자 질문에 따라 페이지를 열며 robots.txt를 대체로 무시함4. Claude-User를 막으면 사용자 주도 웹 검색에서 보일 가능성이 줄 수 있음5 | 같은 문서 |
| Google-Extended | robots.txt에만 쓰는 이름. 별도 HTTP 사용자 에이전트가 없고 Google 검색 포함 여부와 순위에 영향이 없음2 | Google 일반 크롤러 목록 |
확인하는 법
- 서버 접근 기록에서 낯선 줄의 사용자 에이전트 문자열을 복사합니다. 크롤러 이름이 들어 있으면 다음 단계로 갑니다.
- 그 이름을 낸 회사의 크롤러 문서를 열어 용도를 읽습니다. 검색 표시, 학습, 사용자 요청 가운데 하나로 적습니다.
- 사용자 에이전트 문자열은 꾸밀 수 있으므로2 그 줄의 IP 주소를 회사가 공개한 IP 목록과 맞춥니다2345. 목록에 있으면 그 회사의 크롤러로 기록합니다.
- 막기로 했다면 robots.txt에 그 이름의 묶음을 따로 적습니다. Anthropic은 하위 도메인마다 적으라고 하고 IP 차단은 제대로 작동하지 않을 수 있다고 안내합니다5. 고친 robots.txt를 주소창에서 다시 열어 새 묶음이 보이면 끝입니다.
관련 용어
- AI 검색 답변에 내 사이트가 빠질 때 설정 점검하기: 검색용 크롤러가 막혀 있는지 점검하는 절차.
- llms.txt: robots.txt와 목적이 다른 제안 형식.
- 리퍼러: 크롤러가 아닌 사람의 방문이 어디서 왔는지 남는 값.









