이 글은 내 사이트가 다루는 주제를 AI 검색에 직접 물어봤는데 답 아래 출처 링크에 내 사이트가 한 번도 보이지 않을 때 쓰는 점검 절차입니다. 브라우저에 탭 세 개를 열어 둡니다. 내 사이트의 robots.txt, Google Search Console의 URL 검사, 점검할 페이지의 소스 보기입니다. ChatGPT와 Perplexity 쪽을 보려면 서버 접근 기록도 엽니다.
답에 어떤 페이지를 붙일지는 플랫폼이 정하고 사이트 쪽에서 손댈 수 있는 것은 그 후보에 들 자격입니다. Google은 AI Overviews와 AI Mode의 보조 링크가 되려면 페이지가 색인되어 있고 스니펫(검색 결과 제목 아래 붙는 발췌문)과 함께 표시될 자격이 있어야 한다고 안내합니다1. 그래서 크롤러가 들어오는지, 색인됐는지, 발췌가 허용됐는지를 이 순서로 보다가 처음 막힌 곳에서 멈춥니다. AI 기능에 나오려고 새 파일이나 AI용 텍스트 파일, 별도 마크업을 만들 필요는 없다고 Google은 밝힙니다1. 이 점검은 이미 있는 설정만 보고 결과는 끝에서 메모 한 장에 모읍니다.

robots.txt에서 검색용 크롤러 이름 찾기
주소창에 내 도메인 뒤로 /robots.txt를 붙여 엽니다. 파일은 User-agent 줄로 시작하는 묶음 여러 개로 되어 있고 묶음 아래 Disallow 줄이 그 크롤러에게 막는 경로입니다. 크롤러는 자기 이름이 적힌 묶음을 따릅니다. 그런 묶음이 없으면 User-agent: * 묶음을 따릅니다2. 그래서 이름을 찾는 일과 * 묶음을 읽는 일을 함께 해야 합니다.
찾을 이름은 다섯입니다. 앞의 셋이 검색 표시를 맡고 뒤의 둘은 학습 쪽 이름입니다.
| 이름 | 맡는 일 | 막혀 있으면 |
|---|---|---|
| Googlebot | Google 검색 수집 | Google 검색 기술 요건의 첫 조건부터 어긋남3 |
| OAI-SearchBot | ChatGPT 검색에 사이트 표시 | ChatGPT 검색 답변에 표시되지 않고 탐색용 링크로만 남을 수 있음4 |
| PerplexityBot | Perplexity 검색 결과에 사이트를 보여 주고 연결. 기반 모델 학습용 수집에는 쓰지 않음 | 검색 결과에 나오려면 허용하라고 Perplexity가 권함5 |
| GPTBot | OpenAI 기반 모델 학습용 수집 | 검색 표시와 따로 막을 수 있음4 |
| Google-Extended | Gemini 학습과 근거 활용 여부를 정하는 이름 | Google 검색 포함 여부와 순위에 영향 없음6 |
표 1. robots.txt에서 찾을 크롤러 이름. 출처: Google, OpenAI, Perplexity 크롤러 문서3456. 기준일: 2026-10-05 확인. 범위: 세 플랫폼의 검색 표시용 이름과 학습용 이름만 넣었습니다.
아래는 읽는 법을 보여 주는 설명용 예시입니다.
User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /admin/
이 파일에서 GPTBot은 자기 묶음을 따라 사이트 전체가 막힙니다. Googlebot, OAI-SearchBot, PerplexityBot은 이름이 적힌 묶음이 없으니 * 묶음을 따르고 /admin/만 막힙니다. 학습용 수집만 막고 검색 표시는 열어 둔 상태입니다. 반대로 * 묶음에 Disallow: /가 있고 검색용 이름의 묶음이 따로 없다면 세 검색용 크롤러가 모두 막힌 것입니다.
세 검색용 이름이 각자 따르는 묶음에서 점검할 페이지 경로가 Disallow에 걸리지 않으면 이 탭은 끝납니다. 규칙을 고쳤다면 ChatGPT 검색에 반영되기까지 약 24시간이 걸릴 수 있다고 OpenAI는 안내합니다4. ChatGPT 쪽 결과는 하루쯤 지나서 다시 물어봅니다.
robots.txt가 열려 있는데도 크롤러가 못 들어오는 경우가 있습니다. Google은 CDN과 호스팅 설비에서도 크롤링을 허용하라고 권하고1 Perplexity는 웹 방화벽을 쓰는 사이트라면 자사 봇을 허용 목록에 넣어야 할 수 있다고 안내합니다5. 실제로 들어왔는지는 서버 접근 기록에서 OAI-SearchBot과 PerplexityBot 이름을 찾아 가립니다. 두 회사는 봇의 IP 주소 목록을 공개하므로45 기록에 이름이 있으면 그 줄의 IP가 목록에 있는지도 맞춰 봅니다. 이름과 IP가 맞는 줄이 하나라도 있으면 그 봇은 들어온 것입니다. 최근 기록에 이름이 한 번도 없으면 호스팅의 봇 차단 설정과 예외 목록을 메모에 적습니다.

Search Console에서 색인 상태 읽기
Search Console의 URL 검사에 점검할 페이지 주소를 넣으면 맨 위에 현재 색인 상태가 뜹니다7. 이 화면은 Google 검색 기준입니다. ChatGPT와 Perplexity는 robots.txt 허용과 서버 기록의 방문 흔적까지가 사이트에서 확인할 수 있는 범위입니다.
| 보이는 문구 | 뜻 | 다음 할 일 |
|---|---|---|
| URL이 Google에 등록되어 있음 (URL is on Google) | 색인되어 검색 결과에 나올 수 있는 상태. 실제 노출은 보장되지 않음 | 페이지 소스 점검으로 |
| URL이 Google에 등록되어 있지만 문제가 있음 | 색인은 됐지만 구조화 데이터 형식 같은 문제로 개선사항 일부가 표시되지 않을 수 있음 | 펼쳐진 항목의 경고나 오류 이름을 메모에 적고 그 안내대로 고침 |
| URL이 Google에 등록되어 있지 않음 (URL is not on Google) | 색인되지 않은 상태 | 아래 페이지 색인 생성 섹션을 펼쳐 사유를 읽음 |
| 사유가 noindex | 페이지가 검색 제외를 요청함 | 페이지 메타 태그와 응답 헤더에서 noindex를 찾아 의도한 설정인지 정함 |
| 사유가 robots.txt 차단 | Googlebot이 들어오지 못함 | robots.txt 점검으로 돌아감 |
| 실시간 테스트에서 가져오기 실패 | 페이지가 정상 응답을 주지 못함 | 페이지가 HTTP 200 응답을 돌려주는지 서버 설정을 봄 |
표 2. URL 검사 결과 읽기. 출처: Search Console 도움말 한국어판7, Robots 메타 태그 사양8, 검색 기술 요구사항3. 기준일: 2026-10-05 확인. 범위: 한국어 화면 표기 기준이며 괄호 안은 영어 화면 표기입니다.
상태가 "URL이 Google에 등록되어 있음"이면 이 탭은 끝납니다. noindex는 페이지 안이나 응답 헤더에 적히므로 robots.txt를 읽어서는 보이지 않고 이 화면에서 처음 잡힙니다8.
페이지 소스에서 발췌 차단 찾기
Google은 보조 링크 조건에 스니펫 자격을 넣었습니다1. 페이지 전체의 발췌를 금지하는 설정은 그 자리에서 후보 자격을 내려놓는 셈입니다. 점검할 페이지에서 마우스 오른쪽 버튼으로 페이지 소스 보기를 열고 찾기 기능에 snippet을 넣으면 nosnippet, max-snippet, data-nosnippet이 한 번에 걸립니다. 같은 지시는 HTTP 응답 헤더(X-Robots-Tag)로도 걸 수 있으므로 소스에 없으면 개발자 도구의 네트워크 탭에서 문서 응답 헤더도 봅니다.
| 찾은 것 | 뜻 | 판정 |
|---|---|---|
| nosnippet | 페이지 전체 텍스트 발췌 금지. AI Overviews와 AI Mode에도 적용됨 | 막힘 |
| max-snippet:0 | nosnippet과 같은 뜻 | 막힘 |
| max-snippet:숫자 | 발췌 길이 상한. AI Overviews와 AI Mode에 입력으로 쓰일 분량도 이 숫자로 제한됨 | 통과, 숫자를 메모 |
| data-nosnippet 속성 | 그 속성이 붙은 구간만 발췌에서 빠짐 | 통과, 빠진 구간이 핵심 설명인지 메모 |
| 아무것도 없음 | 발췌 제한 없음 | 통과 |
표 3. 발췌 지시 판정. 출처: Robots 메타 태그 사양8. 기준일: 2026-03-24 수정, 2026-10-05 확인. 범위: Google 검색 결과 형태에 대한 지시만 다룹니다.
"막힘"이 나왔고 일부 문단만 숨기려던 설정이었다면 페이지 전체 지시를 지우고 그 문단에만 data-nosnippet을 붙이는 방법이 있습니다.
점검 메모 한 장
점검은 아래 여섯 칸을 채우면 끝납니다. 오른쪽 열은 칸을 채우는 형식을 보여 주는 설명용 예시입니다.
| 칸 | 적을 내용 | 채우는 형식(설명용 예시) |
|---|---|---|
| 페이지와 날짜 | 점검한 주소, 점검일 | /guide/____ / 점검 ____ |
| robots.txt | 세 검색용 이름이 따르는 묶음과 결과 | Googlebot: * 묶음, 열림 / OAI-SearchBot: ____ / PerplexityBot: ____ |
| 방문 기록 | 서버 기록에 두 봇 이름과 공개 IP가 맞는 줄이 있는지 | OAI-SearchBot 있음 / 없음, PerplexityBot 있음 / 없음, 봇 차단 설정 ____ |
| 색인 상태 | URL 검사 문구와 사유 | 등록되어 있음 / 문제가 있음 ____ / 등록되어 있지 않음, 사유 ____ |
| 발췌 설정 | 찾은 지시 | 없음 / nosnippet / max-snippet:__ / data-nosnippet 구간 ____ |
| 구조화 데이터 | 색인 상태가 "등록되어 있지만 문제가 있음"일 때 URL 검사 화면에 뜬 경고나 오류 이름. 다른 상태면 해당 없음 | 해당 없음 / 경고 ____ / 오류 ____ |
표 4. 점검 메모 양식. 출처: 표 1~3의 칸 구성을 옮김1278. 기준일: 2026-10-05. 범위: 페이지 한 개를 점검할 때 씁니다.
막힌 칸을 고쳤다면 다시 확인하는 순서는 이렇습니다. Google 쪽은 URL 검사 화면에서 색인 생성 요청을 누릅니다. 간단한 검사를 통과하면 색인 생성 대기열에 들어가고7 다음에 같은 화면을 열었을 때 상태 문구를 메모의 색인 상태 칸과 견줍니다. ChatGPT 쪽은 robots.txt를 고친 날로부터 하루쯤 지나 처음과 같은 질문을 다시 넣습니다4. 서버 기록에 두 봇 이름이 새로 찍혔는지도 방문 기록 칸에 덧붙입니다.
모든 칸이 열림이면 Google 문서가 든 보조 링크 조건은 채운 상태이고 ChatGPT와 Perplexity는 크롤러가 들어올 수 있는 상태입니다. 그래도 크롤링, 색인, 게재가 보장되지는 않는다고 Google은 밝힙니다1. 모델이 참고한 URL이 답 속 인용보다 대개 많아9 참고만 되고 링크로 붙지 않는 페이지도 생기며 이 구분은 AI 검색 노출 항목에 정리했습니다.










