ChatGPT, Claude, Perplexity가 내 사이트를 읽을 수 있는지 확인하는 법
누군가 어시스턴트에게 당신 회사를 물으면 둘 중 하나가 일어납니다. 몇 달 지난 학습 데이터로 답하거나, 그 자리에서 당신의 사이트를 가져와 읽거나.
당신이 손댈 수 있는 쪽은 후자이고, 그 결과를 좌우하는 것이 셋 있습니다.
1. robots.txt가 들여보내고 있는가
AI 기업들은 작업마다 다른 user-agent를 씁니다. 하나를 막아도 나머지는 막히지 않습니다. 지금 챙겨야 할 것들입니다.
| User-agent | 회사 | 하는 일 |
|---|---|---|
GPTBot |
OpenAI | 학습을 위한 크롤링 |
OAI-SearchBot |
OpenAI | ChatGPT 검색용 색인 |
ChatGPT-User |
OpenAI | 사용자가 지금 물어서 페이지를 가져옴 |
ClaudeBot |
Anthropic | 학습을 위한 크롤링 |
Claude-SearchBot |
Anthropic | 검색용 색인 |
Claude-User |
Anthropic | 사용자를 대신해 가져옴 |
PerplexityBot |
Perplexity | 답변용 색인 |
Perplexity-User |
Perplexity | 요청에 따라 가져옴 |
Google-Extended |
Gemini 학습을 제어. 검색은 아님 | |
Applebot-Extended |
Apple | Apple Intelligence 학습을 제어 |
CCBot |
Common Crawl | 다른 여러 데이터셋의 공급원 |
Bytespider |
ByteDance | 학습을 위한 크롤링 |
거의 모두가 헷갈리는 구분이 있습니다. 끝이 「-User」인 것들은 크롤러가 아닙니다. 방금 어떤 사람이 그 페이지에 대해 물었기 때문에 가져가는 겁니다. GPTBot을 막으면 학습이 멈춥니다. ChatGPT-User를 막으면 잠재 고객이 당신에 대한 답을 얻지 못합니다. 대부분의 사이트가 원하는 건 앞의 것이지 뒤의 것이 아닙니다.
실제로 무엇을 내보내고 있는지 보세요.
curl -s https://yoursite.com/robots.txt
봇의 눈으로 읽습니다. User-agent: * 아래의 Disallow: /는 자기 규칙이 없는 모두를 차단하고, 위 표의 전부가 여기 포함됩니다.
알아둘 함정 하나. Cloudflare 뒤에 있고 자체 robots.txt가 없다면 Cloudflare가 대신 하나를 내보낼 수 있습니다. 관리형 Content Signals Policy입니다. 200과 함께 그럴듯해 보이지만 당신이 쓰지 않은 파일이 돌아옵니다. 당신의 규칙도, 사이트맵도 없습니다. 우리가 몇 달 동안 정확히 이 상태였습니다. 우리 서버는 /robots.txt에 404를 돌려주고 있었는데 아무도 몰랐습니다. 모든 확인이 엣지에서 200을 받았기 때문입니다. 구분하려면 오리진에 직접 물으세요.
curl -sI https://yoursite.com/robots.txt | grep -i "server\|cf-cache-status"
2. JavaScript 없이도 본문이 남는가
대부분의 AI 크롤러는 JavaScript를 실행하지 않습니다. 페이지를 클라이언트에서 조립한다면 그들이 받는 것은 빈 껍데기입니다.
curl -s https://yoursite.com/page | wc -c
curl -s https://yoursite.com/page | grep -o "<p>" | wc -l
수백 바이트에 문단이 하나도 없다면, 브라우저에서 아무리 잘 보여도 크롤러에게 그 페이지는 비어 있습니다. 서버 렌더링, 정적 생성, 프리렌더링 중 무엇으로든 해결되며 어느 쪽인지는 별로 중요하지 않습니다.
3. 추출 후에 얼마나 남는가
가져와서 렌더링까지 마쳐도 에이전트는 내비게이션, 푸터, 쿠키 배너, 그리고 마크업 대부분을 버리고 본문처럼 보이는 것만 남깁니다. 그 남은 것이 당신에 대해 인용되는 내용입니다.
아무도 확인하지 않는 부분이고, 놀라움은 보통 여기 있습니다. 가장 빠른 방법은 에이전트가 남길 형태 그대로 자기 페이지를 읽어보는 것입니다. 장식을 걷어낸 평문으로요. 남은 게 두 문장과 메뉴 항목 목록이라면 robots.txt를 아무리 손봐도 소용없습니다.
함께 갖추면 좋은 것
루트의 llms.txt: 중요한 페이지를 Markdown으로 짧게 정리한 지도. 누구도 지킬 의무가 없는 표준이 아니라 아직 젊은 관행이지만, 품이 거의 들지 않고 실제로 읽힙니다.
Content-Signal: 가져갈 수 있는지만이 아니라, 그 내용으로 무엇을 해도 되는지 — 검색 색인, 답변의 재료, 학습 — 를 밝힐 수 있습니다. 전부 막는 것이 유일한 선택지는 아니며, 대부분의 사업에는 잘못된 선택입니다.
깔끔한 시맨틱 HTML. 진짜 제목, <article>, <main>, 대체 텍스트. 스크린 리더를 돕는 작업과 같은 것이고, 추출이 옳은 부분을 남기게 만드는 이유입니다.
요약
이 셋을 이 순서로 실행하세요.
curl -s https://yoursite.com/robots.txt— 들어올 수 있는가curl -s https://yoursite.com/page | wc -c— JavaScript 없이 내용이 있는가- 추출 후 남는 것을 읽어보기 — 인용되길 바라는 내용인가
대부분의 사이트는 첫 번째를 통과하고, 세 번째에서 떨어지며, 끝내 그 사실을 모릅니다.