자주 묻는 질문

AI 준비도, llms.txt, 웹사이트를 AI 에이전트에 최적화하는 방법에 대해 알아야 할 모든 것.

AI 준비도 기초

AI 준비도는 웹사이트 콘텐츠가 ChatGPT, Claude, Perplexity 같은 AI 에이전트에 의해 얼마나 잘 이해, 추출, 활용될 수 있는지를 측정합니다. AI 기반 도구가 웹 트래픽의 주요 소스가 되면서, AI 준비된 사이트는 더 정확하게 인용되고, AI 생성 답변에 더 자주 나타나며, 처리에 필요한 토큰도 적습니다.

HTML을 시각적으로 렌더링하는 웹 브라우저와 달리, AI 에이전트는 페이지에서 텍스트 콘텐츠를 추출해야 합니다. 복잡한 스타일이 적용된 HTML보다 깔끔하고 잘 구조화된 콘텐츠를 선호합니다. Markdown으로 변환된 잘 구조화된 페이지는 원시 HTML보다 토큰을 70-80% 적게 사용하여 AI 제공업체에게 더 경제적이고 효율적입니다.

주요 AI 크롤러에는 GPTBot(OpenAI/ChatGPT), ClaudeBot(Anthropic/Claude), PerplexityBot(Perplexity), Google-Extended(Google Gemini), Bytespider(ByteDance), CCBot(Common Crawl) 등이 있습니다. 생태계가 성장함에 따라 새로운 AI 에이전트가 정기적으로 등장하고 있습니다.

llms.txt

llms.txt는 AI 에이전트가 웹사이트 구조를 이해하도록 돕는 새로운 표준(llmstxt.org에서 정의)입니다. robots.txt가 검색 엔진 크롤러를 안내하듯, llms.txt는 주요 페이지 링크와 함께 사이트의 Markdown 형식 개요를 제공하여 AI 에이전트가 콘텐츠를 쉽게 탐색할 수 있게 합니다.

llms.txt는 설명과 사이트 주요 페이지 링크가 포함된 간결한 인덱스입니다. llms-full.txt는 해당 페이지의 실제 콘텐츠를 인라인으로 포함하는 확장 버전으로, AI 에이전트가 링크를 따라갈 필요 없이 단일 파일에서 모든 것을 얻을 수 있습니다. 최소한 llms.txt를, 포괄적 커버리지를 위해 llms-full.txt를 사용하세요.

도메인 루트(예: example.com/llms.txt)에 llmstxt.org 사양에 따라 텍스트 파일을 만드세요. # 제목(사이트 이름)으로 시작하고, 인용 형식 설명을 추가한 다음, ## Documentation, ## Main 등의 섹션으로 정리된 링크를 나열하세요. AgentReady는 페이지 분석을 기반으로 추천 llms.txt를 생성할 수 있습니다.

AI를 위한 Markdown

Markdown은 시각적 마크업 잡음(CSS, JavaScript, 레이아웃 div)을 제거하면서 콘텐츠 구조(제목, 목록, 링크, 강조)를 유지하기 때문에 AI 에이전트가 선호하는 형식입니다. 콘텐츠의 Markdown 버전은 토큰을 크게 줄여 AI 시스템의 처리를 더 빠르고 저렴하게 만듭니다.

콘텐츠 협상은 클라이언트의 Accept 헤더에 따라 서버가 같은 페이지의 다른 형식을 제공할 수 있게 합니다. AI 에이전트가 Accept: text/markdown을 보내면 서버가 HTML 대신 Markdown 버전으로 응답할 수 있습니다. 별도의 URL을 만들지 않고 AI 친화적 콘텐츠를 제공하는 가장 효율적인 방법입니다.

두 가지 주요 접근 방식이 있습니다: (1) Accept: text/markdown 헤더를 감지하여 Markdown 콘텐츠를 반환하는 서버 로직 추가; (2) 페이지 옆에 .md 파일 생성(예: /about에 대해 /about.md)하고 llms.txt에서 링크. AgentReady는 자체 페이지에 두 가지 접근 방식을 모두 사용합니다.

구조화 데이터 & JSON-LD

JSON-LD(JavaScript Object Notation for Linked Data)는 Schema.org 어휘를 사용하여 페이지에 구조화 데이터를 포함하는 방법입니다. AI 에이전트는 이 데이터를 사용하여 제품 세부 정보, 기사 메타데이터, 조직 정보 등 사실 기반의 기계 판독 가능 정보를 HTML을 분석하지 않고 추출합니다.

콘텐츠에 가장 맞는 구체적 유형을 사용하세요: 기사에는 Article 또는 BlogPosting, 제품 페이지에는 Product, 회사 페이지에는 Organization, FAQ 페이지에는 FAQPage, 지역 사업체에는 LocalBusiness, 웹 도구에는 WebApplication. 선택한 유형의 name, description, 관련 속성을 항상 포함하세요.

Open Graph 태그(og:title, og:description, og:image)는 소셜 플랫폼과 AI 에이전트 모두가 페이지의 제목, 설명, 메인 이미지를 이해하기 위해 사용하는 표준화된 메타데이터를 제공합니다. 구현이 쉽고 다른 구조화 데이터가 없을 때 신뢰할 수 있는 대안으로 작용합니다.

robots.txt & AI 봇

robots.txt는 어떤 봇이 사이트에 접근할 수 있고 어떤 페이지를 크롤링할 수 있는지를 제어합니다. GPTBot, ClaudeBot 같은 AI 크롤러는 robots.txt 지시를 따릅니다. robots.txt가 이러한 봇을 차단하면 콘텐츠를 색인할 수 없으므로 AI 생성 답변에 사이트가 나타나지 않습니다.

AI 생성 답변에서의 가시성을 최대화하려면 최소한 다음을 허용하세요: GPTBot(OpenAI), ClaudeBot과 Claude-Web(Anthropic), PerplexityBot(Perplexity), Google-Extended(Google Gemini). 다른 봇에 대한 기존 규칙을 유지하면서 이러한 사용자 에이전트에 대한 특정 Allow 규칙을 추가할 수 있습니다.

Content-Signal은 AI 에이전트에게 콘텐츠 사용 방법을 알려주는 HTTP 헤더입니다. 예: Content-Signal: ai-train=yes, search=yes, ai-input=yes는 콘텐츠를 AI 훈련, 검색 색인, AI 답변 입력으로 사용할 수 있음을 나타냅니다. 퍼블리셔에게 AI 사용에 대한 명시적 통제권을 주는 새로운 표준입니다.

AgentReady 채점

AgentReady는 페이지를 가져오고, 콘텐츠를 추출하고, 5개 가중 차원에서 23개 개별 검사를 실행합니다. 각 검사는 0-100으로 평가되며, 차원들이 합산되어 0에서 100까지의 종합 점수가 됩니다. 문자 등급(A-F), 상세 분석, 점수 향상을 위한 우선순위별 권장사항을 받습니다.

5가지 차원은: 시맨틱 HTML(15%) — article, main, 제목, 시맨틱 요소의 올바른 사용; 콘텐츠 효율성(10%) — 토큰 감소율과 콘텐츠 대 잡음 비율; AI 발견 가능성(25%) — llms.txt, robots.txt, 사이트맵, Markdown 협상; 구조화 데이터(20%) — Schema.org, Open Graph, 메타 태그; 접근성(30%) — JavaScript 없이 콘텐츠, 페이지 크기, 콘텐츠 위치.

네! 단일 페이지 분석은 완전 무료이며 가입이 필요 없습니다. 전체 점수, 권장사항, Markdown 변환, llms.txt 미리보기를 받을 수 있습니다. 현재 베타 기간으로 시간당 5회 분석 제한이 있습니다. 전체 도메인 크롤링 및 모니터링 기능이 곧 출시됩니다.

최근 변경 사항

18개의 크롤러를 검사하며, 각각 해당 업체의 공식 문서로 연결됩니다. 2026년 7월에 목록을 다시 만들었습니다. 세 개를 제외했습니다. Claude-Web과 FacebookBot은 더 이상 Anthropic과 Meta 문서에 나오지 않고, cohere-ai는 애초에 문서화된 적이 없습니다. 즉 저희는 존재하지 않는 봇을 적으라고 권해 온 셈입니다. 빠져 있던 것들도 추가했습니다. 그중 OAI-SearchBot은 여러분의 사이트를 실제로 ChatGPT 검색 결과에 올리는 크롤러입니다. 제3자 크롤러 목록에는 지어낸 User-Agent가 돌아다닙니다(xAI/Grok의 사례가 대표적입니다). 여기에는 업체가 직접 문서화한 봇만 올립니다.

아닙니다. 그리고 이 구분이 이 페이지에서 가장 쓸모 있는 내용입니다. 업체들은 크롤러를 목적별로 나눕니다. 학습용(GPTBot, ClaudeBot, Google-Extended)은 모델 학습을 위해 페이지를 읽습니다. 차단해도 노출은 전혀 줄지 않습니다. 검색용(OAI-SearchBot, Claude-SearchBot, PerplexityBot)은 어시스턴트가 인용하는 색인을 만듭니다. 하나라도 막으면 그 어시스턴트에서 사라집니다. 사용자용(ChatGPT-User, Claude-User)은 지금 어떤 사람이 그 페이지를 요청했기 때문에 가져갑니다. 학습은 거부하면서도 어디서나 인용될 수 있습니다. 단, 검색용을 허용해야 합니다. 이제 각 크롤러를 종류별로 표시하므로, 와일드카드로 전부 막는 대신 의식적으로 선택할 수 있습니다.

A2A 에이전트 카드는 /.well-known/agent-card.json에 둡니다. A2A v0.3.0(2025년 8월)에서 이곳으로 옮겨졌고 v1.0도 그대로입니다. /.well-known/agent.json은 SDK가 구형 클라이언트를 위해 아직 제공하는 더 이상 권장되지 않는 별칭입니다. 저희는 예전 경로를 검사하고 생성까지 했는데, 이는 현재의 에이전트가 보지 않는 곳에 디스크립터를 게시하게 한 셈입니다. 지금은 고쳤습니다. MCP의 경우 솔직한 답은 표준 경로가 없다는 것입니다. MCP 명세는 well-known 발견 파일을 전혀 정의하지 않으며, 서버 카드는 여전히 열린 초안(SEP-1649)으로 /.well-known/mcp/server-card.json을 제안하는 단계입니다. 저희는 그 경로와 기존 mcp.json 관행을 함께 탐지하고, 표준인 척하지 않고 초안이라고 표시합니다. MCP 명세가 실제로 요구하는 것은 /.well-known/oauth-protected-resource(RFC 9728)이며, 이제 이를 검사합니다.

채점 기준이 효과를 입증할 수 있는 항목이 아니라 확인하기 쉬운 항목에 높은 점수를 주고 있었기 때문입니다. 주요 업체 어느 곳도 구현을 약속하지 않은 제안인 llms.txt가, 모든 어시스턴트가 실제로 파싱하는 Schema.org보다 더 큰 비중을 차지하고 있었습니다. 루브릭 v2은 23개 검사 각각이 근거 수준을 밝히도록 합니다. 입증됨(업체가 이를 읽는다고 문서화함), 타당함(오래 자리 잡은 웹 관행이지만 AI에 관한 업체의 언급은 없음), 추정(합리적인 추측일 뿐)의 세 단계입니다. 가중치도 이를 따릅니다. 이제 입증됨이 100점 중 32점, 타당함이 51점, 추정이 17점을 차지합니다. llms.txt는 여전히 검사합니다. 게시하는 데 비용이 들지 않고 앞으로 의미를 가질 수도 있기 때문입니다. 다만 효과가 입증된 신호보다 더 큰 비중을 갖지는 않습니다. 모든 결과에는 그것을 산출한 루브릭 버전이 기록되므로, 예전 점수도 측정 당시의 규칙으로 읽을 수 있습니다.

이제 측정합니다. 그리고 그 과정에서 저희 채점의 구멍이 드러났습니다. 다른 검사들은 모두 '선언'을 읽습니다. robots.txt가 크롤러의 통과를 허용한다고 하면 점수를 줬습니다. 하지만 robots.txt는 오리진이 제공하는데, 요청은 거기까지 가지도 못합니다. CDN이나 WAF가 먼저 응답하며, 둘이 일치해야 할 이유는 없습니다. Cloudflare는 2026년 9월 15일부터 엣지에서 AI 크롤러를 기본으로 차단하기 시작했습니다. 흠잡을 데 없는 robots.txt를 게시하고도 모든 어시스턴트에게 닫혀 있으면서 저희에게 만점을 받을 수 있었다는 뜻입니다. 그래서 읽기를 멈추고 측정을 시작했습니다. 일반 클라이언트로 페이지를 가져오고, 다시 OAI-SearchBot이라고 밝히며 가져와 비교합니다. 저희가 증명할 수 있는 것에는 한계가 있고, 과장하기보다 그 한계를 말하는 쪽을 택합니다. 이 검사는 저희 서버에서 나가고, 엣지는 크롤러를 이름이 아니라 IP 주소로 검증합니다. 따라서 거부는 사칭자를 겨냥한 것이고 검증된 크롤러는 통과하고 있을 수도 있습니다. 저희는 본 그대로 보고하고 봇 규칙을 확인할 곳을 알려줍니다. 'ChatGPT에서 차단되었다'고는 말하지 않습니다. 외부에서는 알 수 없기 때문입니다.

유용한 리소스