# 常见问题

关于AI就绪度、llms.txt以及如何让您的网站适应AI代理的所有须知。

## AI就绪度基础

### 什么是AI就绪度，为什么重要？

AI就绪度衡量网站内容能被ChatGPT、Claude和Perplexity等AI代理理解、提取和使用的程度。随着AI工具成为网络流量的重要来源，AI就绪的网站被更准确地引用，在AI生成的回答中更频繁出现，处理所需的Token也更少。

### AI代理与浏览器的内容消费方式有何不同？

与视觉渲染HTML的浏览器不同，AI代理需要从页面中提取文本内容。它们更喜欢干净、结构良好的内容，而非带有复杂样式的HTML。转换为Markdown的结构良好页面比原始HTML使用的Token少70-80%，对AI提供商来说更经济高效。

### 目前有哪些AI机器人和代理在爬取网络？

主要的AI爬虫包括GPTBot（OpenAI/ChatGPT）、ClaudeBot（Anthropic/Claude）、PerplexityBot（Perplexity）、Google-Extended（Google Gemini）、Bytespider（ByteDance）、CCBot（Common Crawl）等。随着生态系统的发展，新的AI代理不断涌现。

## llms.txt

### 什么是llms.txt？

llms.txt是一个新兴标准（在llmstxt.org上定义），帮助AI代理理解网站结构。类似于robots.txt引导搜索引擎爬虫，llms.txt提供网站的Markdown格式概览和关键页面链接，使AI代理能轻松浏览您的内容。

### llms.txt和llms-full.txt有什么区别？

llms.txt是包含描述和网站主要页面链接的简洁索引。llms-full.txt是扩展版本，内联包含这些页面的实际内容，让AI代理无需跟踪链接即可在单个文件中获取所有信息。至少使用llms.txt，要全面覆盖则使用llms-full.txt。

### 如何为网站创建llms.txt？

在域名根目录创建文本文件（如example.com/llms.txt），遵循llmstxt.org规范。以#标题（网站名称）开头，添加引用格式的描述，然后列出按## Documentation和## Main等部分组织的链接。AgentReady可以根据页面分析生成推荐的llms.txt。

## AI的Markdown

### 为什么Markdown对AI代理很重要？

Markdown是AI代理偏好的格式，因为它保留了内容结构（标题、列表、链接、强调）同时消除了视觉标记噪声（CSS、JavaScript、布局div）。内容的Markdown版本使用的Token显著减少，使AI系统处理更快、更便宜。

### 什么是Markdown内容协商？

内容协商允许服务器根据客户端的Accept标头提供同一页面的不同格式。当AI代理发送Accept: text/markdown时，服务器可以响应Markdown版本而非HTML。这是在不创建单独URL的情况下提供AI友好内容的最有效方式。

### 如何提供页面的Markdown版本？

有两种主要方法：(1) 添加服务器逻辑检测Accept: text/markdown标头并返回Markdown内容；(2) 在页面旁创建.md文件（如/about对应/about.md）并在llms.txt中链接。AgentReady对自身页面采用了两种方法。

## 结构化数据与JSON-LD

### 什么是JSON-LD，它如何帮助AI代理？

JSON-LD（JavaScript Object Notation for Linked Data）是使用Schema.org词汇在页面中嵌入结构化数据的方法。AI代理使用这些数据提取产品详情、文章元数据、组织信息等基于事实的机器可读信息——无需解析您的HTML。

### 应该使用哪些Schema.org类型？

使用与内容最匹配的具体类型：文章用Article或BlogPosting，产品页面用Product，公司页面用Organization，FAQ页面用FAQPage，本地商家用LocalBusiness，网页工具用WebApplication。始终包含name、description和所选类型的相关属性。

### Open Graph标签如何帮助AI代理？

Open Graph标签（og:title、og:description、og:image）提供标准化的元数据，社交平台和AI代理都使用它们来理解页面的标题、描述和主图片。实施简单，在缺少其他结构化数据时可作为可靠的备选方案。

## robots.txt与AI机器人

### robots.txt如何影响AI爬虫？

robots.txt控制哪些机器人可以访问您的网站以及可以爬取哪些页面。GPTBot和ClaudeBot等AI爬虫遵守robots.txt指令。如果robots.txt阻止了这些机器人，它们将无法索引您的内容，意味着您的网站不会出现在AI生成的回答中。

### 应在robots.txt中允许哪些AI机器人？

要最大化在AI生成回答中的可见度，至少允许：GPTBot（OpenAI）、ClaudeBot和Claude-Web（Anthropic）、PerplexityBot（Perplexity）和Google-Extended（Google Gemini）。您可以为这些用户代理添加特定的Allow规则，同时保留其他机器人的现有规则。

### 什么是Content-Signal标头？

Content-Signal是一个HTTP标头，告知AI代理如何使用您的内容。例如：Content-Signal: ai-train=yes, search=yes, ai-input=yes表示您的内容可用于AI训练、搜索索引和作为AI回答的输入。这是一个较新的标准，为发布者提供对AI使用的明确控制。

## AgentReady评分

### AgentReady的评分系统如何运作？

AgentReady获取您的页面，提取内容，并在5个加权维度上运行23项个别检查。每项检查评分0-100，各维度汇总为0到100的总分。您将获得字母等级（A-F）、详细分析和优先级排列的改进建议。

### 5个评分维度是什么？

5个维度是：语义化HTML（15%）——正确使用article、main、标题和语义元素；内容效率（10%）——Token减少比率和内容与噪声比；AI可发现性（25%）——llms.txt、robots.txt、站点地图和Markdown协商；结构化数据（20%）——Schema.org、Open Graph和meta标签；可访问性（30%）——无需JavaScript的内容、页面大小和内容位置。

### 分析是免费的吗？

是的！单页分析完全免费，无需注册。您将获得完整评分、改进建议、Markdown转换和llms.txt预览。我们目前处于Beta版，每小时限制5次分析。全域爬取和监控功能即将推出。

## 近期变更

### 你们检测哪些 AI 机器人？为什么名单变了？

我们检测 18 个爬虫，每一个都附有其厂商官方文档的链接。2026 年 7 月我们重建了这份名单，移除了三项：Claude-Web 和 FacebookBot 已不再出现在 Anthropic 与 Meta 的文档中，而 cohere-ai 从来就没有被官方文档记载过——也就是说，我们此前一直在建议大家写入并不存在的机器人。我们也补上了缺失的，其中包括 OAI-SearchBot，正是它把你的网站真正送进 ChatGPT 的搜索结果。第三方爬虫名单里流传着凭空捏造的 User-Agent（xAI/Grok 的就是已知的例子）。在这里，只有厂商亲自记载的机器人才会列出。

### 屏蔽 GPTBot 会损害我在 ChatGPT 中的可见度吗？

不会——而这个区分正是本页最有用的一点。厂商按用途拆分了自己的爬虫。训练类（GPTBot、ClaudeBot、Google-Extended）读取你的页面用于训练模型：屏蔽它们不会让你损失任何可见度。搜索类（OAI-SearchBot、Claude-SearchBot、PerplexityBot）构建助手引用时所依据的索引：屏蔽其中一个，你就从那个助手里消失了。用户类（ChatGPT-User、Claude-User）抓取页面，是因为此刻正有人在要它。你完全可以拒绝训练，同时仍然到处被引用——但前提是放行搜索类爬虫。现在我们为每个爬虫标注类别，让你有意识地选择，而不是用一个通配符把所有人挡在门外。

### 我的 A2A agent card 和 MCP server card 应该放在哪里？

A2A 的 agent card 应放在 /.well-known/agent-card.json。它在 A2A v0.3.0（2025 年 8 月）迁移至此，v1.0 沿用；/.well-known/agent.json 是已弃用的别名，各 SDK 仍为旧客户端提供。我们此前检测——并生成——的是旧路径，这等于让用户把描述符发布在当前代理根本不会查看的位置。此问题已修复。至于 MCP，诚实的回答是：并不存在标准路径。MCP 规范压根没有定义任何 well-known 发现文件，server card 目前仍是一份开放草案（SEP-1649），提议使用 /.well-known/mcp/server-card.json。我们会同时探测该路径与较早的 mcp.json 惯例，并如实标注为草案，而不是假装它是标准。MCP 规范真正要求的是 /.well-known/oauth-protected-resource（RFC 9728）——我们现在会检测它。

### 为什么评分权重在 2026 年 7 月发生了变化？

因为原来的评分标准奖励的是容易检查的东西，而不是我们能证明真正有影响的东西。llms.txt 只是一份没有任何主流厂商承诺实现的提案，权重却高于所有助手都会实际解析的 Schema.org。评分标准 v3 要求 23 项检查各自声明证据等级：已证实（厂商在文档中说明会读取它）、合理（长期确立的网页实践，但厂商未就 AI 作出说明）、推测（一个合理的判断，仅此而已）。权重随之调整：已证实的项目现在占 100 分中的 32 分，合理的占 51 分，推测的占 17 分。我们仍然检查 llms.txt——发布它没有任何成本，将来也可能变得重要——但它不再压过那些效果确实可证的信号。每份结果都会记录生成它的评分标准版本，因此旧的分数可以按当时测量所用的规则来解读。

### 你们会检查 AI 爬虫是否真的能访问到我的网站吗？

现在我们会实测，而这也暴露了我们自己评分中的一个漏洞。其他检查读的都是「声明」：你的 robots.txt 说爬虫可以通过，我们就给分。但 robots.txt 是由你的源站提供的，而请求根本到不了那里——你的 CDN 或 WAF 会先作答，而它不一定与源站一致。Cloudflare 自 2026 年 9 月 15 日起，在边缘默认拦截 AI 爬虫。也就是说，一个站点可以发布无可挑剔的 robots.txt，对所有助手紧闭大门，却在我们这里拿满分。所以我们不再只是读，而是开始测量：以普通客户端请求你的页面，再以 OAI-SearchBot 的身份请求一次，然后对比。我们能证明的事情是有边界的，与其夸大，我们宁愿把边界讲清楚。我们的探测来自我们自己的服务器，而边缘服务通过 IP 地址而非名称来验证爬虫——所以这次拒绝可能针对的是冒名者，而通过验证的爬虫仍被放行。我们只报告实际观察到的结果，并指向你的机器人规则。我们不会告诉你「你已被 ChatGPT 屏蔽」，因为从外部我们无从得知。

## 实用资源

- [llmstxt.org](https://llmstxt.org) — llms.txt specification
- [schema.org](https://schema.org) — Schema.org vocabulary
- [W3C JSON-LD](https://www.w3.org/TR/json-ld11/) — JSON-LD specification
- [ogp.me](https://ogp.me) — Open Graph Protocol
- [robotstxt.org](https://www.robotstxt.org) — robots.txt standard
- [commonmark.org](https://commonmark.org) — CommonMark Markdown specification
- [RFC 7231](https://datatracker.ietf.org/doc/html/rfc7231#section-5.3) — HTTP Content Negotiation
