
# Как проверить, могут ли ChatGPT, Claude и Perplexity прочитать ваш сайт

Когда кто-то спрашивает ассистента о вашей компании, происходит одно из двух: либо он отвечает по обучающим данным, устаревшим на месяцы, либо прямо сейчас забирает ваш сайт и читает его.

На второй случай вы можете повлиять, и исход решают три вещи.

## 1. Пускает ли их ваш robots.txt

ИИ-компании используют разные user-agent под разные задачи, и заблокировать один не значит заблокировать остальные. Вот те, что важны сегодня:

| User-agent | Компания | Что делает |
|---|---|---|
| `GPTBot` | OpenAI | Обходит сайты для обучения |
| `OAI-SearchBot` | OpenAI | Индексирует для поиска ChatGPT |
| `ChatGPT-User` | OpenAI | Забирает страницу, потому что пользователь спросил сейчас |
| `ClaudeBot` | Anthropic | Обходит для обучения |
| `Claude-SearchBot` | Anthropic | Индексирует для поиска |
| `Claude-User` | Anthropic | Забирает по просьбе человека |
| `PerplexityBot` | Perplexity | Индексирует для ответов |
| `Perplexity-User` | Perplexity | Забирает по запросу |
| `Google-Extended` | Google | Управляет обучением Gemini, но не поиском |
| `Applebot-Extended` | Apple | Управляет обучением Apple Intelligence |
| `CCBot` | Common Crawl | Питает множество других наборов данных |
| `Bytespider` | ByteDance | Обходит для обучения |

Различие, на котором спотыкаются почти все: **агенты с окончанием «-User» — не краулеры**. Они забирают страницу, потому что человек только что задал о ней вопрос, в эту самую секунду. Заблокировав `GPTBot`, вы останавливаете обучение. Заблокировав `ChatGPT-User`, вы лишаете потенциального клиента ответа о вас. Большинству сайтов нужно первое без второго.

Посмотрите, что вы отдаёте на самом деле:

```bash
curl -s https://вашсайт.ru/robots.txt
```

Читайте так, как прочитал бы бот: `Disallow: /` под `User-agent: *` закрывает доступ всем, у кого нет собственного правила, — то есть всем из таблицы.

**Ловушка, о которой стоит знать.** Если вы за Cloudflare и своего robots.txt у вас нет, Cloudflare может отдать файл за вас — свою управляемую Content Signals Policy. Вы получите `200` и вполне убедительный файл, который писали не вы: без ваших правил и без вашей карты сайта. У нас было ровно так месяцами: наш сервер возвращал `404` на `/robots.txt`, и никто этого не замечал, потому что любая проверка получала `200` с периметра. Чтобы отличить одно от другого, спросите origin напрямую:

```bash
curl -sI https://вашсайт.ru/robots.txt | grep -i "server\|cf-cache-status"
```

## 2. Переживает ли контент отсутствие JavaScript

Большинство ИИ-краулеров не выполняют JavaScript. Если страница собирается на клиенте, им достаётся пустая оболочка.

```bash
curl -s https://вашсайт.ru/page | wc -c
curl -s https://вашсайт.ru/page | grep -o "<p>" | wc -l
```

Несколько сотен байт и ни одного абзаца означают, что для краулера страница пуста, как бы хорошо она ни выглядела в браузере. Серверный рендеринг, статическая генерация или пререндеринг решают это; какой именно — почти неважно.

## 3. Сколько остаётся после извлечения

Даже загрузив и отрисовав страницу, агент выбрасывает навигацию, подвал, баннер о куках и почти всю разметку, оставляя то, что похоже на содержимое. Именно этот остаток и цитируют о вас.

Эту часть не проверяет никто, и сюрприз обычно здесь. Быстрее всего — прочитать свою страницу так, как её сохранил бы агент: простым текстом, без лесов. Если остались две фразы и список пунктов меню, никакая настройка robots.txt не поможет.

## Что ещё стоит иметь

**`llms.txt`** в корне: короткая карта важных страниц в Markdown. Это молодая договорённость, а не стандарт, который кто-то обязан соблюдать, но стоит она почти ничего, и её читают.

**`Content-Signal`** — возможность сказать, что можно делать с вашим содержимым: индексировать для поиска, использовать как основу ответа, использовать для обучения. А не только можно ли его скачать. Запретить всё — не единственный вариант и для большинства бизнесов неверный.

**Чистый семантический HTML.** Настоящие заголовки, `<article>`, `<main>`, альтернативные тексты. Та же работа, что помогает программам чтения с экрана, — и именно она заставляет извлечение оставить нужное.

## Коротко

Выполните эти три команды, в таком порядке:

1. `curl -s https://вашсайт.ru/robots.txt` — пускают ли их?
2. `curl -s https://вашсайт.ru/page | wc -c` — есть ли что-то без JavaScript?
3. Прочитайте то, что пережило извлечение, — это ли вы хотели бы видеть в цитате?

Большинство сайтов проходят первую проверку, проваливают третью и никогда об этом не узнают.

[Проверить сайт](/ru) · [robots.txt для ИИ-ботов](/ru/tools/robots-txt-generator) · [Пускают ли ботов?](/ru/tools/ai-crawlers-checker)
