Как проверить, могут ли ChatGPT, Claude и Perplexity прочитать ваш сайт

Когда кто-то спрашивает ассистента о вашей компании, происходит одно из двух: либо он отвечает по обучающим данным, устаревшим на месяцы, либо прямо сейчас забирает ваш сайт и читает его.

На второй случай вы можете повлиять, и исход решают три вещи.

1. Пускает ли их ваш robots.txt

ИИ-компании используют разные user-agent под разные задачи, и заблокировать один не значит заблокировать остальные. Вот те, что важны сегодня:

User-agent Компания Что делает
GPTBot OpenAI Обходит сайты для обучения
OAI-SearchBot OpenAI Индексирует для поиска ChatGPT
ChatGPT-User OpenAI Забирает страницу, потому что пользователь спросил сейчас
ClaudeBot Anthropic Обходит для обучения
Claude-SearchBot Anthropic Индексирует для поиска
Claude-User Anthropic Забирает по просьбе человека
PerplexityBot Perplexity Индексирует для ответов
Perplexity-User Perplexity Забирает по запросу
Google-Extended Google Управляет обучением Gemini, но не поиском
Applebot-Extended Apple Управляет обучением Apple Intelligence
CCBot Common Crawl Питает множество других наборов данных
Bytespider ByteDance Обходит для обучения

Различие, на котором спотыкаются почти все: агенты с окончанием «-User» — не краулеры. Они забирают страницу, потому что человек только что задал о ней вопрос, в эту самую секунду. Заблокировав GPTBot, вы останавливаете обучение. Заблокировав ChatGPT-User, вы лишаете потенциального клиента ответа о вас. Большинству сайтов нужно первое без второго.

Посмотрите, что вы отдаёте на самом деле:

curl -s https://вашсайт.ru/robots.txt

Читайте так, как прочитал бы бот: Disallow: / под User-agent: * закрывает доступ всем, у кого нет собственного правила, — то есть всем из таблицы.

Ловушка, о которой стоит знать. Если вы за Cloudflare и своего robots.txt у вас нет, Cloudflare может отдать файл за вас — свою управляемую Content Signals Policy. Вы получите 200 и вполне убедительный файл, который писали не вы: без ваших правил и без вашей карты сайта. У нас было ровно так месяцами: наш сервер возвращал 404 на /robots.txt, и никто этого не замечал, потому что любая проверка получала 200 с периметра. Чтобы отличить одно от другого, спросите origin напрямую:

curl -sI https://вашсайт.ru/robots.txt | grep -i "server\|cf-cache-status"

2. Переживает ли контент отсутствие JavaScript

Большинство ИИ-краулеров не выполняют JavaScript. Если страница собирается на клиенте, им достаётся пустая оболочка.

curl -s https://вашсайт.ru/page | wc -c
curl -s https://вашсайт.ru/page | grep -o "<p>" | wc -l

Несколько сотен байт и ни одного абзаца означают, что для краулера страница пуста, как бы хорошо она ни выглядела в браузере. Серверный рендеринг, статическая генерация или пререндеринг решают это; какой именно — почти неважно.

3. Сколько остаётся после извлечения

Даже загрузив и отрисовав страницу, агент выбрасывает навигацию, подвал, баннер о куках и почти всю разметку, оставляя то, что похоже на содержимое. Именно этот остаток и цитируют о вас.

Эту часть не проверяет никто, и сюрприз обычно здесь. Быстрее всего — прочитать свою страницу так, как её сохранил бы агент: простым текстом, без лесов. Если остались две фразы и список пунктов меню, никакая настройка robots.txt не поможет.

Что ещё стоит иметь

llms.txt в корне: короткая карта важных страниц в Markdown. Это молодая договорённость, а не стандарт, который кто-то обязан соблюдать, но стоит она почти ничего, и её читают.

Content-Signal — возможность сказать, что можно делать с вашим содержимым: индексировать для поиска, использовать как основу ответа, использовать для обучения. А не только можно ли его скачать. Запретить всё — не единственный вариант и для большинства бизнесов неверный.

Чистый семантический HTML. Настоящие заголовки, <article>, <main>, альтернативные тексты. Та же работа, что помогает программам чтения с экрана, — и именно она заставляет извлечение оставить нужное.

Коротко

Выполните эти три команды, в таком порядке:

  1. curl -s https://вашсайт.ru/robots.txt — пускают ли их?
  2. curl -s https://вашсайт.ru/page | wc -c — есть ли что-то без JavaScript?
  3. Прочитайте то, что пережило извлечение, — это ли вы хотели бы видеть в цитате?

Большинство сайтов проходят первую проверку, проваливают третью и никогда об этом не узнают.

Проверить сайт · robots.txt для ИИ-ботов · Пускают ли ботов?