Как проверить, могут ли ChatGPT, Claude и Perplexity прочитать ваш сайт
Когда кто-то спрашивает ассистента о вашей компании, происходит одно из двух: либо он отвечает по обучающим данным, устаревшим на месяцы, либо прямо сейчас забирает ваш сайт и читает его.
На второй случай вы можете повлиять, и исход решают три вещи.
1. Пускает ли их ваш robots.txt
ИИ-компании используют разные user-agent под разные задачи, и заблокировать один не значит заблокировать остальные. Вот те, что важны сегодня:
| User-agent | Компания | Что делает |
|---|---|---|
GPTBot |
OpenAI | Обходит сайты для обучения |
OAI-SearchBot |
OpenAI | Индексирует для поиска ChatGPT |
ChatGPT-User |
OpenAI | Забирает страницу, потому что пользователь спросил сейчас |
ClaudeBot |
Anthropic | Обходит для обучения |
Claude-SearchBot |
Anthropic | Индексирует для поиска |
Claude-User |
Anthropic | Забирает по просьбе человека |
PerplexityBot |
Perplexity | Индексирует для ответов |
Perplexity-User |
Perplexity | Забирает по запросу |
Google-Extended |
Управляет обучением Gemini, но не поиском | |
Applebot-Extended |
Apple | Управляет обучением Apple Intelligence |
CCBot |
Common Crawl | Питает множество других наборов данных |
Bytespider |
ByteDance | Обходит для обучения |
Различие, на котором спотыкаются почти все: агенты с окончанием «-User» — не краулеры. Они забирают страницу, потому что человек только что задал о ней вопрос, в эту самую секунду. Заблокировав GPTBot, вы останавливаете обучение. Заблокировав ChatGPT-User, вы лишаете потенциального клиента ответа о вас. Большинству сайтов нужно первое без второго.
Посмотрите, что вы отдаёте на самом деле:
curl -s https://вашсайт.ru/robots.txt
Читайте так, как прочитал бы бот: Disallow: / под User-agent: * закрывает доступ всем, у кого нет собственного правила, — то есть всем из таблицы.
Ловушка, о которой стоит знать. Если вы за Cloudflare и своего robots.txt у вас нет, Cloudflare может отдать файл за вас — свою управляемую Content Signals Policy. Вы получите 200 и вполне убедительный файл, который писали не вы: без ваших правил и без вашей карты сайта. У нас было ровно так месяцами: наш сервер возвращал 404 на /robots.txt, и никто этого не замечал, потому что любая проверка получала 200 с периметра. Чтобы отличить одно от другого, спросите origin напрямую:
curl -sI https://вашсайт.ru/robots.txt | grep -i "server\|cf-cache-status"
2. Переживает ли контент отсутствие JavaScript
Большинство ИИ-краулеров не выполняют JavaScript. Если страница собирается на клиенте, им достаётся пустая оболочка.
curl -s https://вашсайт.ru/page | wc -c
curl -s https://вашсайт.ru/page | grep -o "<p>" | wc -l
Несколько сотен байт и ни одного абзаца означают, что для краулера страница пуста, как бы хорошо она ни выглядела в браузере. Серверный рендеринг, статическая генерация или пререндеринг решают это; какой именно — почти неважно.
3. Сколько остаётся после извлечения
Даже загрузив и отрисовав страницу, агент выбрасывает навигацию, подвал, баннер о куках и почти всю разметку, оставляя то, что похоже на содержимое. Именно этот остаток и цитируют о вас.
Эту часть не проверяет никто, и сюрприз обычно здесь. Быстрее всего — прочитать свою страницу так, как её сохранил бы агент: простым текстом, без лесов. Если остались две фразы и список пунктов меню, никакая настройка robots.txt не поможет.
Что ещё стоит иметь
llms.txt в корне: короткая карта важных страниц в Markdown. Это молодая договорённость, а не стандарт, который кто-то обязан соблюдать, но стоит она почти ничего, и её читают.
Content-Signal — возможность сказать, что можно делать с вашим содержимым: индексировать для поиска, использовать как основу ответа, использовать для обучения. А не только можно ли его скачать. Запретить всё — не единственный вариант и для большинства бизнесов неверный.
Чистый семантический HTML. Настоящие заголовки, <article>, <main>, альтернативные тексты. Та же работа, что помогает программам чтения с экрана, — и именно она заставляет извлечение оставить нужное.
Коротко
Выполните эти три команды, в таком порядке:
curl -s https://вашсайт.ru/robots.txt— пускают ли их?curl -s https://вашсайт.ru/page | wc -c— есть ли что-то без JavaScript?- Прочитайте то, что пережило извлечение, — это ли вы хотели бы видеть в цитате?
Большинство сайтов проходят первую проверку, проваливают третью и никогда об этом не узнают.
Проверить сайт · robots.txt для ИИ-ботов · Пускают ли ботов?