Что на самом деле видит ИИ-агент на вашем сайте
Вы открываете свою главную страницу и видите дизайн: меню, крупную картинку, три колонки текста, таблицу тарифов и баннер о куках, который перестали замечать месяцы назад.
Агент открывает тот же URL и не видит ничего из этого. Он получает поток байтов, выбрасывает почти всё и передаёт остаток модели с ограниченным окном контекста. То, что переживает эту дорогу, и есть всё основание, на котором ассистент опишет вашу компанию.
Почти никто на это не смотрел. Поэтому мы измерили.
Измерение
31 августа 2026 года мы прогнали двенадцать известных страниц через собственный движок: скачать страницу так, как это сделал бы обычный агент, извлечь читаемое содержимое, преобразовать его в Markdown и посчитать токены на обоих концах с помощью cl100k_base.
| Страница | Отправлено | Доходит до модели | Остаток |
|---|---|---|---|
wordpress.org/about |
56 663 ток | 159 ток | 0,3% |
vercel.com/docs |
278 962 ток | 905 ток | 0,3% |
stripe.com/docs |
376 509 ток | 1 042 ток | 0,3% |
cloudflare.com/learning/… |
95 028 ток | 631 ток | 0,7% |
nodejs.org/en/about |
117 729 ток | 1 190 ток | 1,0% |
shopify.com/pricing |
410 515 ток | 2 479 ток | 0,6% |
notion.com/pricing |
172 136 ток | 2 805 ток | 1,6% |
slack.com/pricing |
294 980 ток | 5 718 ток | 1,9% |
developer.mozilla.org/…/HTTP |
59 350 ток | 3 059 ток | 5,2% |
react.dev/learn |
91 899 ток | 3 804 ток | 4,1% |
atlassian.com/software/jira/pricing |
379 636 ток | 1 ток | 0,0% |
agentready.md |
13 188 ток | 627 ток | 4,8% |
Ни одна страница не отдаёт больше 6% того, что отправляет. Медиана — меньше 1%.
Это не скандал. Большая часть этих байтов делает настоящую работу — вёрстка, стили, аналитика, интерактивность — для читателя с браузером. Утверждение уже: за всё это платят на входе, и почти ничего из этого не является тем, за чем пришёл агент.
Четыре вещи, которые происходят с вашей страницей
Между запросом и моделью страница проходит четыре двери. Каждая что-то роняет.
1. Загрузка. Агент запрашивает URL. Большинство загрузчиков агентов не выполняют JavaScript: это медленно, дорого и расширяет поверхность атаки. Значит, они получают сырой ответ вашего сервера, а не страницу, которую собирает браузер.
2. Извлечение. Что-то должно решить, какая часть этого HTML — статья, а какая — мебель. Это та же задача, которую решает режим чтения в Firefox, и та же библиотека, которой пользуются все. Меню, подвал, баннер о куках и боковая панель отправляются в мусор. И всё, что извлекатель не отличает от боковой панели, тоже.
3. Преобразование. Оставшееся становится текстом. Заголовки, списки, таблицы, ссылки и блоки кода выживают как структура. Имена классов, обёртки <div>, встроенные SVG и атрибуты data- — нет.
4. Окно контекста. То, что уцелело, теперь борется за место с вопросом пользователя, системным промптом и, возможно, ещё девятью страницами.
Ваше содержимое существует для ассистента, только если пройдёт все четыре.
Как это выглядит, когда всё хорошо
vercel.com/docs сокращает 278 962 токена до 905, и эти 905 начинаются так:
## Ship anything with Vercel
Deploy your app on Vercel in three steps: install the CLI, add agent
support if you need it…
Это чистый ответ на вопрос «что делает Vercel». Модель, прочитав его, может процитировать, пересказать и указать источник. Отброшенные 99,7% не стоили агенту ничего из того, что он хотел.
Как это выглядит, когда всё плохо
atlassian.com/software/jira/pricing отправляет 1,37 МБ и выдаёт один токен.
Страница — оболочка. В HTML есть <div id="wac-root"></div>, а дальше около мегабайта встроенного состояния приложения: цены, названия тарифов, списки возможностей — всё внутри <script> в виде JSON, в ожидании, когда JavaScript построит из этого страницу. Наш извлекатель послушно вытащил 1,1 миллиона символов window.SSR_detailMetrics=Object.freeze({"getFeatureGateValues":…, а после удаления скриптов остался один перевод строки.
То есть: спросите ассистента, сколько стоит Jira, и ничто на этой странице не может быть источником его ответа. Не потому, что Atlassian кого-то заблокировал — не блокировал, — а потому, что на странице нет текста, пока её не выполнит браузер.
Скачайте тот же URL headless-браузером — и получится 3 048 токенов, начинающихся с Transparent pricing for every team. Содержимое есть. Его просто нет в ответе. Запускает ли агент браузер и во что это ему обходится — вот и вся разница.
stripe.com/docs — более мягкая версия той же формы: на входе 1,28 МБ, а извлечённое содержимое — 1 057 символов, начинающихся с примера командной строки, а не с описания Stripe.
Что мы рассчитывали найти и не нашли
Мы предполагали, что часть этих сайтов отсекает агентов на периметре. Мы прозондировали каждый дважды — один раз как обычный браузер, один раз представившись OAI-SearchBot — и сравнили.
Ни один из двенадцати не отнёсся к боту иначе. Одинаковый код ответа в обоих случаях, через Cloudflare, Vercel и CloudFront. (cloudflare.com/learning ответил 403 обеим нашим пробам — это стена, но не специфичная для ботов.)
О блокировке говорят все. В этой выборке она не случилась ни разу. Случилось нечто более тихое: дверь была открыта, а комната пуста.
Посмотрите на свою страницу
Две команды. Что вы отправляете:
curl -s https://вашсайт.ru/страница | wc -c
А потом прочитайте то, что пережило извлечение: вставьте URL в анализатор и смотрите на панель Markdown, а не на оценку. Вопрос не в том, велико ли число. Вопрос в том, тот ли это текст, который вы хотели бы видеть процитированным о себе.
Обычно удивляются дважды: тому, как мало там всего, и тому, какие именно части дошли.
Коротко
- Агент видит ваш сырой HTML, обычно без выполнения JavaScript, и оставляет около 1%.
- Если содержимое собирает JavaScript, этот 1% может оказаться ровно ничем.
- Быть заблокированным — редкость. Быть пустым — обычное дело.
- Решение не в том, чтобы отправлять меньше разметки. Оно в том, чтобы слова были в ответе.
Проверить свой сайт · Могут ли ИИ-ассистенты вас прочитать? · Отдавать агентам Markdown