
# Lo que ve de verdad un agente de IA al visitar tu web

Abres tu portada y ves un diseño: un menú, una imagen grande, tres columnas de texto, una tabla de precios y un aviso de cookies que dejaste de mirar hace meses.

Un agente abre esa misma URL y no ve nada de eso. Recibe un chorro de bytes, tira casi todos y le pasa lo que queda a un modelo con una ventana de contexto limitada. Lo que sobrevive a ese viaje es todo lo que tiene un asistente para describir tu empresa.

Casi nadie lo ha mirado nunca. Así que lo medimos.

## La medición

El 31 de agosto de 2026 pasamos doce páginas conocidas por nuestro propio motor: descargar la página como lo haría un agente normal, extraer el contenido legible, convertirlo a Markdown y contar tokens en los dos extremos con `cl100k_base`.

| Página | Envía | Llega al modelo | Queda |
|---|---|---|---|
| `wordpress.org/about` | 56.663 tok | 159 tok | 0,3% |
| `vercel.com/docs` | 278.962 tok | 905 tok | 0,3% |
| `stripe.com/docs` | 376.509 tok | 1.042 tok | 0,3% |
| `cloudflare.com/learning/…` | 95.028 tok | 631 tok | 0,7% |
| `nodejs.org/en/about` | 117.729 tok | 1.190 tok | 1,0% |
| `shopify.com/pricing` | 410.515 tok | 2.479 tok | 0,6% |
| `notion.com/pricing` | 172.136 tok | 2.805 tok | 1,6% |
| `slack.com/pricing` | 294.980 tok | 5.718 tok | 1,9% |
| `developer.mozilla.org/…/HTTP` | 59.350 tok | 3.059 tok | 5,2% |
| `react.dev/learn` | 91.899 tok | 3.804 tok | 4,1% |
| `atlassian.com/software/jira/pricing` | 379.636 tok | 1 tok | 0,0% |
| `agentready.md` | 13.188 tok | 627 tok | 4,8% |

Ninguna entrega más del 6% de lo que envía. La mediana no llega al 1%.

No es ningún escándalo. Casi todos esos bytes hacen un trabajo real —maquetación, estilos, analítica, interactividad— para quien llega con un navegador. Lo que decimos es más concreto: **todo eso se paga a la entrada, y casi nada es lo que el agente venía a buscar.**

## Las cuatro cosas que le pasan a tu página

Entre la petición y el modelo, tu página cruza cuatro puertas. Cada una deja algo por el camino.

**1. La descarga.** El agente pide la URL. La mayoría de los descargadores de agentes no ejecutan JavaScript: es lento, caro y abre superficie de ataque. Así que reciben la respuesta cruda de tu servidor, no la página que monta un navegador.

**2. La extracción.** Algo tiene que decidir qué parte de ese HTML es el artículo y qué parte es mobiliario. Es el mismo problema que resuelve el modo lectura de Firefox, con la misma librería que usa todo el mundo. El menú, el pie, el aviso de cookies y la barra lateral van a la basura. Y también todo lo que el extractor no sepa distinguir de una barra lateral.

**3. La conversión.** Lo que queda se vuelve texto. Los encabezados, las listas, las tablas, los enlaces y los bloques de código sobreviven como estructura. Los nombres de clase, los `<div>` envoltorio, los SVG en línea y los atributos `data-` no.

**4. La ventana de contexto.** Lo que ha llegado hasta aquí compite por el espacio con la pregunta del usuario, con el prompt de sistema y quizá con otras nueve páginas.

Tu contenido solo existe, para el asistente, si atraviesa las cuatro.

## Cómo se ve cuando sale bien

`vercel.com/docs` reduce 278.962 tokens a 905, y esos 905 empiezan así:

```markdown
## Ship anything with Vercel

Deploy your app on Vercel in three steps: install the CLI, add agent
support if you need it…
```

Eso responde limpiamente a «qué hace Vercel». Un modelo que lo lea puede citarlo, resumirlo y atribuirlo. El 99,7% que se cayó no le costó nada que quisiera.

## Cómo se ve cuando sale mal

`atlassian.com/software/jira/pricing` envía 1,37 MB y entrega **un token**.

La página es una carcasa. El HTML contiene `<div id="wac-root"></div>` y después alrededor de un megabyte de estado de aplicación: los precios, los nombres de los planes, las listas de funciones, todo dentro de un `<script>` en forma de JSON, esperando a que JavaScript construya la página. Nuestro extractor sacó obedientemente 1,1 millones de caracteres de `window.SSR_detailMetrics=Object.freeze({"getFeatureGateValues":…` y, una vez eliminados los scripts, lo que quedaba era un salto de línea.

O sea: pregúntale a un asistente cuánto cuesta Jira y nada de esa página puede ser la fuente de su respuesta. No porque Atlassian haya bloqueado a nadie —no lo ha hecho—, sino porque la página no tiene texto hasta que un navegador la ejecuta.

Descarga esa misma URL con un navegador headless y salen 3.048 tokens que empiezan por **Transparent pricing for every team**. El contenido está. Simplemente no está en la respuesta. [Que un agente ejecute o no un navegador, y lo que eso le cuesta](/es/blog/why-ai-agents-fail), es toda la diferencia.

`stripe.com/docs` es una versión más suave de la misma forma: entran 1,28 MB y el contenido extraído son 1.057 caracteres que empiezan por un ejemplo de línea de comandos en vez de por una descripción de Stripe.

## Lo que esperábamos encontrar y no estaba

Dábamos por hecho que algunos de estos sitios estarían echando a los agentes en el borde. Sondeamos cada uno dos veces —una como navegador normal y otra identificándonos como `OAI-SearchBot`— y comparamos.

**Ninguno de los doce trató distinto al bot.** El mismo código de estado en ambos casos, con Cloudflare, Vercel y CloudFront por medio. (`cloudflare.com/learning` devolvió 403 a nuestras dos sondas, que es un muro, pero no uno específico para bots.)

El bloqueo es el fallo del que todo el mundo habla. En esta muestra no ocurrió ni una vez. Lo que ocurrió fue más silencioso: la puerta estaba abierta y la habitación, vacía.

## Mira tu propia página

Dos comandos. Lo que envías:

```bash
curl -s https://tusitio.com/pagina | wc -c
```

Y después lee lo que sobrevive a la extracción: pega la URL en [el analizador](/es) y mira el panel de Markdown, no la nota. La pregunta no es si el número es grande. Es si el texto que estás leyendo es el texto que querrías que un asistente citara sobre ti.

A casi todo el mundo le sorprenden dos cosas: lo poco que hay, y qué partes son las que han llegado.

## La versión corta

- Un agente ve tu HTML crudo, normalmente sin ejecutar JavaScript, y se queda con alrededor del 1%.
- Si tu contenido lo monta JavaScript, ese 1% puede ser exactamente nada.
- Que te bloqueen es raro. Estar vacío es lo habitual.
- El arreglo no es enviar menos marcado. Es asegurarte de que las palabras están en la respuesta.

[Analiza tu web](/es) · [¿Pueden leerte los asistentes de IA?](/es/blog/can-ai-read-your-site) · [Servir Markdown a los agentes](/es/blog/markdown-for-agents)
