Preguntas Frecuentes
Todo lo que necesitas saber sobre preparación para IA, llms.txt y cómo hacer que tu sitio web funcione con AI agents.
Fundamentos de AI-Readiness
AI-readiness mide lo bien que el contenido de tu sitio web puede ser comprendido, extraído y utilizado por AI agents como ChatGPT, Claude y Perplexity. A medida que las herramientas impulsadas por IA se convierten en una fuente importante de tráfico web, los sitios preparados para IA se citan con más precisión, aparecen más a menudo en las respuestas generadas por IA y cuestan menos tokens de procesar.
A diferencia de los navegadores web que renderizan HTML visualmente, los AI agents necesitan extraer el contenido de texto de tus páginas. Prefieren contenido limpio y bien estructurado frente a HTML complejo con estilos pesados. Una página bien estructurada convertida a Markdown usa un 70-80% menos de tokens que el HTML sin procesar, haciéndola más barata y eficiente para los proveedores de IA.
Los principales crawlers de IA incluyen GPTBot (OpenAI/ChatGPT), ClaudeBot (Anthropic/Claude), PerplexityBot (Perplexity), Google-Extended (Google Gemini), Bytespider (ByteDance), CCBot (Common Crawl) y muchos más. Nuevos AI agents aparecen regularmente a medida que el ecosistema crece.
llms.txt
llms.txt es un estándar emergente (definido en llmstxt.org) que ayuda a los AI agents a comprender la estructura de tu sitio web. Similar a cómo robots.txt guía a los crawlers de motores de búsqueda, llms.txt proporciona un resumen en formato Markdown de tu sitio con enlaces a páginas clave, facilitando a los AI agents la navegación por tu contenido.
llms.txt es un índice conciso con una descripción y enlaces a las páginas principales de tu sitio. llms-full.txt es una versión extendida que incluye el contenido real de esas páginas en línea, dando a los AI agents todo en un solo archivo sin necesidad de seguir enlaces. Usa llms.txt como mínimo, y llms-full.txt para una cobertura completa.
Crea un archivo de texto en la raíz de tu dominio (por ejemplo, ejemplo.com/llms.txt) siguiendo la especificación de llmstxt.org. Empieza con un encabezado # (el nombre de tu sitio), añade una descripción en cita, y luego lista los enlaces organizados en secciones como ## Documentation y ## Main. AgentReady puede generar un llms.txt recomendado basándose en el análisis de tu página.
Markdown para IA
Markdown es el formato preferido por los AI agents porque preserva la estructura del contenido (encabezados, listas, enlaces, énfasis) eliminando el ruido del marcado visual (CSS, JavaScript, divs de layout). Una versión en Markdown de tu contenido usa significativamente menos tokens, haciéndola más rápida y barata de procesar para los sistemas de IA.
La negociación de contenido permite que tu servidor sirva diferentes formatos de la misma página según la cabecera Accept del cliente. Cuando un AI agent envía Accept: text/markdown, tu servidor puede responder con una versión en Markdown en lugar de HTML. Es la forma más eficiente de servir contenido optimizado para IA sin crear URLs separadas.
Hay dos enfoques principales: (1) Añadir lógica en el servidor para detectar cabeceras Accept: text/markdown y devolver contenido en Markdown; (2) Crear archivos .md junto a tus páginas (por ejemplo, /about.md para /about) y enlazarlos desde tu llms.txt. AgentReady usa ambos enfoques para sus propias páginas.
Datos Estructurados y JSON-LD
JSON-LD (JavaScript Object Notation for Linked Data) es una forma de incrustar datos estructurados en tus páginas usando el vocabulario Schema.org. Los AI agents usan estos datos para extraer información factual y legible por máquinas como detalles de productos, metadatos de artículos, información de organizaciones y más, sin necesidad de analizar tu HTML.
Usa el tipo más específico que coincida con tu contenido: Article o BlogPosting para artículos, Product para páginas de productos, Organization para páginas de empresa, FAQPage para páginas de FAQ, LocalBusiness para negocios locales y WebApplication para herramientas web. Incluye siempre name, description y las propiedades relevantes para el tipo elegido.
Las etiquetas Open Graph (og:title, og:description, og:image) proporcionan metadatos estandarizados que tanto las plataformas sociales como los AI agents utilizan para comprender el título, la descripción y la imagen principal de tu página. Son fáciles de implementar y sirven como respaldo fiable cuando faltan otros datos estructurados.
robots.txt y Bots de IA
robots.txt controla qué bots pueden acceder a tu sitio y qué páginas pueden rastrear. Los crawlers de IA como GPTBot y ClaudeBot respetan las directivas de robots.txt. Si tu robots.txt bloquea estos bots, no podrán indexar tu contenido, lo que significa que tu sitio no aparecerá en las respuestas generadas por IA.
Para maximizar la visibilidad en respuestas generadas por IA, permite al menos: GPTBot (OpenAI), ClaudeBot y Claude-Web (Anthropic), PerplexityBot (Perplexity) y Google-Extended (Google Gemini). Puedes añadir reglas Allow específicas para estos user agents manteniendo tus reglas existentes para otros bots.
Content-Signal es una cabecera HTTP que indica a los AI agents cómo pueden usar tu contenido. Por ejemplo: Content-Signal: ai-train=yes, search=yes, ai-input=yes indica que tu contenido puede usarse para entrenamiento de IA, indexación de búsqueda y como entrada para respuestas de IA. Es un estándar más reciente que da a los editores control explícito sobre el uso de IA.
Puntuación de AgentReady
AgentReady obtiene tu página, extrae el contenido y ejecuta 23 comprobaciones individuales en 5 dimensiones ponderadas. Cada comprobación puntua de 0 a 100, y las dimensiones se combinan en una puntuación global de 0 a 100. Obtienes una calificación (A-F), un desglose detallado y recomendaciones priorizadas para mejorar tu puntuación.
Las 5 dimensiones son: HTML Semántico (15%) — uso adecuado de article, main, encabezados y elementos semánticos; Eficiencia del Contenido (10%) — ratio de reducción de tokens y ratio contenido-ruido; Visibilidad para IA (25%) — llms.txt, robots.txt, sitemap y negociación de markdown; Datos Estructurados (20%) — Schema.org, Open Graph y meta tags; Accesibilidad (30%) — contenido sin JavaScript, tamaño de página y posición del contenido.
¡Sí! El análisis de una página es completamente gratuito y sin registro. Obtienes la puntuación completa, recomendaciones, conversión a Markdown y vista previa de llms.txt. Actualmente estamos en beta con un límite de 5 análisis por hora. Las funciones de rastreo de dominio completo y monitorización estarán disponibles próximamente.
Qué hemos cambiado
Comprobamos 18 rastreadores, y cada uno enlaza a la documentación oficial de su fabricante. En julio de 2026 rehicimos la lista. Retiramos tres: Claude-Web y FacebookBot ya no aparecen en la documentación de Anthropic ni de Meta, y cohere-ai nunca estuvo documentado — estábamos recomendando nombrar bots que no existen. También añadimos los que faltaban, entre ellos OAI-SearchBot, el rastreador que de verdad mete tu web en los resultados de búsqueda de ChatGPT. Por ahí circulan listas de terceros con user-agents inventados (los de xAI/Grok son un caso conocido). Aquí solo aparece un bot si su fabricante lo documenta.
No — y esta distinción es lo más útil de esta página. Los fabricantes separan sus rastreadores por finalidad. Los de entrenamiento (GPTBot, ClaudeBot, Google-Extended) leen tus páginas para entrenar modelos: bloquearlos no te cuesta ni un gramo de visibilidad. Los de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) construyen el índice del que el asistente cita: bloquea uno y desapareces de ese asistente. Los de usuario (ChatGPT-User, Claude-User) piden una página porque una persona la está pidiendo ahora mismo. Puedes negarte al entrenamiento y seguir siendo citado en todas partes — pero solo si permites los de búsqueda. Ahora etiquetamos cada rastreador por tipo para que elijas a conciencia en vez de bloquearlo todo con un comodín.
El agent card de A2A va en /.well-known/agent-card.json. Se movió ahí en A2A v0.3.0 (agosto de 2025) y v1.0 lo mantiene; /.well-known/agent.json es un alias obsoleto que los SDK siguen sirviendo por compatibilidad. Nosotros comprobábamos — y generábamos — la ruta vieja, lo que significaba publicar un descriptor donde los agentes actuales no miran. Ya está corregido. Con MCP la respuesta honesta es que no hay ruta estándar: la especificación de MCP no define ningún fichero well-known de descubrimiento, y los server cards siguen siendo un borrador abierto (SEP-1649) que propone /.well-known/mcp/server-card.json. Sondeamos esa y también la convención antigua mcp.json, y las etiquetamos como borrador en vez de fingir lo contrario. Lo que la especificación de MCP sí exige es /.well-known/oauth-protected-resource (RFC 9728) — ahora lo comprobamos.
Porque la rúbrica premiaba lo fácil de comprobar y no lo que podemos demostrar que importa. llms.txt —una propuesta que ningún proveedor grande se ha comprometido a implementar— pesaba más que Schema.org, que todos los asistentes sí interpretan. La rúbrica v2 obliga a cada una de las 23 comprobaciones a declarar su evidencia: probada (el proveedor documenta que lo lee), plausible (práctica web asentada, pero sin declaración del proveedor sobre IA) o especulativa (una apuesta razonable, nada más). Los pesos siguen esa clasificación: lo probado suma ahora 32 de los 100 puntos, lo plausible 51 y lo especulativo 17. Seguimos comprobando llms.txt —publicarlo no cuesta nada y puede acabar importando— pero ya no pesa más que las señales que sí funcionan de forma demostrable. Cada resultado registra la versión de rúbrica que lo produjo, así que un score antiguo se puede leer con las reglas con las que se midió.
Ahora lo medimos, y al hacerlo destapamos un agujero en nuestro propio scoring. El resto de comprobaciones leen una declaración: tu robots.txt dice que los crawlers pueden pasar, así que dábamos los puntos. Pero robots.txt lo sirve tu origen, y la petición nunca llega hasta ahí: tu CDN o WAF responde antes, y no tiene por qué estar de acuerdo. Cloudflare empezó a bloquear crawlers de IA por defecto en el borde el 15 de septiembre de 2026. Un sitio podía publicar un robots.txt impecable, estar cerrado a todos los asistentes y sacar la nota máxima con nosotros. Así que dejamos de leer y empezamos a medir: pedimos tu página como cliente normal, la pedimos otra vez identificándonos como OAI-SearchBot y comparamos. Lo que podemos demostrar tiene límites, y preferimos decirlo a afirmar de más. Nuestra sonda sale de nuestros servidores, y los bordes verifican a los crawlers por dirección IP, no por nombre: un rechazo puede ir dirigido a los suplantadores mientras el crawler verificado sí pasa. Informamos exactamente de lo que vimos y te señalamos tus reglas de bots. No te decimos que estás bloqueado en ChatGPT, porque desde fuera eso no lo podemos saber.