Questions Fréquentes

Tout ce que vous devez savoir sur la préparation IA, llms.txt et comment faire fonctionner votre site web avec les AI agents.

Fondamentaux de l’AI-Readiness

L’AI-readiness mesure la capacité du contenu de votre site web à être compris, extrait et utilisé par des AI agents comme ChatGPT, Claude et Perplexity. À mesure que les outils alimentés par l’IA deviennent une source majeure de trafic web, les sites préparés pour l’IA sont cités plus précisément, apparaissent plus souvent dans les réponses générées par l’IA et coûtent moins de tokens à traiter.

Contrairement aux navigateurs web qui affichent le HTML visuellement, les AI agents doivent extraire le contenu textuel de vos pages. Ils préfèrent un contenu propre et bien structuré plutôt qu’un HTML complexe avec des styles lourds. Une page bien structurée convertie en Markdown utilise 70-80 % moins de tokens que le HTML brut, la rendant moins coûteuse et plus efficace pour les fournisseurs d’IA.

Les principaux crawlers IA incluent GPTBot (OpenAI/ChatGPT), ClaudeBot (Anthropic/Claude), PerplexityBot (Perplexity), Google-Extended (Google Gemini), Bytespider (ByteDance), CCBot (Common Crawl) et bien d’autres. De nouveaux AI agents apparaissent régulièrement à mesure que l’écosystème se développe.

llms.txt

llms.txt est un standard émergent (défini sur llmstxt.org) qui aide les AI agents à comprendre la structure de votre site web. À l’image de robots.txt qui guide les crawlers des moteurs de recherche, llms.txt fournit un aperçu au format Markdown de votre site avec des liens vers les pages clés, facilitant la navigation des AI agents dans votre contenu.

llms.txt est un index concis avec une description et des liens vers les pages principales de votre site. llms-full.txt est une version étendue qui inclut le contenu réel de ces pages en ligne, donnant aux AI agents tout dans un seul fichier sans avoir à suivre de liens. Utilisez llms.txt au minimum, et llms-full.txt pour une couverture complète.

Créez un fichier texte à la racine de votre domaine (par ex. exemple.com/llms.txt) en suivant la spécification llmstxt.org. Commencez par un titre # (le nom de votre site), ajoutez une description en citation, puis listez les liens organisés en sections comme ## Documentation et ## Main. AgentReady peut générer un llms.txt recommandé basé sur l’analyse de votre page.

Markdown pour l’IA

Le Markdown est le format préféré des AI agents car il préserve la structure du contenu (titres, listes, liens, emphase) tout en éliminant le bruit du balisage visuel (CSS, JavaScript, divs de mise en page). Une version Markdown de votre contenu utilise nettement moins de tokens, la rendant plus rapide et moins coûteuse à traiter pour les systèmes d’IA.

La négociation de contenu permet à votre serveur de servir différents formats d’une même page en fonction de l’en-tête Accept du client. Quand un AI agent envoie Accept: text/markdown, votre serveur peut répondre avec une version Markdown au lieu du HTML. C’est le moyen le plus efficace de servir du contenu optimisé pour l’IA sans créer d’URLs séparées.

Il existe deux approches principales : (1) Ajouter une logique serveur pour détecter les en-têtes Accept: text/markdown et retourner du contenu Markdown ; (2) Créer des fichiers .md à côté de vos pages (par ex. /about.md pour /about) et les référencer depuis votre llms.txt. AgentReady utilise les deux approches pour ses propres pages.

Données structurées et JSON-LD

JSON-LD (JavaScript Object Notation for Linked Data) est un moyen d’intégrer des données structurées dans vos pages en utilisant le vocabulaire Schema.org. Les AI agents utilisent ces données pour extraire des informations factuelles et lisibles par machine comme les détails de produits, les métadonnées d’articles, les informations d’organisations et plus encore — sans avoir à analyser votre HTML.

Utilisez le type le plus spécifique correspondant à votre contenu : Article ou BlogPosting pour les articles, Product pour les pages produits, Organization pour les pages d’entreprise, FAQPage pour les pages FAQ, LocalBusiness pour les commerces locaux et WebApplication pour les outils web. Incluez toujours name, description et les propriétés pertinentes pour le type choisi.

Les balises Open Graph (og:title, og:description, og:image) fournissent des métadonnées standardisées que les plateformes sociales et les AI agents utilisent pour comprendre le titre, la description et l’image principale de votre page. Elles sont faciles à implémenter et servent de solution de repli fiable quand d’autres données structurées manquent.

robots.txt et bots IA

robots.txt contrôle quels bots peuvent accéder à votre site et quelles pages ils peuvent explorer. Les crawlers IA comme GPTBot et ClaudeBot respectent les directives de robots.txt. Si votre robots.txt bloque ces bots, ils ne pourront pas indexer votre contenu, ce qui signifie que votre site n’apparaîtra pas dans les réponses générées par l’IA.

Pour maximiser la visibilité dans les réponses générées par l’IA, autorisez au minimum : GPTBot (OpenAI), ClaudeBot et Claude-Web (Anthropic), PerplexityBot (Perplexity) et Google-Extended (Google Gemini). Vous pouvez ajouter des règles Allow spécifiques pour ces user agents tout en conservant vos règles existantes pour les autres bots.

Content-Signal est un en-tête HTTP qui indique aux AI agents comment ils peuvent utiliser votre contenu. Par exemple : Content-Signal: ai-train=yes, search=yes, ai-input=yes signale que votre contenu peut être utilisé pour l’entraînement IA, l’indexation de recherche et comme entrée pour les réponses IA. C’est un standard plus récent qui donne aux éditeurs un contrôle explicite sur l’utilisation par l’IA.

Notation AgentReady

AgentReady récupère votre page, extrait le contenu et exécute 23 vérifications individuelles réparties sur 5 dimensions pondérées. Chaque vérification note de 0 à 100, et les dimensions sont combinées en un score global de 0 à 100. Vous obtenez une note (A-F), un détail complet et des recommandations prioritaires pour améliorer votre score.

Les 5 dimensions sont : HTML Sémantique (15 %) — utilisation correcte d’article, main, titres et éléments sémantiques ; Efficacité du Contenu (10 %) — ratio de réduction de tokens et ratio contenu/bruit ; Visibilité IA (25 %) — llms.txt, robots.txt, sitemap et négociation Markdown ; Données Structurées (20 %) — Schema.org, Open Graph et balises meta ; Accessibilité (30 %) — contenu sans JavaScript, taille de page et position du contenu.

Oui ! L’analyse d’une page est entièrement gratuite et sans inscription. Vous obtenez le score complet, les recommandations, la conversion Markdown et l’aperçu llms.txt. Nous sommes actuellement en bêta avec une limite de 5 analyses par heure. Les fonctionnalités d’exploration de domaine complet et de surveillance arrivent bientôt.

Ce qui a changé

Nous vérifions 18 robots d'exploration, et chacun renvoie à la documentation officielle de son éditeur. En juillet 2026 nous avons refait la liste. Trois entrées ont été retirées : Claude-Web et FacebookBot ne figurent plus dans la documentation d'Anthropic ni de Meta, et cohere-ai n'a jamais été documenté — nous conseillions donc de nommer des bots qui n'existent pas. Nous avons aussi ajouté ceux qui manquaient, dont OAI-SearchBot, le robot qui place réellement votre site dans les résultats de recherche de ChatGPT. Des listes tierces font circuler des user-agents inventés (ceux de xAI/Grok en sont un cas connu). Ici, un bot n'apparaît que si son éditeur le documente.

Non — et cette distinction est ce qu'il y a de plus utile sur cette page. Les éditeurs séparent leurs robots par finalité. Les robots d'entraînement (GPTBot, ClaudeBot, Google-Extended) lisent vos pages pour entraîner des modèles : les bloquer ne vous coûte aucune visibilité. Les robots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) construisent l'index que l'assistant cite : bloquez-en un et vous disparaissez de cet assistant. Les robots utilisateur (ChatGPT-User, Claude-User) récupèrent une page parce qu'une personne la demande à l'instant. Vous pouvez refuser l'entraînement et rester cité partout — mais seulement si vous autorisez les robots de recherche. Nous étiquetons désormais chaque robot par type pour que vous choisissiez sciemment plutôt que de tout bloquer d'un joker.

La carte d'agent A2A se place à /.well-known/agent-card.json. Elle y a été déplacée dans A2A v0.3.0 (août 2025) et v1.0 le conserve ; /.well-known/agent.json est un alias obsolète que les SDK servent encore pour les anciens clients. Nous vérifiions — et générions — l'ancien chemin, ce qui revenait à publier un descripteur là où les agents actuels ne regardent pas. C'est corrigé. Pour MCP, la réponse honnête est qu'il n'existe aucun chemin standard : la spécification MCP ne définit aucun fichier well-known de découverte, et les cartes de serveur restent un brouillon ouvert (SEP-1649) qui propose /.well-known/mcp/server-card.json. Nous sondons ce chemin ainsi que l'ancienne convention mcp.json, et nous les étiquetons comme brouillon plutôt que de prétendre le contraire. Ce que la spécification MCP exige bel et bien, c'est /.well-known/oauth-protected-resource (RFC 9728) — nous le vérifions désormais.

Parce que la grille récompensait ce qui est facile à vérifier plutôt que ce dont nous pouvons démontrer l'importance. llms.txt — une proposition qu'aucun grand fournisseur ne s'est engagé à implémenter — pesait plus lourd que Schema.org, que tous les assistants analysent réellement. La grille v2 oblige chacune des 23 vérifications à déclarer son niveau de preuve : prouvé (le fournisseur documente qu'il le lit), plausible (pratique web bien établie, mais aucune déclaration du fournisseur sur l'IA) ou spéculatif (un pari raisonnable, rien de plus). Les pondérations suivent : le prouvé représente désormais 32 des 100 points, le plausible 51 et le spéculatif 17. Nous vérifions toujours llms.txt — le publier ne coûte rien et cela pourrait finir par compter — mais il ne prime plus sur les signaux dont l'effet est démontré. Chaque résultat enregistre la version de grille qui l'a produit : un ancien score peut donc être lu avec les règles qui l'ont mesuré.

Nous le mesurons désormais, et cela a révélé un trou dans notre propre notation. Toutes les autres vérifications lisent une déclaration : votre robots.txt dit que les crawlers peuvent passer, donc nous accordions les points. Mais le robots.txt est servi par votre origine, et la requête n'y parvient jamais — votre CDN ou WAF répond d'abord, et il n'est pas tenu d'être d'accord. Cloudflare a commencé à bloquer les crawlers d'IA par défaut en périphérie le 15 septembre 2026. Un site pouvait publier un robots.txt irréprochable, être fermé à tous les assistants, et obtenir la note maximale chez nous. Nous avons donc cessé de lire pour mesurer : nous demandons votre page en tant que client ordinaire, puis à nouveau en nous annonçant comme OAI-SearchBot, et nous comparons. Ce que nous pouvons prouver a des limites, et nous préférons le dire plutôt que d'en affirmer trop. Notre sonde part de nos serveurs, et les périphéries vérifient les crawlers par adresse IP, non par nom : un refus peut viser les usurpateurs tandis que le crawler vérifié passe. Nous rapportons exactement ce que nous avons vu et vous orientons vers vos règles de bots. Nous ne vous disons pas que vous êtes bloqué sur ChatGPT, car de l'extérieur nous ne pouvons pas le savoir.

Ressources utiles