
# Comment vérifier si ChatGPT, Claude et Perplexity peuvent lire votre site

Quand quelqu'un interroge un assistant sur votre entreprise, deux choses peuvent se produire : soit il sait déjà quelque chose grâce à ses données d'entraînement, vieilles de plusieurs mois, soit il va chercher votre site sur-le-champ et le lit.

C'est le second cas que vous pouvez influencer, et trois éléments décident du résultat.

## 1. Votre robots.txt les laisse-t-il entrer ?

Les entreprises d'IA utilisent des user-agents distincts pour des tâches distinctes, et en bloquer un n'en bloque aucun autre. Voici ceux qui comptent aujourd'hui :

| User-agent | Entreprise | Rôle |
|---|---|---|
| `GPTBot` | OpenAI | Explore pour l'entraînement |
| `OAI-SearchBot` | OpenAI | Indexe pour la recherche ChatGPT |
| `ChatGPT-User` | OpenAI | Récupère une page parce qu'un utilisateur le demande maintenant |
| `ClaudeBot` | Anthropic | Explore pour l'entraînement |
| `Claude-SearchBot` | Anthropic | Indexe pour la recherche |
| `Claude-User` | Anthropic | Récupère à la demande d'une personne |
| `PerplexityBot` | Perplexity | Indexe pour répondre |
| `Perplexity-User` | Perplexity | Récupère à la demande |
| `Google-Extended` | Google | Contrôle l'entraînement de Gemini, pas le moteur de recherche |
| `Applebot-Extended` | Apple | Contrôle l'entraînement d'Apple Intelligence |
| `CCBot` | Common Crawl | Alimente de nombreux autres jeux de données |
| `Bytespider` | ByteDance | Explore pour l'entraînement |

La distinction qui piège tout le monde : **les agents en « -User » ne sont pas des robots d'exploration**. Ils récupèrent la page parce qu'une personne vient de poser une question à son sujet, à la seconde près. Bloquer `GPTBot` empêche l'entraînement. Bloquer `ChatGPT-User` empêche un client potentiel d'obtenir une réponse sur vous. La plupart des sites veulent le premier sans le second.

Regardez ce que vous servez réellement :

```bash
curl -s https://votresite.com/robots.txt
```

Lisez-le comme le ferait un robot : un `Disallow: /` sous `User-agent: *` bloque tous ceux qui n'ont pas de règle propre, donc tous ceux du tableau.

**Un piège à connaître.** Si vous êtes derrière Cloudflare sans robots.txt à vous, Cloudflare peut en servir un à votre place : sa Content Signals Policy gérée. Vous obtiendrez un `200` et un fichier tout à fait crédible que vous n'avez pas écrit, sans aucune de vos règles ni votre sitemap. Nous avons vécu exactement cela pendant des mois : notre serveur renvoyait `404` sur `/robots.txt` sans que personne le remarque, puisque chaque vérification recevait un `200` venu du CDN. Pour les distinguer, interrogez directement votre origine :

```bash
curl -sI https://votresite.com/robots.txt | grep -i "server\|cf-cache-status"
```

## 2. Votre contenu survit-il sans JavaScript ?

La plupart des robots d'IA n'exécutent pas JavaScript. Si votre page se construit côté client, ils reçoivent une coquille vide.

```bash
curl -s https://votresite.com/votre-page | wc -c
curl -s https://votresite.com/votre-page | grep -o "<p>" | wc -l
```

Quelques centaines d'octets et aucun paragraphe : la page est vide pour un robot, aussi belle soit-elle dans un navigateur. Rendu côté serveur, génération statique ou prérendu corrigent le problème ; lequel importe peu.

## 3. Que reste-t-il après extraction ?

Même récupérée et rendue, la page passe à la moulinette : navigation, pied de page, bandeau cookies et presque tout le balisage sont jetés, et il reste ce qui ressemble à du contenu. Ce reste, c'est ce qui sera cité à votre sujet.

Personne ne vérifie cette partie, et c'est là que se trouve la surprise. Le plus rapide est de lire votre page telle qu'un agent la conserverait : en texte brut, sans échafaudage. S'il ne reste que deux phrases et une liste d'entrées de menu, aucun réglage de robots.txt n'y changera quoi que ce soit.

## À avoir également

**`llms.txt`** à la racine : une courte carte en Markdown de vos pages importantes. C'est une convention récente, pas une norme que quiconque est tenu de respecter, mais elle ne coûte presque rien et elle est lue.

**`Content-Signal`**, qui permet de dire ce qu'on peut faire de votre contenu — l'indexer pour la recherche, s'en servir pour composer une réponse, l'utiliser pour entraîner — et pas seulement s'il peut être récupéré. Tout bloquer n'est pas la seule option, et pour la plupart des entreprises c'est la mauvaise.

**Du HTML sémantique propre.** De vrais titres, `<article>`, `<main>`, des textes alternatifs. C'est le même travail que celui qui aide les lecteurs d'écran, et c'est ce qui fait que l'extraction garde les bonnes parties.

## En bref

Lancez ces trois commandes, dans cet ordre :

1. `curl -s https://votresite.com/robots.txt` — peuvent-ils entrer ?
2. `curl -s https://votresite.com/page | wc -c` — y a-t-il quelque chose sans JavaScript ?
3. Lisez ce qui survit à l'extraction — est-ce ce que vous voudriez voir cité ?

La plupart des sites réussissent la première, échouent à la troisième, et ne l'apprennent jamais.

[Analyser votre site](/fr) · [robots.txt pour les IA](/fr/tools/robots-txt-generator) · [Les robots sont-ils autorisés ?](/fr/tools/ai-crawlers-checker)
