
# Come verificare se ChatGPT, Claude e Perplexity riescono a leggere il tuo sito

Quando qualcuno chiede a un assistente della tua azienda succede una di due cose: o sa già qualcosa dai dati di addestramento, vecchi di mesi, oppure va sul tuo sito in quel momento e lo legge.

Il secondo caso è quello su cui puoi incidere, e sono tre le cose che decidono come va a finire.

## 1. Il tuo robots.txt li lascia entrare?

Le aziende di IA usano user-agent diversi per compiti diversi, e bloccarne uno non blocca gli altri. Questi sono quelli che contano oggi:

| User-agent | Azienda | Cosa fa |
|---|---|---|
| `GPTBot` | OpenAI | Scansiona per l'addestramento |
| `OAI-SearchBot` | OpenAI | Indicizza per la ricerca di ChatGPT |
| `ChatGPT-User` | OpenAI | Scarica una pagina perché un utente l'ha appena chiesto |
| `ClaudeBot` | Anthropic | Scansiona per l'addestramento |
| `Claude-SearchBot` | Anthropic | Indicizza per la ricerca |
| `Claude-User` | Anthropic | Scarica per conto di una persona |
| `PerplexityBot` | Perplexity | Indicizza per rispondere |
| `Perplexity-User` | Perplexity | Scarica su richiesta |
| `Google-Extended` | Google | Governa l'addestramento di Gemini, non il motore di ricerca |
| `Applebot-Extended` | Apple | Governa l'addestramento di Apple Intelligence |
| `CCBot` | Common Crawl | Alimenta molti altri dataset |
| `Bytespider` | ByteDance | Scansiona per l'addestramento |

La distinzione su cui quasi tutti inciampano: **gli agent che finiscono in «-User» non sono crawler**. Scaricano la pagina perché una persona ha appena fatto una domanda a riguardo, in quel secondo. Bloccare `GPTBot` ferma l'addestramento. Bloccare `ChatGPT-User` impedisce a un potenziale cliente di ottenere una risposta su di te. Quasi tutti i siti vogliono la prima cosa senza la seconda.

Guarda cosa stai servendo davvero:

```bash
curl -s https://iltuosito.com/robots.txt
```

Leggilo come lo leggerebbe un bot: un `Disallow: /` sotto `User-agent: *` blocca chiunque non abbia una regola propria, e quindi tutti quelli della tabella.

**Una trappola da conoscere.** Se sei dietro Cloudflare e non hai un robots.txt tuo, Cloudflare può servirne uno al posto tuo: la sua Content Signals Policy gestita. Riceverai un `200` e un file dall'aria perfettamente credibile che però non hai scritto tu, senza nessuna delle tue regole e senza la tua sitemap. È esattamente quello che è capitato a noi per mesi: il nostro server rispondeva `404` su `/robots.txt` e nessuno se ne accorgeva, perché ogni verifica riceveva un `200` dalla CDN. Per distinguerli, interroga direttamente l'origine:

```bash
curl -sI https://iltuosito.com/robots.txt | grep -i "server\|cf-cache-status"
```

## 2. Il tuo contenuto sopravvive senza JavaScript?

La maggior parte dei crawler IA non esegue JavaScript. Se la tua pagina si costruisce lato client, quello che ricevono è un guscio vuoto.

```bash
curl -s https://iltuosito.com/la-tua-pagina | wc -c
curl -s https://iltuosito.com/la-tua-pagina | grep -o "<p>" | wc -l
```

Qualche centinaio di byte e nessun paragrafo significa che per un crawler la pagina è vuota, per quanto bella sia nel browser. Rendering lato server, generazione statica o prerendering risolvono; quale dei tre conta poco.

## 3. Quanto resta dopo l'estrazione?

Anche una volta scaricata e renderizzata, la pagina viene sfoltita: navigazione, piè di pagina, banner dei cookie e quasi tutto il markup vengono buttati, e resta ciò che sembra contenuto. È quel resto a essere citato sul tuo conto.

È la parte che nessuno controlla, ed è di solito dove sta la sorpresa. Il modo più rapido di vederla è leggere la tua pagina come la terrebbe un agente: in testo semplice, senza impalcature. Se quel che resta sono due frasi e un elenco di voci di menu, non c'è robots.txt che tenga.

## Vale anche la pena avere

**`llms.txt`** nella radice: una breve mappa in Markdown delle tue pagine importanti. È una convenzione giovane, non uno standard che qualcuno sia tenuto a rispettare, ma costa pochissimo e viene letta.

**`Content-Signal`**, che ti permette di dire cosa si può fare del tuo contenuto — indicizzarlo per la ricerca, usarlo come base per una risposta, usarlo per addestrare — e non solo se può essere scaricato. Bloccare tutto non è l'unica opzione, e per la maggior parte delle aziende è quella sbagliata.

**HTML semantico pulito.** Titoli veri, `<article>`, `<main>`, testi alternativi. È lo stesso lavoro che aiuta gli screen reader, ed è ciò che fa sì che l'estrazione tenga le parti giuste.

## In breve

Esegui queste tre, in quest'ordine:

1. `curl -s https://iltuosito.com/robots.txt` — riescono a entrare?
2. `curl -s https://iltuosito.com/pagina | wc -c` — c'è qualcosa senza JavaScript?
3. Leggi ciò che sopravvive all'estrazione — è quello che vorresti veder citato?

Quasi tutti i siti passano la prima, falliscono la terza, e non lo scoprono mai.

[Analizza il tuo sito](/it) · [robots.txt per i bot IA](/it/tools/robots-txt-generator) · [I bot sono ammessi?](/it/tools/ai-crawlers-checker)
