Come verificare se ChatGPT, Claude e Perplexity riescono a leggere il tuo sito
Quando qualcuno chiede a un assistente della tua azienda succede una di due cose: o sa già qualcosa dai dati di addestramento, vecchi di mesi, oppure va sul tuo sito in quel momento e lo legge.
Il secondo caso è quello su cui puoi incidere, e sono tre le cose che decidono come va a finire.
1. Il tuo robots.txt li lascia entrare?
Le aziende di IA usano user-agent diversi per compiti diversi, e bloccarne uno non blocca gli altri. Questi sono quelli che contano oggi:
| User-agent | Azienda | Cosa fa |
|---|---|---|
GPTBot |
OpenAI | Scansiona per l'addestramento |
OAI-SearchBot |
OpenAI | Indicizza per la ricerca di ChatGPT |
ChatGPT-User |
OpenAI | Scarica una pagina perché un utente l'ha appena chiesto |
ClaudeBot |
Anthropic | Scansiona per l'addestramento |
Claude-SearchBot |
Anthropic | Indicizza per la ricerca |
Claude-User |
Anthropic | Scarica per conto di una persona |
PerplexityBot |
Perplexity | Indicizza per rispondere |
Perplexity-User |
Perplexity | Scarica su richiesta |
Google-Extended |
Governa l'addestramento di Gemini, non il motore di ricerca | |
Applebot-Extended |
Apple | Governa l'addestramento di Apple Intelligence |
CCBot |
Common Crawl | Alimenta molti altri dataset |
Bytespider |
ByteDance | Scansiona per l'addestramento |
La distinzione su cui quasi tutti inciampano: gli agent che finiscono in «-User» non sono crawler. Scaricano la pagina perché una persona ha appena fatto una domanda a riguardo, in quel secondo. Bloccare GPTBot ferma l'addestramento. Bloccare ChatGPT-User impedisce a un potenziale cliente di ottenere una risposta su di te. Quasi tutti i siti vogliono la prima cosa senza la seconda.
Guarda cosa stai servendo davvero:
curl -s https://iltuosito.com/robots.txt
Leggilo come lo leggerebbe un bot: un Disallow: / sotto User-agent: * blocca chiunque non abbia una regola propria, e quindi tutti quelli della tabella.
Una trappola da conoscere. Se sei dietro Cloudflare e non hai un robots.txt tuo, Cloudflare può servirne uno al posto tuo: la sua Content Signals Policy gestita. Riceverai un 200 e un file dall'aria perfettamente credibile che però non hai scritto tu, senza nessuna delle tue regole e senza la tua sitemap. È esattamente quello che è capitato a noi per mesi: il nostro server rispondeva 404 su /robots.txt e nessuno se ne accorgeva, perché ogni verifica riceveva un 200 dalla CDN. Per distinguerli, interroga direttamente l'origine:
curl -sI https://iltuosito.com/robots.txt | grep -i "server\|cf-cache-status"
2. Il tuo contenuto sopravvive senza JavaScript?
La maggior parte dei crawler IA non esegue JavaScript. Se la tua pagina si costruisce lato client, quello che ricevono è un guscio vuoto.
curl -s https://iltuosito.com/la-tua-pagina | wc -c
curl -s https://iltuosito.com/la-tua-pagina | grep -o "<p>" | wc -l
Qualche centinaio di byte e nessun paragrafo significa che per un crawler la pagina è vuota, per quanto bella sia nel browser. Rendering lato server, generazione statica o prerendering risolvono; quale dei tre conta poco.
3. Quanto resta dopo l'estrazione?
Anche una volta scaricata e renderizzata, la pagina viene sfoltita: navigazione, piè di pagina, banner dei cookie e quasi tutto il markup vengono buttati, e resta ciò che sembra contenuto. È quel resto a essere citato sul tuo conto.
È la parte che nessuno controlla, ed è di solito dove sta la sorpresa. Il modo più rapido di vederla è leggere la tua pagina come la terrebbe un agente: in testo semplice, senza impalcature. Se quel che resta sono due frasi e un elenco di voci di menu, non c'è robots.txt che tenga.
Vale anche la pena avere
llms.txt nella radice: una breve mappa in Markdown delle tue pagine importanti. È una convenzione giovane, non uno standard che qualcuno sia tenuto a rispettare, ma costa pochissimo e viene letta.
Content-Signal, che ti permette di dire cosa si può fare del tuo contenuto — indicizzarlo per la ricerca, usarlo come base per una risposta, usarlo per addestrare — e non solo se può essere scaricato. Bloccare tutto non è l'unica opzione, e per la maggior parte delle aziende è quella sbagliata.
HTML semantico pulito. Titoli veri, <article>, <main>, testi alternativi. È lo stesso lavoro che aiuta gli screen reader, ed è ciò che fa sì che l'estrazione tenga le parti giuste.
In breve
Esegui queste tre, in quest'ordine:
curl -s https://iltuosito.com/robots.txt— riescono a entrare?curl -s https://iltuosito.com/pagina | wc -c— c'è qualcosa senza JavaScript?- Leggi ciò che sopravvive all'estrazione — è quello che vorresti veder citato?
Quasi tutti i siti passano la prima, falliscono la terza, e non lo scoprono mai.
Analizza il tuo sito · robots.txt per i bot IA · I bot sono ammessi?