Como saber se o ChatGPT, o Claude e o Perplexity conseguem ler o teu site
Quando alguém pergunta a um assistente sobre a tua empresa acontece uma de duas coisas: ou ele já sabe algo pelos dados de treino, com meses de atraso, ou vai ao teu site naquele momento e lê-o.
O segundo caso é aquele que podes influenciar, e há três coisas que decidem como corre.
1. O teu robots.txt deixa-os entrar?
As empresas de IA usam user-agents diferentes para tarefas diferentes, e bloquear um não bloqueia os outros. Estes são os que contam hoje:
| User-agent | Empresa | O que faz |
|---|---|---|
GPTBot |
OpenAI | Rastreia para treino |
OAI-SearchBot |
OpenAI | Indexa para a pesquisa do ChatGPT |
ChatGPT-User |
OpenAI | Vai buscar uma página porque alguém pediu agora |
ClaudeBot |
Anthropic | Rastreia para treino |
Claude-SearchBot |
Anthropic | Indexa para pesquisa |
Claude-User |
Anthropic | Vai buscar a pedido de uma pessoa |
PerplexityBot |
Perplexity | Indexa para responder |
Perplexity-User |
Perplexity | Vai buscar a pedido |
Google-Extended |
Controla o treino do Gemini, não o motor de busca | |
Applebot-Extended |
Apple | Controla o treino da Apple Intelligence |
CCBot |
Common Crawl | Alimenta muitos outros conjuntos de dados |
Bytespider |
ByteDance | Rastreia para treino |
A distinção em que quase toda a gente tropeça: os agentes terminados em «-User» não são rastreadores. Vão buscar a página porque uma pessoa acabou de perguntar sobre ela, naquele segundo. Bloquear o GPTBot trava o treino. Bloquear o ChatGPT-User impede que um potencial cliente obtenha uma resposta sobre ti. A maioria dos sites quer o primeiro sem o segundo.
Vê o que estás mesmo a servir:
curl -s https://oteusite.com/robots.txt
Lê-o como o leria um bot: um Disallow: / sob User-agent: * bloqueia todos os que não têm regra própria, e isso inclui todos os da tabela.
Uma armadilha que convém conhecer. Se estás atrás da Cloudflare e não tens robots.txt próprio, a Cloudflare pode servir um por ti: a Content Signals Policy gerida. Vais receber um 200 e um ficheiro com todo o ar de estar certo que tu não escreveste, sem nenhuma das tuas regras e sem o teu sitemap. Foi exatamente o que nos aconteceu durante meses: o nosso servidor devolvia 404 em /robots.txt e ninguém reparou, porque qualquer verificação recebia um 200 da CDN. Para os distinguir, pergunta diretamente à tua origem:
curl -sI https://oteusite.com/robots.txt | grep -i "server\|cf-cache-status"
2. O teu conteúdo sobrevive sem JavaScript?
A maioria dos rastreadores de IA não executa JavaScript. Se a tua página é montada no cliente, o que eles recebem é uma casca vazia.
curl -s https://oteusite.com/a-tua-pagina | wc -c
curl -s https://oteusite.com/a-tua-pagina | grep -o "<p>" | wc -l
Umas centenas de bytes e nenhum parágrafo querem dizer que a página está vazia para um rastreador, por melhor que se veja no navegador. Renderização no servidor, geração estática ou prerender resolvem; qual das três é quase indiferente.
3. Quanto sobra depois da extração?
Mesmo descarregada e renderizada, a página é desbastada: navegação, rodapé, aviso de cookies e quase toda a marcação vão fora, e fica o que parece conteúdo. É esse resto que acaba citado sobre ti.
É a parte que ninguém verifica, e costuma ser onde está a surpresa. A forma mais rápida de ver é ler a tua página tal como um agente a guardaria: em texto simples, sem andaimes. Se o que sobra são duas frases e uma lista de opções de menu, não há afinação de robots.txt que salve.
Além disso, convém ter
llms.txt na raiz: um mapa curto em Markdown das tuas páginas importantes. É uma convenção recente, não uma norma que alguém seja obrigado a cumprir, mas custa pouquíssimo e é lida.
Content-Signal, que te deixa dizer o que se pode fazer com o teu conteúdo — indexá-lo para pesquisa, usá-lo como base de uma resposta, usá-lo para treinar — em vez de apenas se pode ou não ser descarregado. Bloquear tudo não é a única opção e, para a maioria dos negócios, é a errada.
HTML semântico limpo. Cabeçalhos a sério, <article>, <main>, textos alternativos. É o mesmo trabalho que ajuda os leitores de ecrã, e é o que faz a extração ficar com as partes certas.
Resumindo
Corre estas três, por esta ordem:
curl -s https://oteusite.com/robots.txt— conseguem entrar?curl -s https://oteusite.com/pagina | wc -c— há alguma coisa sem JavaScript?- Lê o que sobrevive à extração — é aquilo que gostarias de ver citado?
A maioria dos sites passa na primeira, falha na terceira, e nunca chega a saber.
Analisa o teu site · robots.txt para bots de IA · Os bots estão autorizados?