Como saber se o ChatGPT, o Claude e o Perplexity conseguem ler o teu site

Quando alguém pergunta a um assistente sobre a tua empresa acontece uma de duas coisas: ou ele já sabe algo pelos dados de treino, com meses de atraso, ou vai ao teu site naquele momento e lê-o.

O segundo caso é aquele que podes influenciar, e há três coisas que decidem como corre.

1. O teu robots.txt deixa-os entrar?

As empresas de IA usam user-agents diferentes para tarefas diferentes, e bloquear um não bloqueia os outros. Estes são os que contam hoje:

User-agent Empresa O que faz
GPTBot OpenAI Rastreia para treino
OAI-SearchBot OpenAI Indexa para a pesquisa do ChatGPT
ChatGPT-User OpenAI Vai buscar uma página porque alguém pediu agora
ClaudeBot Anthropic Rastreia para treino
Claude-SearchBot Anthropic Indexa para pesquisa
Claude-User Anthropic Vai buscar a pedido de uma pessoa
PerplexityBot Perplexity Indexa para responder
Perplexity-User Perplexity Vai buscar a pedido
Google-Extended Google Controla o treino do Gemini, não o motor de busca
Applebot-Extended Apple Controla o treino da Apple Intelligence
CCBot Common Crawl Alimenta muitos outros conjuntos de dados
Bytespider ByteDance Rastreia para treino

A distinção em que quase toda a gente tropeça: os agentes terminados em «-User» não são rastreadores. Vão buscar a página porque uma pessoa acabou de perguntar sobre ela, naquele segundo. Bloquear o GPTBot trava o treino. Bloquear o ChatGPT-User impede que um potencial cliente obtenha uma resposta sobre ti. A maioria dos sites quer o primeiro sem o segundo.

Vê o que estás mesmo a servir:

curl -s https://oteusite.com/robots.txt

Lê-o como o leria um bot: um Disallow: / sob User-agent: * bloqueia todos os que não têm regra própria, e isso inclui todos os da tabela.

Uma armadilha que convém conhecer. Se estás atrás da Cloudflare e não tens robots.txt próprio, a Cloudflare pode servir um por ti: a Content Signals Policy gerida. Vais receber um 200 e um ficheiro com todo o ar de estar certo que tu não escreveste, sem nenhuma das tuas regras e sem o teu sitemap. Foi exatamente o que nos aconteceu durante meses: o nosso servidor devolvia 404 em /robots.txt e ninguém reparou, porque qualquer verificação recebia um 200 da CDN. Para os distinguir, pergunta diretamente à tua origem:

curl -sI https://oteusite.com/robots.txt | grep -i "server\|cf-cache-status"

2. O teu conteúdo sobrevive sem JavaScript?

A maioria dos rastreadores de IA não executa JavaScript. Se a tua página é montada no cliente, o que eles recebem é uma casca vazia.

curl -s https://oteusite.com/a-tua-pagina | wc -c
curl -s https://oteusite.com/a-tua-pagina | grep -o "<p>" | wc -l

Umas centenas de bytes e nenhum parágrafo querem dizer que a página está vazia para um rastreador, por melhor que se veja no navegador. Renderização no servidor, geração estática ou prerender resolvem; qual das três é quase indiferente.

3. Quanto sobra depois da extração?

Mesmo descarregada e renderizada, a página é desbastada: navegação, rodapé, aviso de cookies e quase toda a marcação vão fora, e fica o que parece conteúdo. É esse resto que acaba citado sobre ti.

É a parte que ninguém verifica, e costuma ser onde está a surpresa. A forma mais rápida de ver é ler a tua página tal como um agente a guardaria: em texto simples, sem andaimes. Se o que sobra são duas frases e uma lista de opções de menu, não há afinação de robots.txt que salve.

Além disso, convém ter

llms.txt na raiz: um mapa curto em Markdown das tuas páginas importantes. É uma convenção recente, não uma norma que alguém seja obrigado a cumprir, mas custa pouquíssimo e é lida.

Content-Signal, que te deixa dizer o que se pode fazer com o teu conteúdo — indexá-lo para pesquisa, usá-lo como base de uma resposta, usá-lo para treinar — em vez de apenas se pode ou não ser descarregado. Bloquear tudo não é a única opção e, para a maioria dos negócios, é a errada.

HTML semântico limpo. Cabeçalhos a sério, <article>, <main>, textos alternativos. É o mesmo trabalho que ajuda os leitores de ecrã, e é o que faz a extração ficar com as partes certas.

Resumindo

Corre estas três, por esta ordem:

  1. curl -s https://oteusite.com/robots.txt — conseguem entrar?
  2. curl -s https://oteusite.com/pagina | wc -c — há alguma coisa sem JavaScript?
  3. Lê o que sobrevive à extração — é aquilo que gostarias de ver citado?

A maioria dos sites passa na primeira, falha na terceira, e nunca chega a saber.

Analisa o teu site · robots.txt para bots de IA · Os bots estão autorizados?