
# Como saber se o ChatGPT, o Claude e o Perplexity conseguem ler o teu site

Quando alguém pergunta a um assistente sobre a tua empresa acontece uma de duas coisas: ou ele já sabe algo pelos dados de treino, com meses de atraso, ou vai ao teu site naquele momento e lê-o.

O segundo caso é aquele que podes influenciar, e há três coisas que decidem como corre.

## 1. O teu robots.txt deixa-os entrar?

As empresas de IA usam user-agents diferentes para tarefas diferentes, e bloquear um não bloqueia os outros. Estes são os que contam hoje:

| User-agent | Empresa | O que faz |
|---|---|---|
| `GPTBot` | OpenAI | Rastreia para treino |
| `OAI-SearchBot` | OpenAI | Indexa para a pesquisa do ChatGPT |
| `ChatGPT-User` | OpenAI | Vai buscar uma página porque alguém pediu agora |
| `ClaudeBot` | Anthropic | Rastreia para treino |
| `Claude-SearchBot` | Anthropic | Indexa para pesquisa |
| `Claude-User` | Anthropic | Vai buscar a pedido de uma pessoa |
| `PerplexityBot` | Perplexity | Indexa para responder |
| `Perplexity-User` | Perplexity | Vai buscar a pedido |
| `Google-Extended` | Google | Controla o treino do Gemini, não o motor de busca |
| `Applebot-Extended` | Apple | Controla o treino da Apple Intelligence |
| `CCBot` | Common Crawl | Alimenta muitos outros conjuntos de dados |
| `Bytespider` | ByteDance | Rastreia para treino |

A distinção em que quase toda a gente tropeça: **os agentes terminados em «-User» não são rastreadores**. Vão buscar a página porque uma pessoa acabou de perguntar sobre ela, naquele segundo. Bloquear o `GPTBot` trava o treino. Bloquear o `ChatGPT-User` impede que um potencial cliente obtenha uma resposta sobre ti. A maioria dos sites quer o primeiro sem o segundo.

Vê o que estás mesmo a servir:

```bash
curl -s https://oteusite.com/robots.txt
```

Lê-o como o leria um bot: um `Disallow: /` sob `User-agent: *` bloqueia todos os que não têm regra própria, e isso inclui todos os da tabela.

**Uma armadilha que convém conhecer.** Se estás atrás da Cloudflare e não tens robots.txt próprio, a Cloudflare pode servir um por ti: a Content Signals Policy gerida. Vais receber um `200` e um ficheiro com todo o ar de estar certo que tu não escreveste, sem nenhuma das tuas regras e sem o teu sitemap. Foi exatamente o que nos aconteceu durante meses: o nosso servidor devolvia `404` em `/robots.txt` e ninguém reparou, porque qualquer verificação recebia um `200` da CDN. Para os distinguir, pergunta diretamente à tua origem:

```bash
curl -sI https://oteusite.com/robots.txt | grep -i "server\|cf-cache-status"
```

## 2. O teu conteúdo sobrevive sem JavaScript?

A maioria dos rastreadores de IA não executa JavaScript. Se a tua página é montada no cliente, o que eles recebem é uma casca vazia.

```bash
curl -s https://oteusite.com/a-tua-pagina | wc -c
curl -s https://oteusite.com/a-tua-pagina | grep -o "<p>" | wc -l
```

Umas centenas de bytes e nenhum parágrafo querem dizer que a página está vazia para um rastreador, por melhor que se veja no navegador. Renderização no servidor, geração estática ou prerender resolvem; qual das três é quase indiferente.

## 3. Quanto sobra depois da extração?

Mesmo descarregada e renderizada, a página é desbastada: navegação, rodapé, aviso de cookies e quase toda a marcação vão fora, e fica o que parece conteúdo. É esse resto que acaba citado sobre ti.

É a parte que ninguém verifica, e costuma ser onde está a surpresa. A forma mais rápida de ver é ler a tua página tal como um agente a guardaria: em texto simples, sem andaimes. Se o que sobra são duas frases e uma lista de opções de menu, não há afinação de robots.txt que salve.

## Além disso, convém ter

**`llms.txt`** na raiz: um mapa curto em Markdown das tuas páginas importantes. É uma convenção recente, não uma norma que alguém seja obrigado a cumprir, mas custa pouquíssimo e é lida.

**`Content-Signal`**, que te deixa dizer o que se pode fazer com o teu conteúdo — indexá-lo para pesquisa, usá-lo como base de uma resposta, usá-lo para treinar — em vez de apenas se pode ou não ser descarregado. Bloquear tudo não é a única opção e, para a maioria dos negócios, é a errada.

**HTML semântico limpo.** Cabeçalhos a sério, `<article>`, `<main>`, textos alternativos. É o mesmo trabalho que ajuda os leitores de ecrã, e é o que faz a extração ficar com as partes certas.

## Resumindo

Corre estas três, por esta ordem:

1. `curl -s https://oteusite.com/robots.txt` — conseguem entrar?
2. `curl -s https://oteusite.com/pagina | wc -c` — há alguma coisa sem JavaScript?
3. Lê o que sobrevive à extração — é aquilo que gostarias de ver citado?

A maioria dos sites passa na primeira, falha na terceira, e nunca chega a saber.

[Analisa o teu site](/pt) · [robots.txt para bots de IA](/pt/tools/robots-txt-generator) · [Os bots estão autorizados?](/pt/tools/ai-crawlers-checker)
