
# ChatGPT・Claude・Perplexity が自社サイトを読めるか確認する方法

誰かがアシスタントにあなたの会社について尋ねると、起きることは二つに一つです。何か月も前の学習データから答えるか、その場であなたのサイトを取得して読むか。

あなたが手を出せるのは後者で、その結果を左右するものが三つあります。

## 1. robots.txt は通しているか

AI 各社は用途ごとに別々のユーザーエージェントを使っており、ひとつを塞いでも他は塞がりません。今押さえるべきものは次のとおりです。

| ユーザーエージェント | 企業 | 用途 |
|---|---|---|
| `GPTBot` | OpenAI | 学習のためのクロール |
| `OAI-SearchBot` | OpenAI | ChatGPT 検索のためのインデックス |
| `ChatGPT-User` | OpenAI | 利用者が今尋ねたのでページを取得 |
| `ClaudeBot` | Anthropic | 学習のためのクロール |
| `Claude-SearchBot` | Anthropic | 検索のためのインデックス |
| `Claude-User` | Anthropic | 利用者の依頼で取得 |
| `PerplexityBot` | Perplexity | 回答のためのインデックス |
| `Perplexity-User` | Perplexity | 依頼に応じて取得 |
| `Google-Extended` | Google | Gemini の学習を制御。検索そのものではない |
| `Applebot-Extended` | Apple | Apple Intelligence の学習を制御 |
| `CCBot` | Common Crawl | 他の多くのデータセットの供給元 |
| `Bytespider` | ByteDance | 学習のためのクロール |

ほとんどの人が取り違える区別があります。**末尾が「-User」のものはクローラーではありません**。人がたった今そのページについて質問したから取りにくるのです。`GPTBot` を止めれば学習が止まります。`ChatGPT-User` を止めれば、見込み客があなたについての答えを得られなくなります。多くのサイトが望むのは前者だけで、後者ではありません。

実際に何を返しているか見てください。

```bash
curl -s https://example.com/robots.txt
```

ボットの目で読みます。`User-agent: *` の下の `Disallow: /` は、個別の規則を持たない相手をすべて締め出します。上の表のすべてが含まれます。

**知っておくべき落とし穴。** Cloudflare の背後にいて自前の robots.txt がない場合、Cloudflare が代わりに配信することがあります。管理された Content Signals Policy です。`200` と、いかにも正しそうな、しかしあなたが書いていないファイルが返ります。あなたの規則もサイトマップも入っていません。私たちはまさにこれを何か月も抱えていました。自分のサーバーは `/robots.txt` に `404` を返していたのに、誰も気づかなかった。どの確認もエッジから `200` を受け取っていたからです。見分けるには、オリジンに直接尋ねます。

```bash
curl -sI https://example.com/robots.txt | grep -i "server\|cf-cache-status"
```

## 2. JavaScript なしで本文は残るか

AI クローラーの多くは JavaScript を実行しません。ページをクライアント側で組み立てているなら、彼らが受け取るのは空の器です。

```bash
curl -s https://example.com/page | wc -c
curl -s https://example.com/page | grep -o "<p>" | wc -l
```

数百バイトで段落がゼロなら、ブラウザでどれだけ見栄えがよくても、クローラーにとってそのページは空です。サーバーサイドレンダリング、静的生成、プリレンダリングのいずれでも直ります。どれを選ぶかはあまり重要ではありません。

## 3. 抽出後に何が残るか

取得してレンダリングできたとしても、エージェントはナビゲーション、フッター、クッキーバナー、そしてほとんどのマークアップを捨て、本文らしきものだけを残します。その残りが、あなたについて引用される中身です。

ここを確認する人はほとんどおらず、たいていの驚きはここにあります。いちばん早いのは、エージェントが残すのと同じ形で自分のページを読むことです。飾りを外した素のテキストで。残ったのが二文とメニュー項目の一覧なら、robots.txt をどう調整しても意味がありません。

## あわせて用意したいもの

**`llms.txt`** をルートに。重要なページを Markdown で短くまとめた地図です。誰かが従う義務を負う標準ではなく、まだ新しい取り決めですが、ほとんど手間がかからず、実際に読まれます。

**`Content-Signal`**。取得の可否だけでなく、その中身をどう扱ってよいか——検索のためのインデックス、回答の材料、学習——を表明できます。すべて拒否するのは唯一の選択肢ではなく、多くの事業にとっては誤った選択です。

**きれいなセマンティック HTML。** 本物の見出し、`<article>`、`<main>`、代替テキスト。スクリーンリーダーを助けるのと同じ作業であり、抽出が正しい部分を残す理由でもあります。

## まとめ

次の三つを、この順で実行してください。

1. `curl -s https://example.com/robots.txt` — 入れるか
2. `curl -s https://example.com/page | wc -c` — JavaScript なしで中身はあるか
3. 抽出後に残るものを読む — それは引用されたい内容か

多くのサイトは一つ目に合格し、三つ目で落ち、そのことを最後まで知りません。

[サイトを調べる](/ja) · [AI ボット向け robots.txt](/ja/tools/robots-txt-generator) · [ボットは許可されているか](/ja/tools/ai-crawlers-checker)
