ChatGPT・Claude・Perplexity が自社サイトを読めるか確認する方法
誰かがアシスタントにあなたの会社について尋ねると、起きることは二つに一つです。何か月も前の学習データから答えるか、その場であなたのサイトを取得して読むか。
あなたが手を出せるのは後者で、その結果を左右するものが三つあります。
1. robots.txt は通しているか
AI 各社は用途ごとに別々のユーザーエージェントを使っており、ひとつを塞いでも他は塞がりません。今押さえるべきものは次のとおりです。
| ユーザーエージェント | 企業 | 用途 |
|---|---|---|
GPTBot |
OpenAI | 学習のためのクロール |
OAI-SearchBot |
OpenAI | ChatGPT 検索のためのインデックス |
ChatGPT-User |
OpenAI | 利用者が今尋ねたのでページを取得 |
ClaudeBot |
Anthropic | 学習のためのクロール |
Claude-SearchBot |
Anthropic | 検索のためのインデックス |
Claude-User |
Anthropic | 利用者の依頼で取得 |
PerplexityBot |
Perplexity | 回答のためのインデックス |
Perplexity-User |
Perplexity | 依頼に応じて取得 |
Google-Extended |
Gemini の学習を制御。検索そのものではない | |
Applebot-Extended |
Apple | Apple Intelligence の学習を制御 |
CCBot |
Common Crawl | 他の多くのデータセットの供給元 |
Bytespider |
ByteDance | 学習のためのクロール |
ほとんどの人が取り違える区別があります。末尾が「-User」のものはクローラーではありません。人がたった今そのページについて質問したから取りにくるのです。GPTBot を止めれば学習が止まります。ChatGPT-User を止めれば、見込み客があなたについての答えを得られなくなります。多くのサイトが望むのは前者だけで、後者ではありません。
実際に何を返しているか見てください。
curl -s https://example.com/robots.txt
ボットの目で読みます。User-agent: * の下の Disallow: / は、個別の規則を持たない相手をすべて締め出します。上の表のすべてが含まれます。
知っておくべき落とし穴。 Cloudflare の背後にいて自前の robots.txt がない場合、Cloudflare が代わりに配信することがあります。管理された Content Signals Policy です。200 と、いかにも正しそうな、しかしあなたが書いていないファイルが返ります。あなたの規則もサイトマップも入っていません。私たちはまさにこれを何か月も抱えていました。自分のサーバーは /robots.txt に 404 を返していたのに、誰も気づかなかった。どの確認もエッジから 200 を受け取っていたからです。見分けるには、オリジンに直接尋ねます。
curl -sI https://example.com/robots.txt | grep -i "server\|cf-cache-status"
2. JavaScript なしで本文は残るか
AI クローラーの多くは JavaScript を実行しません。ページをクライアント側で組み立てているなら、彼らが受け取るのは空の器です。
curl -s https://example.com/page | wc -c
curl -s https://example.com/page | grep -o "<p>" | wc -l
数百バイトで段落がゼロなら、ブラウザでどれだけ見栄えがよくても、クローラーにとってそのページは空です。サーバーサイドレンダリング、静的生成、プリレンダリングのいずれでも直ります。どれを選ぶかはあまり重要ではありません。
3. 抽出後に何が残るか
取得してレンダリングできたとしても、エージェントはナビゲーション、フッター、クッキーバナー、そしてほとんどのマークアップを捨て、本文らしきものだけを残します。その残りが、あなたについて引用される中身です。
ここを確認する人はほとんどおらず、たいていの驚きはここにあります。いちばん早いのは、エージェントが残すのと同じ形で自分のページを読むことです。飾りを外した素のテキストで。残ったのが二文とメニュー項目の一覧なら、robots.txt をどう調整しても意味がありません。
あわせて用意したいもの
llms.txt をルートに。重要なページを Markdown で短くまとめた地図です。誰かが従う義務を負う標準ではなく、まだ新しい取り決めですが、ほとんど手間がかからず、実際に読まれます。
Content-Signal。取得の可否だけでなく、その中身をどう扱ってよいか——検索のためのインデックス、回答の材料、学習——を表明できます。すべて拒否するのは唯一の選択肢ではなく、多くの事業にとっては誤った選択です。
きれいなセマンティック HTML。 本物の見出し、<article>、<main>、代替テキスト。スクリーンリーダーを助けるのと同じ作業であり、抽出が正しい部分を残す理由でもあります。
まとめ
次の三つを、この順で実行してください。
curl -s https://example.com/robots.txt— 入れるかcurl -s https://example.com/page | wc -c— JavaScript なしで中身はあるか- 抽出後に残るものを読む — それは引用されたい内容か
多くのサイトは一つ目に合格し、三つ目で落ち、そのことを最後まで知りません。