ChatGPT・Claude・Perplexity が自社サイトを読めるか確認する方法

誰かがアシスタントにあなたの会社について尋ねると、起きることは二つに一つです。何か月も前の学習データから答えるか、その場であなたのサイトを取得して読むか。

あなたが手を出せるのは後者で、その結果を左右するものが三つあります。

1. robots.txt は通しているか

AI 各社は用途ごとに別々のユーザーエージェントを使っており、ひとつを塞いでも他は塞がりません。今押さえるべきものは次のとおりです。

ユーザーエージェント 企業 用途
GPTBot OpenAI 学習のためのクロール
OAI-SearchBot OpenAI ChatGPT 検索のためのインデックス
ChatGPT-User OpenAI 利用者が今尋ねたのでページを取得
ClaudeBot Anthropic 学習のためのクロール
Claude-SearchBot Anthropic 検索のためのインデックス
Claude-User Anthropic 利用者の依頼で取得
PerplexityBot Perplexity 回答のためのインデックス
Perplexity-User Perplexity 依頼に応じて取得
Google-Extended Google Gemini の学習を制御。検索そのものではない
Applebot-Extended Apple Apple Intelligence の学習を制御
CCBot Common Crawl 他の多くのデータセットの供給元
Bytespider ByteDance 学習のためのクロール

ほとんどの人が取り違える区別があります。末尾が「-User」のものはクローラーではありません。人がたった今そのページについて質問したから取りにくるのです。GPTBot を止めれば学習が止まります。ChatGPT-User を止めれば、見込み客があなたについての答えを得られなくなります。多くのサイトが望むのは前者だけで、後者ではありません。

実際に何を返しているか見てください。

curl -s https://example.com/robots.txt

ボットの目で読みます。User-agent: * の下の Disallow: / は、個別の規則を持たない相手をすべて締め出します。上の表のすべてが含まれます。

知っておくべき落とし穴。 Cloudflare の背後にいて自前の robots.txt がない場合、Cloudflare が代わりに配信することがあります。管理された Content Signals Policy です。200 と、いかにも正しそうな、しかしあなたが書いていないファイルが返ります。あなたの規則もサイトマップも入っていません。私たちはまさにこれを何か月も抱えていました。自分のサーバーは /robots.txt404 を返していたのに、誰も気づかなかった。どの確認もエッジから 200 を受け取っていたからです。見分けるには、オリジンに直接尋ねます。

curl -sI https://example.com/robots.txt | grep -i "server\|cf-cache-status"

2. JavaScript なしで本文は残るか

AI クローラーの多くは JavaScript を実行しません。ページをクライアント側で組み立てているなら、彼らが受け取るのは空の器です。

curl -s https://example.com/page | wc -c
curl -s https://example.com/page | grep -o "<p>" | wc -l

数百バイトで段落がゼロなら、ブラウザでどれだけ見栄えがよくても、クローラーにとってそのページは空です。サーバーサイドレンダリング、静的生成、プリレンダリングのいずれでも直ります。どれを選ぶかはあまり重要ではありません。

3. 抽出後に何が残るか

取得してレンダリングできたとしても、エージェントはナビゲーション、フッター、クッキーバナー、そしてほとんどのマークアップを捨て、本文らしきものだけを残します。その残りが、あなたについて引用される中身です。

ここを確認する人はほとんどおらず、たいていの驚きはここにあります。いちばん早いのは、エージェントが残すのと同じ形で自分のページを読むことです。飾りを外した素のテキストで。残ったのが二文とメニュー項目の一覧なら、robots.txt をどう調整しても意味がありません。

あわせて用意したいもの

llms.txt をルートに。重要なページを Markdown で短くまとめた地図です。誰かが従う義務を負う標準ではなく、まだ新しい取り決めですが、ほとんど手間がかからず、実際に読まれます。

Content-Signal。取得の可否だけでなく、その中身をどう扱ってよいか——検索のためのインデックス、回答の材料、学習——を表明できます。すべて拒否するのは唯一の選択肢ではなく、多くの事業にとっては誤った選択です。

きれいなセマンティック HTML。 本物の見出し、<article><main>、代替テキスト。スクリーンリーダーを助けるのと同じ作業であり、抽出が正しい部分を残す理由でもあります。

まとめ

次の三つを、この順で実行してください。

  1. curl -s https://example.com/robots.txt — 入れるか
  2. curl -s https://example.com/page | wc -c — JavaScript なしで中身はあるか
  3. 抽出後に残るものを読む — それは引用されたい内容か

多くのサイトは一つ目に合格し、三つ目で落ち、そのことを最後まで知りません。

サイトを調べる · AI ボット向け robots.txt · ボットは許可されているか