robots.txt で AI クローラーを制御する
大手 AI 提供元はそれぞれ独自のユーザーエージェント名で独自のクローラーを運用しています。robots.txt を通じて、ボットごとにあなたのコンテンツを読み込めるかを決定します。
最も重要な AI クローラー
OpenAI: GPTBot(学習)、OAI-SearchBot(ChatGPT 検索)、ChatGPT-User(ユーザー要求時の取得)。Anthropic: ClaudeBot、Claude-SearchBot、Claude-User。Perplexity: PerplexityBot、Perplexity-User。Google: Google-Extended(Gemini の学習)— AI による概要のための実際の取得は通常の Googlebot 経由で行われます。さらに Common Crawl(CCBot)、Amazonbot、Bytespider、Applebot-Extended、Meta-ExternalAgent。
的確に許可する
最大限の AI 可視性のために、関連するボットに「Allow: /」を含む専用ブロックを与えます。重要: ボット固有のブロックは、そのボットについて「User-agent: *」ブロックを完全に置き換えます — 必要な disallow ルールをそこで繰り返してください。
的確に除外する
学習を拒否しつつ AI 検索で可視性を保ちたい場合は、GPTBot と Google-Extended をブロックし、OAI-SearchBot と Googlebot を許可できます。これは内容に関わる判断であり、純粋に技術的なものではありません。
なぜ robots.txt だけでは不十分なことが多いのか
多くのサイトは robots.txt でボットを許可しながら、サーバーレベルでブロックしています: WAF ルール、Cloudflare の「Bot Fight Mode」、ファイアウォールがクローラーを 403 で拒否します。ボットは robots.txt に従っているのに入れません。citeglass はこの食い違いを可視化します。
検証する
許可リストには検証済みのボットを入れるべきです。OpenAI、Anthropic、Perplexity、Google はクローラーの IP 範囲を公開しています。ユーザーエージェント文字列だけに頼らず、逆引き DNS でも確認してください。
自分のサイトをチェック
citeglass は約 30 秒で、あなたのサイトが AI システムにとってどこが読み取れないかを示します — 無料、ログイン不要。
続きを読む
一般的な情報であり、法的助言ではありません。GEO は新しい分野です — 推奨事項は変わる可能性があります。