よくある質問(FAQ)
AIクローラー設定ナビに寄せられる、AIクローラーと robots.txt の基本的な疑問にお答えします。 ・ 最終更新 2026-09-10
AIの学習を拒否する robots.txt はどう書けばいいですか?
学習用のクローラーごとに「User-agent: 名前」と「Disallow: /」を並べます。代表的な学習系は GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended(Google の Gemini 学習制御トークン)、CCBot(Common Crawl)などです。例えば「User-agent: GPTBot / Disallow: /」を各社ぶん書きます。当サイトの「AI学習だけ拒否」レシピをコピーして robots.txt に貼り、サイト直下(/robots.txt)に置けば設定できます。ただし robots.txt は自発的に従うボット向けの取り決めで、強制力はない点に注意してください。
GPTBot・ChatGPT-User・OAI-SearchBot は何が違いますか?
すべて OpenAI のクローラーですが役割が異なります。GPTBot はモデルの学習用データ収集、OAI-SearchBot は ChatGPT 検索に表示するためのインデックス、ChatGPT-User はユーザーが ChatGPT 内で操作したときにページを取得するフェッチャです。GPTBot と OAI-SearchBot は robots.txt に従いますが、ChatGPT-User はユーザー起点のため robots.txt に拘束されないと OpenAI が明記しています。「学習には使わせたくないが AI 検索には出したい」なら GPTBot だけ Disallow にする、といった使い分けができます。
robots.txt でブロックすれば、AIに絶対使われなくなりますか?
いいえ、断定できません。robots.txt は「自発的に従うクローラー」に向けたお願いで、法的な強制力はありません。方針を無視するボットや、user-agent を詐称するアクセスは防げません。また、ユーザーの操作をきっかけに取得するフェッチャ(ChatGPT-User、Perplexity-User)は robots.txt に従わない場合があると各社が明記しています。厳密に遮断したい場合は、サーバ側での user-agent 判定や IP レンジでの制御を併用してください。当サイトは各社の公式記載を出典に挙動を整理し、断定はしていません。
Google-Extended とは何ですか?Google検索に影響しますか?
Google-Extended は、Google がクロールした内容を将来の Gemini モデルの学習や Gemini アプリのグラウンディングに使うかを、サイト側が robots.txt で制御するためのトークンです。単独のクローラーではなく制御用の識別子で、「User-agent: Google-Extended / Disallow: /」と書くと AI 学習利用を拒否できます。重要なのは、Google-Extended を Disallow にしても Google 検索の掲載やランキングには影響しないと Google が明記している点です。検索には出したいが AI 学習には使われたくない、という場合に使えます。
PerplexityBot や Perplexity-User は robots.txt に従いますか?
Perplexity の公式ドキュメントでは、検索インデックス用の PerplexityBot は robots.txt での許可と公開IPレンジの許可を推奨しています。一方、ユーザーの質問をきっかけにページを取得する Perplexity-User は「ユーザーが要求した取得のため、一般に robots.txt を無視する」と公式に明記されています。過去にはクローラーの robots.txt 遵守をめぐる報道もありました。当サイトは各社の現時点の公式記載を出典に整理し、最終的な挙動は公式ドキュメントで確認する前提で掲載しています。
robots.txt はどこに置けばいいですか?
ドメイン直下、つまり https://あなたのドメイン/robots.txt でアクセスできる場所に置きます。サブディレクトリに置いても機能しません。静的サイトなら public/ や static/ に robots.txt を置けば /robots.txt として配信されます。記法は RFC 9309(Robots Exclusion Protocol)に基づき、「User-agent:」「Allow:」「Disallow:」「Sitemap:」などの行で構成します。当サイトは、デイリーローンチ社が実際に本番配信している robots.txt を実例として掲載しています。
AIに読ませたい場合、robots.txt 以外にやることはありますか?
robots.txt で AI クローラーを許可したうえで、サイトの要約と主要ページを案内する llms.txt をサイト直下に置くと、AI がサイトの要点をつかみやすくなります(効果は保証されません)。あわせて、構造化データ(JSON-LD)や sitemap.xml を整えると、検索・AI検索の双方に理解されやすくなります。robots.txt=アクセスの可否、sitemap.xml=全URLの網羅、llms.txt=要約と厳選案内、と役割を分けて用意するのが基本です。
「AIO」「LLM」「クローラー」など関連用語の意味は、当社AI用語辞典や、当サイトの設定ガイドもあわせてご覧ください。