LLMO

AI クローラと robots.txt:最初に確認すること

比較メディアに載る事業会社 90 社の robots.txt を調べると、AI のクローラを名指しで拒否していたのは 2 社でした。少数でも、弾いていれば他の施策が届きません。学習用と検索用の違いと、5 分で終わる確認の手順を示します。

この記事の要点

  • AI クローラは学習用と検索用に分かれており、拒否したときに起きることがまったく違います
  • 比較メディアに載る事業会社 90 社のうち、AI クローラを名指しで拒否していたのは 2 社でした
  • Google の AI 概要・AI モードだけから外したい場合は、robots.txt ではなく Search Console の設定を使います

AI クローラとは何ですか?

AI クローラは、目的によって別々の名前(ユーザーエージェント)を持っています。学習用と検索用が分かれていることが、設定を考えるうえでいちばん大事な点です。

開発元名前目的robots.txt
OpenAIGPTBot基盤モデルの学習従う。拒否すると学習に使わないという意思表示になる
OpenAIOAI-SearchBotChatGPT の検索機能従う。拒否すると ChatGPT の検索回答に表示されない
OpenAIChatGPT-User利用者の操作に応じた取得利用者が起点のため、適用されない場合があるとされる
OpenAIOAI-AdsBotChatGPT の広告として登録されたリンク先ページの確認従う。広告として登録されたページだけを見る。学習には使わないとしている
AnthropicClaudeBot学習従う
AnthropicClaude-SearchBot検索結果のための取得従う
AnthropicClaude-User利用者の質問に応じた取得従う
PerplexityPerplexityBot検索結果に表示・リンクするため(学習には使わないとしている)従う
PerplexityPerplexity-User利用者の操作に応じた取得概ね適用されないとされる
GoogleGooglebot通常の検索。AI 概要・AI モードもこの範囲で決まる従う
GoogleGoogle-ExtendedGemini の学習や回答の根拠づけへの利用の管理(独自の取得プログラムではなく指定用の名前)従う。Google 検索への表示や順位には影響しない

(各社の公開ドキュメント・2026 年 9 月時点)

自社サイトは、AI クローラを弾いていませんか?

当方が、比較メディアに掲載されている事業会社のサイトを実際に調べました。

見たもの結果
robots.txt を置いていた90 社中 78 社(置いていない 12 社は、すべてのクローラに許可したのと同じ扱い)
すべてのクローラを拒否していた0 社
AI クローラの名前を robots.txt に書いていた7 社
AI クローラを名指しで拒否していた2 社(学習用の GPTBot を拒否 1 社、検索用の PerplexityBot を拒否 1 社)

大半のサイトは AI クローラを弾いていませんでした。ただ、検索用のクローラを拒否しているサイトもありました。その AI の検索回答では、自社サイトが根拠として読まれない状態です。

参考として、同じ方法で調べた支援会社のサイトの中には、学習用のクローラだけを拒否し、検索用は許可している例もありました。学習と検索を分けて判断している設定です。

この調査は robots.txt だけを見ています。CDN やファイアウォールのボット対策で弾いている場合は、ここには表れません。

学習用と検索用は、分けて考えるべきですか?

分けて考えるべきです。拒否したときに起きることがまったく違います。

拒否するもの起きること
学習用(GPTBot・ClaudeBot など)将来のモデルの学習に使われなくなる。AI 検索の根拠として読まれるかどうかは、検索用の指定で別に決まる
Google-ExtendedGemini の学習に加えて、Gemini アプリなどで回答の根拠として使われることも止まる。Google 検索の AI 概要・AI モードには影響しない
検索用(OAI-SearchBot・Claude-SearchBot・PerplexityBot など)その AI の検索回答で、自社サイトが根拠として読まれなくなる
Googlebot通常の検索から消える。AI 概要・AI モードにも出なくなる

「AI に使われたくない」という理由で Googlebot を止めると、通常の検索からも消えます。逆に、Google-Extended を止めても、AI 概要から外れるわけではありません。目的と、止めたときに起きることを 1 つずつ対応させて決めてください。

Google の AI 概要・AI モードだけから自社サイトを外したい場合は、robots.txt ではなく Search Console の設定を使います。2026 年 8 月 31 日から全世界で使えるようになった「Search 生成 AI」の設定で、AI 概要・AI モードなどの生成 AI 機能から自社サイトを除外できます。Google は、通常の検索の順位には影響しないとしています。外すと、生成 AI 機能からの表示とクリックはなくなります。

たとえば「学習には使わせないが、AI 検索では読まれたい」という方針なら、次のような書き方になります。

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

学習用のクローラを許可すれば回答で有利になるのかは、分かっていません(「AI に学習させる SEO」が成立しない理由)。どちらを選ぶかは、自社の方針で決める事柄です。

確認は、どういう手順で行えばいいですか?

5 分で終わります。

手順やること
1ブラウザで「https://自社のドメイン/robots.txt」を開く
2上の表のクローラ名が「User-agent:」の行にあるか探す。あれば、その下に「Disallow: /」がないかを見る
3「User-agent: *」の下に「Disallow: /」がないかを見る(すべてのクローラの拒否)
4CDN やファイアウォールの管理画面で、ボット対策の設定を確認する
5重要なページに noindex や nosnippet が付いていないかを確認する(Google の AI 概要・AI モードの根拠になるには、抜粋つきで検索に表示できる状態が必要)

サイトのリニューアルやセキュリティ対策の変更のあとには、もう一度確認してください。意図しない設定が入るのは、たいていそのタイミングです。

主張根拠の強さ根拠
事業会社の大半は、robots.txt で AI クローラを弾いていない◎ 実証当方の調査(90 社中、名指しの拒否は 2 社)
検索用のクローラを拒否すると、その AI の検索回答の根拠として読まれない◎ 実証各社の公開ドキュメント
学習用のクローラを許可すると、AI の回答で有利になる△ 仮説確かめられていない

根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。

※ 各社のクローラの説明は、記載した時点の公開ドキュメントにもとづくもので、変更されることがあります。設定の変更は、自社の方針と影響を確認したうえで行ってください。

よくある質問

すべての AI クローラを許可すべきですか?

方針しだいです。AI 検索で自社サイトを根拠として読んでほしいなら、少なくとも検索用のクローラは許可する必要があります。学習用を許可するかどうかは、それとは分けて判断できます。

Google-Extended を拒否すると、AI 概要に出なくなりますか?

出なくなるわけではありません。Google は、Google-Extended は Google 検索への表示や順位には影響しないと説明しています。AI 概要・AI モードに表示されるかは、通常の検索と同じく Googlebot の取得範囲で決まります。AI 概要・AI モードから外したい場合は、Search Console の「Search 生成 AI」の設定を使います(2026 年 8 月 31 日から全世界で提供)。

robots.txt と一緒に、llms.txt も置くべきですか?

置く必要はありません。llms.txt は、大規模な調査で AI にほとんど読まれていないことが報告されています(llms.txt に効果はあるのか:調査と 90 社の実態)。

計測条件と免責

本ページに記載した数値は、明記した計測条件(エンジン・モデル・反復回数・実施日)のもとで観測された結果です。 生成 AI の回答は継続的に変動するため、同じ条件で再計測しても同一の結果になるとは限らず、将来の結果を保証するものではありません。 また本ページは、特定の施策によって出現率・順位が向上することを保証するものではありません。

法規制に関する記述は、公表されている運用基準にもとづく一般的な整理であり、法的助言ではありません。個別の判断は専門家にご確認ください。

本ページに登場する計測対象・競合は、特に断りのない限り社名を伏せています。特定の企業・サービスを推奨または批判する意図はありません。