この記事の要点
- AI クローラは学習用と検索用に分かれており、拒否したときに起きることがまったく違います
- 比較メディアに載る事業会社 90 社のうち、AI クローラを名指しで拒否していたのは 2 社でした
- Google の AI 概要・AI モードだけから外したい場合は、robots.txt ではなく Search Console の設定を使います
AI クローラとは何ですか?
AI クローラは、目的によって別々の名前(ユーザーエージェント)を持っています。学習用と検索用が分かれていることが、設定を考えるうえでいちばん大事な点です。
| 開発元 | 名前 | 目的 | robots.txt |
|---|---|---|---|
| OpenAI | GPTBot | 基盤モデルの学習 | 従う。拒否すると学習に使わないという意思表示になる |
| OpenAI | OAI-SearchBot | ChatGPT の検索機能 | 従う。拒否すると ChatGPT の検索回答に表示されない |
| OpenAI | ChatGPT-User | 利用者の操作に応じた取得 | 利用者が起点のため、適用されない場合があるとされる |
| OpenAI | OAI-AdsBot | ChatGPT の広告として登録されたリンク先ページの確認 | 従う。広告として登録されたページだけを見る。学習には使わないとしている |
| Anthropic | ClaudeBot | 学習 | 従う |
| Anthropic | Claude-SearchBot | 検索結果のための取得 | 従う |
| Anthropic | Claude-User | 利用者の質問に応じた取得 | 従う |
| Perplexity | PerplexityBot | 検索結果に表示・リンクするため(学習には使わないとしている) | 従う |
| Perplexity | Perplexity-User | 利用者の操作に応じた取得 | 概ね適用されないとされる |
| Googlebot | 通常の検索。AI 概要・AI モードもこの範囲で決まる | 従う | |
| Google-Extended | Gemini の学習や回答の根拠づけへの利用の管理(独自の取得プログラムではなく指定用の名前) | 従う。Google 検索への表示や順位には影響しない |
(各社の公開ドキュメント・2026 年 9 月時点)
自社サイトは、AI クローラを弾いていませんか?
当方が、比較メディアに掲載されている事業会社のサイトを実際に調べました。
| 見たもの | 結果 |
|---|---|
| robots.txt を置いていた | 90 社中 78 社(置いていない 12 社は、すべてのクローラに許可したのと同じ扱い) |
| すべてのクローラを拒否していた | 0 社 |
| AI クローラの名前を robots.txt に書いていた | 7 社 |
| AI クローラを名指しで拒否していた | 2 社(学習用の GPTBot を拒否 1 社、検索用の PerplexityBot を拒否 1 社) |
大半のサイトは AI クローラを弾いていませんでした。ただ、検索用のクローラを拒否しているサイトもありました。その AI の検索回答では、自社サイトが根拠として読まれない状態です。
参考として、同じ方法で調べた支援会社のサイトの中には、学習用のクローラだけを拒否し、検索用は許可している例もありました。学習と検索を分けて判断している設定です。
この調査は robots.txt だけを見ています。CDN やファイアウォールのボット対策で弾いている場合は、ここには表れません。
学習用と検索用は、分けて考えるべきですか?
分けて考えるべきです。拒否したときに起きることがまったく違います。
| 拒否するもの | 起きること |
|---|---|
| 学習用(GPTBot・ClaudeBot など) | 将来のモデルの学習に使われなくなる。AI 検索の根拠として読まれるかどうかは、検索用の指定で別に決まる |
| Google-Extended | Gemini の学習に加えて、Gemini アプリなどで回答の根拠として使われることも止まる。Google 検索の AI 概要・AI モードには影響しない |
| 検索用(OAI-SearchBot・Claude-SearchBot・PerplexityBot など) | その AI の検索回答で、自社サイトが根拠として読まれなくなる |
| Googlebot | 通常の検索から消える。AI 概要・AI モードにも出なくなる |
「AI に使われたくない」という理由で Googlebot を止めると、通常の検索からも消えます。逆に、Google-Extended を止めても、AI 概要から外れるわけではありません。目的と、止めたときに起きることを 1 つずつ対応させて決めてください。
Google の AI 概要・AI モードだけから自社サイトを外したい場合は、robots.txt ではなく Search Console の設定を使います。2026 年 8 月 31 日から全世界で使えるようになった「Search 生成 AI」の設定で、AI 概要・AI モードなどの生成 AI 機能から自社サイトを除外できます。Google は、通常の検索の順位には影響しないとしています。外すと、生成 AI 機能からの表示とクリックはなくなります。
たとえば「学習には使わせないが、AI 検索では読まれたい」という方針なら、次のような書き方になります。
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
学習用のクローラを許可すれば回答で有利になるのかは、分かっていません(「AI に学習させる SEO」が成立しない理由)。どちらを選ぶかは、自社の方針で決める事柄です。
確認は、どういう手順で行えばいいですか?
5 分で終わります。
| 手順 | やること |
|---|---|
| 1 | ブラウザで「https://自社のドメイン/robots.txt」を開く |
| 2 | 上の表のクローラ名が「User-agent:」の行にあるか探す。あれば、その下に「Disallow: /」がないかを見る |
| 3 | 「User-agent: *」の下に「Disallow: /」がないかを見る(すべてのクローラの拒否) |
| 4 | CDN やファイアウォールの管理画面で、ボット対策の設定を確認する |
| 5 | 重要なページに noindex や nosnippet が付いていないかを確認する(Google の AI 概要・AI モードの根拠になるには、抜粋つきで検索に表示できる状態が必要) |
サイトのリニューアルやセキュリティ対策の変更のあとには、もう一度確認してください。意図しない設定が入るのは、たいていそのタイミングです。
| 主張 | 根拠の強さ | 根拠 |
|---|---|---|
| 事業会社の大半は、robots.txt で AI クローラを弾いていない | ◎ 実証 | 当方の調査(90 社中、名指しの拒否は 2 社) |
| 検索用のクローラを拒否すると、その AI の検索回答の根拠として読まれない | ◎ 実証 | 各社の公開ドキュメント |
| 学習用のクローラを許可すると、AI の回答で有利になる | △ 仮説 | 確かめられていない |
根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。
※ 各社のクローラの説明は、記載した時点の公開ドキュメントにもとづくもので、変更されることがあります。設定の変更は、自社の方針と影響を確認したうえで行ってください。