robots.txtでAIトレーニングと検索ボットを分離する戦略【2026年版】
GPTBot・ClaudeBot・Google-Extendedなど主要AIクローラーを目的別に制御するrobots.txt分離設定を解説。学習データ提供を拒否しながらAI検索からの引用機会を維持する実践戦略を紹介する。
目次(14項目)
robots.txtでAIトレーニングと検索ボットを分離する戦略【2026年版】
結論: AIクローラーは「学習データ収集」と「AI検索・回答生成」の2種類に大別でき、それぞれ別のUser-agentが割り当てられている。robots.txtで両者を個別に制御することで、学習データとしての無断利用を防ぎながら、ChatGPTやPerplexityなどのAI検索エンジンへの引用機会は維持するという最適解が実現できる。
最終更新日:2026年6月8日
はじめに
「AIにコンテンツを学習させたくない」と考えてGPTBotをrobots.txtでブロックしたところ、ChatGPT Searchからの参照流入がゼロになった――そんな事例が増えている。原因は、学習用クローラーと検索用クローラーを同一視したまま設定したことにある。
2026年現在、主要AIプロバイダーは目的の異なる複数のクローラーを運用している。OpenAIはモデル学習用のGPTBotと、ChatGPT Searchのリアルタイム取得用OAI-SearchBotを分けて公開している。GoogleもGoogle-Extendedというトークンを通じて、Geminiへの学習利用だけを個別にオプトアウトできる仕組みを提供した。
robots.txtの分離設定は、もはや「AIから守る」という守りの施策ではなく、LLMO(Large Language Model Optimization)戦略の中核をなす積極的な設計の問題になっている。本稿では主要ボットの整理から具体的な記述例、よくある誤設定まで体系的に解説する。
AIクローラーは「学習系」と「検索系」に分かれる
AIクローラーを一括りにブロックする前に、まず目的別の分類を把握しておきたい。大きく3種類に分けられる。
① 学習データ収集系(Training Bot)
モデルのファインチューニングや事前学習に使うコンテンツを収集する。代表的なものがGPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended(Google)、CCBot(Common Crawl)だ。これらをDisallowしても、AI検索の引用には直接影響しない。
② AI検索・回答生成系(Search Bot)
ユーザーの質問に対してリアルタイムでWebを取得し、回答の根拠や引用元として使うクローラー。OAI-SearchBot(ChatGPT Search)、ChatGPT-User(ユーザー起点の取得)、PerplexityBot、YouBotなどが該当する。これらをブロックすると、AI検索での引用機会が失われる。
③ 汎用・共有データセット系
CCBot(Common Crawl)は多くのAIモデルの事前学習データセットとして広く使われる。直接的なAI企業のクローラーではないが、間接的な学習利用の入口となるため、学習データ提供を拒否したい場合はDisallowの対象になる。
この3分類を前提に置くことで、robots.txtの設計方針が整理される。
主要User-agentの一覧と制御ポイント
実装前に各ボットの正式なUser-agent文字列を把握しておく必要がある。
| User-agent | 運営会社 | 用途 |
|---|---|---|
GPTBot | OpenAI | モデル学習データ収集 |
OAI-SearchBot | OpenAI | ChatGPT Searchのリアルタイム取得 |
ChatGPT-User | OpenAI | ユーザー起点のページ取得 |
ClaudeBot | Anthropic | Claudeのモデル学習・データ収集 |
anthropic-ai | Anthropic | Anthropic社サービスのクロール |
Google-Extended | GeminiやVertex AIへの学習利用制御 | |
CCBot | Common Crawl | 共有データセット収集 |
PerplexityBot | Perplexity | Perplexity AI検索の取得 |
YouBot | You.com | You.com検索の取得 |
Google-Extendedは独立したクローラーではなく、Googlebotが収集したデータをGeminiの学習・Grounding用途に使うことを制御するためのUser-agentトークンという点が特徴的だ。Googlebotそのもののクロールには影響しない。
分離設定の基本構成:robots.txt記述例
以下が「学習ボットはブロック・AI検索ボットは通す」という分離設定の標準的な記述例だ。
# ================================================
# AI学習データ収集クローラー:すべて拒否
# ================================================
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
# ================================================
# AI検索・回答生成クローラー:通常クロール許可
# ================================================
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: YouBot
Allow: /
# ================================================
# 通常の検索エンジン:デフォルト許可
# ================================================
User-agent: Googlebot
Allow: /
User-agent: bingbot
Allow: /
# ================================================
# 全体のデフォルトルール
# ================================================
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /private/
Sitemap: https://example.com/sitemap.xml
Allow: /の記述は省略しても動作するが、意図を明示するために書いておくと管理しやすい。各ブロックにコメントを入れることで、後から設定変更した際の意図が伝わりやすくなる。
部分的なコンテンツ保護の設計パターン
サイト全体ではなく、特定ディレクトリやコンテンツのみを学習対象から外したい場合は、Disallowのパスを絞り込む。
# 有料コンテンツ・会員専用ページのみ学習から除外
User-agent: GPTBot
Disallow: /premium/
Disallow: /members/
Disallow: /tools/
User-agent: ClaudeBot
Disallow: /premium/
Disallow: /members/
Disallow: /tools/
このパターンは、オープンなブログ記事はAI学習に使わせてブランド認知を高めつつ、コア機能や有料コンテンツは保護するという戦略に適している。SaaSサービスやメディアサイトで実用性が高い。
よくある誤設定とその影響
誤設定①:全ボット一括ブロック
# 危険:すべてのクローラーをブロックしてしまう
User-agent: *
Disallow: /
これはGooglebotも含めた全クローラーをブロックするため、検索インデックスが消えてサイトのSEOが壊滅的な打撃を受ける。「AIから守りたい」という意図で安易に記述すると致命的な事故になる。
誤設定②:Googlebotと Google-Extendedの混同
Google-Extendedをブロックしても、Googlebotのクロールとインデックスには一切影響しない。逆に、Googlebotをブロックすると検索順位が消える一方でGeminiへの学習利用は続く可能性がある。両者は独立して制御できるという点を必ず押さえておく。
誤設定③:ClaudeBotのブロック漏れ
ClaudeBotのみ記述してanthropic-aiを書き忘れるケースがある。AnthropicはUser-agentに複数の識別文字列を使い分けている場合があるため、公式ドキュメントで最新のUser-agent一覧を確認したうえで両方を記述するのが安全だ。
誤設定④:robots.txtをnoindexの代替として使う
robots.txtはクロールを「お願いする」仕組みであり、行儀のよいボットしか従わない。noindexメタタグやX-Robots-Tagのように、インデックスを強制的に制御する効力はない。ページを検索結果から除外したい場合は必ずnoindexを使う。
設定後の検証方法
robots.txtを更新したら以下の手順で動作を確認する。
- Google Search Consoleのrobots.txtテスターを使い、各User-agentに対して意図通りのAllow/Disallowが返るかを確認する
- ブラウザで
https://yourdomain.com/robots.txtにアクセスして記述が正しく反映されているか目視チェック - サーバーログの確認:設定後1〜2週間でClaudeBotやGPTBotからのアクセスが減少しているかを確認する(完全にゼロになるとは限らないが、主要ボットは従う)
- GSCのクロール統計でGooglebotのクロール頻度が意図せず低下していないかを監視する
robots.txtの変更はリアルタイムで反映されるが、各クローラーがファイルを再取得するまでには数時間〜数日かかることがある。
関連用語
- robots.txt(クローラー制御ファイル) — クローラーへのアクセス可否を宣言するテキストファイル
- クローラー — Webページを巡回して情報を収集するプログラムの総称
- llms.txt — LLMに対してサイト情報を構造化して伝えるための新しい規格
- noindex — ページを検索エンジンのインデックスから除外するディレクティブ
- LLMO — Large Language Model Optimization、AIへの最適化施策全般
関連記事
- robots.txt 完全ガイド:基礎から応用まで
- robots.txtとllms.txtのSEO・LLMO影響の違い
- AIクローラーのrobots.txtとインデックス戦略
- AIクローラーのログ解析:GPTBot・ClaudeBot・GEO
- llms.txtによるAI引用効果とWordPress実装
- LLMO完全ガイド:AIに評価されるコンテンツ戦略
- AI検索最適化(AISEO)完全ガイド
- SEO×LLMO ハイブリッド戦略
- Cloudflare Content Signals Policyとrobots.txt AIクローラー設定
- RSL(Really Simple Licensing)とは?robots.txtでAIライセンスを設定する方法
よくある質問(FAQ)
Q1. robots.txtでGPTBotをブロックすると、ChatGPT Searchにも表示されなくなりますか?
A. いいえ、表示されなくなりません。GPTBotはモデル学習用、ChatGPT Searchの取得にはOAI-SearchBotが使われます。GPTBotのみをブロックしてもOAI-SearchBotを許可していれば、ChatGPT Searchへの引用機会は維持されます。
Q2. Google-Extendedをブロックすると、Google検索の順位に影響しますか?
A. 影響しません。Google-Extendedの制御はGeminiやVertex AIへの学習利用のみを対象としており、Googlebotのクロールや検索インデックスへの登録には一切関係がありません。SEO評価への影響はゼロです。
Q3. ClaudeBotをブロックすると、Claude(チャットAI)での言及も減りますか?
A. 直接的な因果は証明されていませんが、学習データへの取り込みを止めることで、将来のモデル更新後に引用・言及される機会が減少する可能性はあります。現在のモデルへの即時影響はありません。
Q4. robots.txtを無視して収集するクローラーはありますか?
A. あります。OpenAI・Anthropic・Googleなどの大手プロバイダーは原則として遵守しますが、格安の中小AI企業や悪意あるスクレイパーは無視するケースがあります。robots.txtはあくまで「紳士協定」であり、法的拘束力はありません。
Q5. CCBotをブロックすることで、どのAIの学習を防げますか?
A. Common Crawlのデータセットは多くのオープンソースLLMや研究用モデルの学習に使われています。Meta LlamaやMistralなど多数のモデルがCCのデータを活用しているため、CCBotのブロックは広範な学習利用の抑制につながります。
Q6. robots.txtとllms.txtは同時に使うべきですか?
A. 目的が異なるため、両方の活用が理想的です。robots.txtはクロール自体の可否を制御する守りの設定、llms.txtはLLMに対してサイトの構造や重要コンテンツを積極的に伝える攻めの設定です。llms.txtを整備しながら学習クローラーだけをrobots.txtでブロックするという組み合わせが最も合理的です。
Q7. サイト全体ではなく特定ページだけAI学習から守れますか?
A. 可能です。Disallow: /premium/のようにパスを指定することで、有料コンテンツや独自分析データなど守りたいディレクトリのみを対象にできます。オープンなコンテンツはAI検索からの流入を狙いながら、コア資産は保護するという使い分けが有効です。
Q8. robots.txtの変更はどのくらいで各クローラーに反映されますか?
A. クローラーがrobots.txtを再取得するまでのサイクルはボットごとに異なり、数時間から数日程度かかるのが一般的です。緊急でブロックしたい場合は、robots.txtに加えてWAF(Web Application Firewall)でUser-agentベースのアクセス制限を併用する方法が即効性の点で確実です。
Q9. OAI-SearchBotとChatGPT-Userの違いは何ですか?
A. OAI-SearchBotはChatGPT Searchが自動的にWebをクロールして最新情報を取得するためのクローラーです。一方、ChatGPT-Userはユーザーが会話の中で特定のURLを指定した場合や、Custom GPTが外部取得を行う際に使われます。AI検索での引用を狙うにはどちらも許可しておくのが基本方針です。
参考文献
- GPTBot - OpenAI公式クローラー概要 — OpenAI(参照: 2026-06-08)
- Google-Extended の制御について(Googlebot ドキュメント) — Google Search Central(参照: 2026-06-08)
- ClaudeBot - Anthropic公式クローラー情報 — Anthropic(参照: 2026-06-08)
- robots.txt の仕様(Google 検索セントラル) — Google Search Central(参照: 2026-06-08)
- OAI-SearchBotとは?ChatGPT Searchで表示されるためのrobots.txt設定と確認ポイント — ファネルAi(参照: 2026-06-08)
関連用語
- インデックス
インデックスとは、クローラーが集めたページをGoogleがデータベースに登録すること。インデックスされて初めて検索結果に表示される対象になります。「索引」とイメージすると分かりやすい用語です。
- llms.txt
llms.txtとは、サイト運営者がAIクローラーに「このサイトの重要な情報はここ」と伝えるためのMarkdownファイルの提案。2024年9月にJeremy Howard氏が提唱し、急速に普及しつつある新しい標準です。
- クローラー
クローラーとは、Web上のページを自動巡回してデータを集めるプログラムのこと。Googleの「Googlebot」が代表例で、これに見つけてもらわないと検索結果に表示されません。
- sitemap.xml
sitemap.xmlとは、サイト内のページ一覧をXML形式でまとめたファイル。クローラーに「うちにはこんなページがありますよ」と教えるための地図で、新規サイトのインデックス促進に必須です。
- トークン
トークンとは、LLMが文章を処理する最小単位。「単語」より細かく、英語なら約4文字 = 1トークン、日本語なら1〜2文字 = 1トークンが目安。API料金もトークン単位で決まります。
- noindex
noindexとは、ページに付けることで「このページを検索結果に表示しないでください」と検索エンジンに伝えるmetaタグ。低品質ページや会員専用ページに使い、サイト全体の評価を守ります。
関連記事
最新記事
practice カテゴリの他の記事
- LLMO対策のセカンドオピニオンのすすめ|今の会社を乗り換えるべきかの判断基準
- LLMO対策の業務委託契約書チェックポイント12|損しない条項の見方
- 制作会社・代理店がクライアントにLLMO対策を提供する方法|OEM・ホワイトレーベルと内製の判断基準【2026年】
- LLMO対策の失敗事例7パターンと回避策|記事を量産してもAIに引用されない本当の理由【2026年】
- LLMO対策の効果が出るまでの期間は?月別スケジュールと3ヶ月・6ヶ月の判断基準【2026年】
- LLMO対策会社に契約前に確認すべき質問20|商談チェックリストと危険な回答の見分け方【2026年】
- LLMO対策の効果測定と月次レポートの見方|発注者が成果を検収する7つのチェックポイント【2026年】
- LLMO対策は丸投げできる?代行に任せられる範囲・成果報酬の実態・失敗しない任せ方【2026年】
- LLMO対策は月5万円でどこまでできる?低予算プランの現実的な範囲と優先施策【2026年】
- LLMO対策は外注と内製どっち?判断基準7つと費用対効果の分岐点【2026年】
- GoogleマップGemini店舗情報とは何かとMEO対策の実践手順
- Copilotに引用されない原因チェックリスト|Bing起点で診断する7つの確認項目
- LLMO対策会社おすすめ比較|費用相場とツール診断の使い分け
- LLMOツール費用対効果の判断基準|導入・内製・コンサルの選び方
- Bing Webmaster ToolsのAI Performanceレポート完全ガイド【2026年】見方と活用法
- A2Aプロトコル時代にAIエージェントへ自社を発見させる準備【2026年版】
- LLMOコンサル依頼の流れ完全ガイド|相談から契約・初月成果まで6ステップ
- Search Console 生成AIパフォーマンスレポートの見方【2026年7月版】
- Stripe Agentic Commerce Suiteとは?MPP対応と加盟店の実装手順
- RSL(Really Simple Licensing)とは?robots.txtでAIライセンスを設定する方法
- Google Universal Cartとは?加盟店が今すぐ備える実装手順
- YouTubeチャプター×タイムスタンプ設計でAI Overviewsに引用される動画を作る
- Cloudflare Content Signals Policyとrobots.txt AIクローラー設定
- Shopify Agentic Storefronts対応 Global Catalogで商品をAI検索に表示させる方法
- Microsoft Copilot Checkout Merchant Program 商品表示とEC対策
- Amazon Buy for MeとAlexa for Shoppingにブランド商品を表示させる対策
- PayPal Store Syncで商品をAIに表示させる方法
- Mastercard Agent Pay とは|EC事業者が今準備すべきこと【2026年】
- Gemini API グラウンディング groundingMetadata 引用元実装ガイド
- Visa×ChatGPTのエージェント決済にEC事業者はどう備えるか
- Perplexity Snap to Shopの画像検索で商品を表示させる対策
- Perplexity Merchant Program 商品フィード登録の完全手順【2026年版】
- AP2(Agent Payments Protocol)とは?EC決済の対応と日本事業者の備え
- AI経由流入のコンバージョン率が計測できない理由とGA4の限界
- ChatGPT Shopping Researchで商品を表示させる方法を完全解説
- YouTube AIスロップ規制2026で生き残る:AI引用され続ける動画対策
- GA4「AIアシスタント」チャネルとは?AI流入計測の設定・限界を2026年最新版で解説
- YouTube スペック比較・レビュー動画をAI引用されやすく作る方法【2026年版】
- YouTube字幕SRTファイル作成・アップロード完全ガイド|AI引用を高める実務手順
- llms.txtは必要か不要か?Google公式見解とエージェントコマースの結論
- Amazon Rufusと楽天AIに選ばれる商品最適化ガイド【2026年版】
- AI検索流入のCVRは自然検索の4.4倍?データの実態とLLMO投資判断基準
- AIエージェント トラフィックをGA4で可視化・識別する分離計測ガイド【2026年版】
- 字幕チャプター説明欄の3シグナルでYouTube動画をAIに引用させる設計
- YouTubeハッシュタグ×メタデータ設計とAI引用の相関を実装に落とす
- マルチモーダルAIクローラーが動画・音声を理解する仕組みと最適化手順
- プロンプトセット設計・intentタグ付け・AI監視を一元化する実務ガイド
- YouTube Clip・SeekToAction・キーモーメントのAI引用設計と海外ローカライズ戦略
- YouTube多言語字幕でAI引用を獲得する海外展開戦略2026
- YouTube生成AIラベル義務化とLLMO影響:動画が引用されるための実務対応
- YouTube冒頭15秒×結論ファースト:AI引用設計で視聴維持率と検索露出を同時に高める方法
- AI検索の順位安定性を計測・監視する方法【rank stability実践ガイド2026】
- YouTubeチャプターで複数クエリを面取りするAI引用戦略
- YouTube動画をAIに要約されやすくする構成設計の完全ガイド
- YouTube経由のAI検索流入をGA4で計測する完全手順
- YouTube概要欄のLLMO最適化完全ガイド|AIに引用されるテンプレと書き方
- YouTubeタイムスタンプ・章構造でAI引用率を最大化する最適化完全ガイド
- YouTubeチャンネルのAI可視性を確認・計測する方法【2026年版】
- リッチリザルトテスト終了後の構造化データ検証:代替ツールと実務フロー完全ガイド
- 構造化データの実装ミスでAI引用されない原因と修正手順
- AI参照流入をGA4で計測する設定方法【ChatGPT・Perplexity対応2026年版】
- 日本語AI引用率監視ツール比較9選|料金・対応エンジン2026
- ゼロクリック検索でも収益化できるブランド想起戦略の全手順
- HubSpot AEOフレームワークを日本語サイトに適用する実践ガイド
- BtoBオーガニック流入減に直面した企業がAEO転換で成果を回復した事例と手順
- AI Overview クリック率低下をAEOで回復する実践手順書
- OAI-SearchBot・Claude-SearchBot を許可しつつ学習ボットを遮断する robots.txt 設計
- AI引用率の測定と改善サイクル:PDCA運用の実践ガイド
- schema.org VideoObject 完全ガイド|動画をAI引用される構造化データの実装手順【2026年版】
- AIクローラー ログ解析完全ガイド|GPTBot・ClaudeBot 検出からGEO可視化まで【2026年版】
- robots.txtとllms.txtの違いとSEO影響を徹底比較【2026年版】
- llms.txtの効果とWordPress実装ガイド|AI引用率を上げる設定・書き方【2026年版】
- ECサイトSEO×AI検索対策2026年版|LLMO・AI引用率を高めて売上を守る実践ガイド
- コンテンツ構造設計でAI引用率を上げる実践ガイド|ページ設計と最適化の全手順
- AIクローラーのrobots.txt設定とAI検索引用戦略【2026年版】
- セッション減少をAI検索が原因か診断する完全手順【2026年版】
- WebマーケティングのAI検索移行戦略2026|実践ロードマップ
- UI/UX設計とAI検索最適化:評価基準と具体的な改善手順を徹底解説
- 中小企業のLLMO導入事例|AI引用率を改善した具体的ステップと成果
- セマンティックHTMLでAI検索の理解度を上げる完全実践ガイド
- AI検索でCTRはどう変わる?8%まで低下する実態と回復手順2026
- YouTube サムネイル AB テストのやり方 2026 年版|雑学ショートで CTR を 2 倍にする手順
- YouTube Shorts と長尺の収益化はどっちが稼げる?2026 年版の RPM 比較と使い分け戦略
- YouTube Shorts から長尺動画への誘導設計|雑学ショート運営者の動線フロー 5 ステップ
- YouTube 検索ボリュームの調べ方|無料ツールで雑学キーワードを見つける 4 つの手順
- YouTube 収益と税金|個人事業主と法人化の損益分岐【日本 2026】