LLMO/AISEOモニタリングツール
AIクローラー誤ブロック調査、22%が意図せず遮断 (llmo-news-20260831-ai-crawler-robots-txt-accidental-blocking-study)
LLMO最終更新日: 2026年9月18日初出: 2026年8月31日

AIクローラー誤ブロック調査、22%が意図せず遮断

Relevance社の調査で50サイト中11サイト(22%)が主要5大AIクローラーのいずれかをrobots.txtで意図せずブロックしていたと判明。メディア業界は71%が該当。原因と対応策を解説する。

#LLMO#AI検索#AIクローラー#robots.txt#GPTBot#ClaudeBot#PerplexityBot#Google-Extended#CCBot#GEO
目次(33項目)

AIクローラー誤ブロック調査、22%が意図せず遮断

要点: メディア・テクノロジー分析を手がけるRelevance社が50サイトのrobots.txtを実地調査した結果、22%(11サイト)が主要5大AIクローラー(GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBot)のいずれかをブロックしていたことが判明した。 業種別ではメディア/ニュース業界が71%、医療業界が50%と突出して高く、eコマース・金融業界はブロック0%だった一方、NPRのみが5大クローラー全てをブロックする唯一のサイトだったなど、対応にはばらつきが大きい。 調査を行ったKate Shaw氏は、多くのケースが「熟慮されたポリシーではなく、一度設定して以来見直されていない放置状態」だと指摘しており、Relevanceは7項目のチェックリストによる定期見直しを提言している。

最終更新日: 2026年8月31日

何が起きたのか

調査の概要

メディア・テクノロジー分析を手がけるRelevance社は2026年8月18日、著者Kate Shaw氏名義でtechnori.comに「Blocking AI Crawlers: 1 in 5 Sites Do It by Accident」と題した調査記事を公開した。タイトルが示す通り、調査の核心は「5サイトに1サイトが、意図せずAIクローラーをブロックしている」という指摘にある。

調査対象は50サイトで、業種はメディア/ニュース、SaaS、eコマース、金融、医療、教育、非営利/政府、ブログ/クリエイター、旅行/地域、マーケティング/SEOの10業種に分類され、各業種あたり4〜7サイトが選定された。手法としては、各ドメインの実際のrobots.txtファイルをプログラムで取得・解析し、GPTBot(OpenAI)、ClaudeBot(Anthropic)、PerplexityBot(Perplexity)、Google-Extended(Googleの生成AI学習オプトアウト用トークン)、CCBot(Common Crawl)という5つの主要AIクローラーに対するアクセス許可・拒否の設定状況を機械的に確認している。

主要データ:22%が少なくとも1つをブロック

調査結果として、50サイト中11サイト(22%)が、5大AIクローラーのうち少なくとも1つをDisallowしていたことが確認された。クローラー別のブロック率は以下の通りだ。

クローラー運営元ブロック率
GPTBotOpenAI18%
CCBotCommon Crawl18%
ClaudeBotAnthropic14%
Google-ExtendedGoogle8%
PerplexityBotPerplexity4%

GPTBotとCCBotが同率でもっともブロック率が高く、次いでClaudeBot、Google-Extended、PerplexityBotの順となっている。これらのクローラーは、ChatGPT検索・Claude・Perplexity等の生成AI検索サービスがウェブページを引用・要約する際の情報収集経路として機能しており、ブロックされたサイトは理論上、これらのサービスからの引用・言及の機会を失っている可能性がある。

業種別のブロック率:メディア業界が突出

業種別に見ると、ブロック傾向には極めて大きな偏りがあることが分かる。

業種ブロック率(目安)
メディア/ニュース71%
医療50%
その他の業種(SaaS、教育、非営利/政府、ブログ/クリエイター、旅行/地域、マーケティング/SEOなど)25%以下
eコマース0%
金融0%

メディア/ニュース業界のブロック率71%は、他業種と比べて突出して高い数値だ。医療業界も50%と高水準であり、この2業種が調査対象50サイト全体のブロック傾向を強く牽引していることがうかがえる。対照的に、eコマースと金融業界はブロック率0%で、AIクローラーを制限なく受け入れる姿勢が明確だった。

さらに、5大クローラー以外にも視野を広げると、調査対象50サイトのうち32%が、主要5クローラー以外の小規模AIボットをブロックしていたことも分かっている。つまり「主要5クローラーはブロックしていないが、その他のAIボットは何らかの形で制限している」というサイトも一定数存在し、AIクローラー全般への警戒感がすでに広がっていることを示している。

個別サイトの具体例

Relevanceの調査では、個別サイトの設定例もいくつか紹介されている。それぞれ異なるパターンを示しており、robots.txt運用の実態を理解する上で参考になる。

  • NPR: 調査対象50サイトの中で唯一、5大AIクローラー全てをブロックしていたサイトだった。GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotのいずれも許可しない、もっとも徹底したブロック方針を取っている。
  • WebMDとHealthline: いずれもGPTBot・ClaudeBot・CCBotの3クローラーをブロックする一方、Google-ExtendedとPerplexityBotは通過させる設定になっていた。同じ「生成AIの学習・検索利用」を目的とするクローラーであるにもかかわらず、対応にばらつきがある点は、一貫した方針に基づく設定というより、場当たり的な追加・編集の積み重ねを示唆する例として挙げられている。
  • Khan Academy: ブロック対象がGPTBotのみという、逆に限定的な設定だった。他の4クローラー(ClaudeBot、PerplexityBot、Google-Extended、CCBot)はすべて許可されており、なぜGPTBotだけが対象になっているのか、明確な方針が見えにくい設定例として紹介されている。

原因分析:「事故」としてのブロック

Kate Shaw氏はこの調査結果について、多くのケースが意図的なポリシーの結果ではないと分析している。氏の指摘の趣旨は、「これらは熟慮されたポリシーには見えない。誰かが一度robots.txtファイルを編集し、その時点で存在していたクローラーをブロックし、その後一度も見直していない」というものだ。

背景には、AIクローラーの多くが2023年前後に相次いで登場・稼働を開始した経緯がある。GPTBotは2023年8月、ClaudeBotやCCBotも同時期以降に広く認知されるようになったが、Relevanceの調査結果を踏まえると、多くのサイトはその当時に一度robots.txtへ設定を加えた後、新しいAIクローラー(PerplexityBotやGoogle-Extendedなど、稼働開始時期が異なるクローラー)が登場しても、設定を更新していない傾向がうかがえる。

WebMDとHealthlineの「一部クローラーのみブロック」という一貫性のない設定や、Khan Academyの「GPTBotだけをブロック」という設定は、いずれも意図的な方針決定というよりも、その時々の事情で個別にクローラー名を追加・削除した結果、全体として一貫性を欠いた状態になっている可能性を示す例と言える。つまり、この調査が示す本質的な問題は「意図的なブロック方針」そのものではなく、放置と設定の継承(inherit)によって生じる「事故」的なブロックにあるというのが、Relevance/Kate Shaw氏の指摘の核心だ。

Relevanceが提示した7項目の実務チェックリスト

Relevanceは記事の中で、サイト運営者がrobots.txtの状態を点検するための実務チェックリストを提示している。趣旨は以下の7項目に整理できる。

  1. robots.txtの現状を実際に確認する
  2. ワイルドカードルールの影響範囲を検証する
  3. どのクローラーを許可/ブロックするか意図的に方針決定する
  4. CDN・WAF・ファイアウォールレベルでの追加ブロックも確認する(robots.txtだけでは不十分)
  5. User-Agent文字列が最新かどうかを検証する
  6. サーバーログで実際のクローラーアクセス状況を確認する
  7. 四半期ごとに設定を見直す

このチェックリストは、robots.txtというテキストファイル単体の設定だけでなく、CDNやWAF(Web Application Firewall)レベルでの追加的なブロックルールの有無、User-Agent文字列自体の陳腐化(新しいクローラーのUser-Agentがルールに反映されていない状態)、そして実際のアクセスログとの突き合わせまで含めた、多層的な点検を求めている点が特徴的だ。

aiseo-llmo.com ユーザーへの影響

背景・経緯の整理:robots.txtは「検索エンジン向け」に設計された歴史を持つ

robots.txtという仕組みは、そもそも1990年代半ばにGooglebotをはじめとする従来型の検索エンジンクローラーを制御する目的で普及した、長い歴史を持つ標準規格だ。長年にわたり、多くのサイト運営者にとってrobots.txtは「検索エンジンのインデックスをコントロールするためのファイル」という認識で運用されてきた。

しかし、2022年末以降の生成AIサービスの急速な普及に伴い、GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotといった、生成AIの学習データ収集やAI検索の情報収集を目的とする新しいクローラーが次々と登場した。これらのクローラーは、従来の検索エンジンクローラーとは目的も運営元も異なるにもかかわらず、robots.txtという同じ仕組みの中でUser-Agent名を指定してアクセス可否を制御する形になっている。

この結果として起こりうるのが、今回のRelevance調査が示すような「設定の陳腐化」だ。ある時点でのAIクローラー一覧を基準にrobots.txtを設定した後、新しいクローラーが登場しても更新されない状態が続けば、意図せずして「一部の新しいAIクローラーだけが素通り」「一部の古いAIクローラーだけがブロックされたまま」という一貫性のない状態が生まれる。こうした傾向は、本調査に限らず、Cloudflareのネットワークトラフィック分析など他の複数の調査でも類似の指摘が報告されており、robots.txtの「AIクローラー時代への未対応」は業界全体で共通して観測されている論点と言える。

Google-Extendedをブロックする意味を正しく理解する

今回の調査データを解釈する上で、技術的に押さえておくべき重要な点がある。それは、Google-Extendedが検索インデックス構築を担うGooglebotとは別のトークンだということだ。

Google-Extendedは、Geminiをはじめとする生成AIの学習データ収集をオプトアウトするための専用のUser-Agentトークンであり、これをrobots.txtでブロックしても、Google検索やAI Overviewsでのそのサイトの表示自体には影響しない。つまり「学習データとしての利用のみを拒否し、検索結果・AI Overviewsへの表示は維持する」という選択が可能な設計になっている。

この技術的な違いを理解しないまま、GPTBotやClaudeBotと同列に「AIクローラー全般」としてGoogle-Extendedを一括ブロックしてしまうと、本来は区別して運用できたはずの「検索表示の維持」と「AI学習データ提供の拒否」という2つの目的を、意図せず混同してしまう恐れがある。今回の調査でGoogle-Extendedのブロック率が8%と、GPTBot(18%)やCCBot(18%)と比べて低めに出ている背景には、こうした技術的な性質の違いが一定程度反映されている可能性もあるが、この点について本調査自体が明言しているわけではない。

業種別の実務インパクト

今回の調査結果を、業種ごとの実務インパクトという観点で整理すると、以下のような傾向が見えてくる。

業種調査でのブロック率想定される実務インパクト
メディア/ニュース71%AI検索・AIアシスタントでのニュース引用・要約対象から外れる機会損失が大きい。著作権・コンテンツ盗用への懸念、ライセンス交渉との兼ね合いが背景として語られることが多い業種だが、本調査自体はその理由を明言していない
医療50%健康・医療情報を求めるユーザーがAI検索で情報源を探す際、専門性の高いサイトが回答生成の情報源候補から外れるリスクがある。WebMD・Healthlineのように一貫性を欠く設定も見られ、方針の再点検が特に必要な業種
SaaS・教育・非営利/政府・ブログ/クリエイター・旅行/地域・マーケティング/SEO25%以下業種全体としてはブロック率が低いが、個別サイトごとに設定が異なりうるため、自社の設定を個別に確認する必要がある
eコマース0%調査対象内では全サイトがブロックなし。AI検索経由での商品比較・レコメンド機会を維持する方向で運用されている
金融0%調査対象内では全サイトがブロックなし。ただし規制業種特有の情報の正確性・引用リスクへの配慮は別途必要になりうる

この表からも分かる通り、業種によってブロック傾向には大きな差があり、「自社の業種だから安全/危険」と単純に判断することはできない。同じメディア業界の中でもNPRのように徹底的にブロックするサイトもあれば、逆にブロックを一切していないメディアサイトも存在すると考えられ、最終的には個別サイトごとのrobots.txtを直接確認する以外に実態を把握する方法はない。

国内外の反応

Relevanceの調査結果自体は米国のメディア・SaaS等を中心とした50サイトを対象にしたものであり、日本国内のサイトを直接対象にした調査ではない点は明記しておきたい。ただし、AIクローラーの実装・robots.txtの標準仕様はグローバル共通であり、日本国内のサイトでも同様の「設定の陳腐化」が起こりうる構造的な条件は変わらない。

海外では、今回のRelevanceの調査以前にも、Cloudflareが自社のネットワークトラフィックデータを用いてAIクローラーのアクセス状況を分析するレポートを継続的に公開しており、多くのサイトがAIクローラーへの対応方針を明確化できていない実態が指摘されてきた経緯がある。今回のRelevance調査は、その延長線上で「実際にrobots.txtの記述内容を直接調べる」という手法を取ることで、より具体的な業種別・クローラー別の数値を示した点に特徴があると言える。

今すぐできる対応策

Relevanceが提示した7項目のチェックリストに沿って、具体的な確認手順とrobots.txtの記述例を示す。

1. robots.txtの現状を確認する

まずは自社サイトの実際のrobots.txtファイルの内容を、直接確認することから始める。

curl -s https://example.com/robots.txt

このコマンドで、サイトのルート直下に配置されたrobots.txtの内容をそのまま表示できる。Disallow: /User-agent: GPTBotUser-agent: ClaudeBotなどのブロックの直下に記述されていないか、一行ずつ確認する。

2. ワイルドカードルールの影響範囲を検証する

User-agent: *のように、すべてのクローラーを対象にしたワイルドカードルールが存在する場合、そのルールが意図せずAIクローラーにも適用されていないかを確認する必要がある。例えば以下のような記述は、明示的に個別クローラーを指定していない限り、GPTBotやClaudeBotを含むすべてのクローラーに影響する。

User-agent: *
Disallow: /admin/
Disallow: /search/

このようなワイルドカードルールの範囲に、意図せず主要なコンテンツディレクトリが含まれていないか、パス単位で洗い出す。

3. 許可/ブロックの方針を意図的に決定する

「なんとなく」ではなく、自社のビジネス方針として、各AIクローラーを許可するかブロックするかを明文化する。方針決定の例として、以下のような記述パターンが考えられる。

AI検索での引用・言及を積極的に狙う場合(すべて許可)

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: CCBot
Allow: /

AI検索での引用は許可しつつ、生成AIの学習データ提供のみを避けたい場合

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

この設定例では、AI検索エンジン(ChatGPT検索、Claude、Perplexity)からの引用・言及の経路となるクローラーは許可しつつ、Google-Extended(Geminiなどの学習データ収集専用トークン)とCCBot(学習データセットとして広く再配布されるCommon Crawl)についてのみ拒否する、という区別を明示的に行っている。前述の通り、Google-Extendedのブロックは検索表示自体には影響しない設定であるため、こうした使い分けが技術的に可能だ。

特定のクローラーのみをブロックしたい場合(意図を明記するコメント付き)

# 2026年8月方針レビュー: 著作権懸念によりCCBotのみブロック
# 他のAIクローラー(GPTBot/ClaudeBot/PerplexityBot/Google-Extended)は許可
User-agent: CCBot
Disallow: /

コメント(#から始まる行)に方針決定の日付と理由を残しておくことで、今回の調査が指摘するような「誰が何のために設定したか分からない」状態を防ぎ、次回の見直し時に判断の経緯を追いやすくなる。

4. CDN・WAF・ファイアウォールレベルの追加ブロックを確認する

robots.txtはあくまでクローラー側の「自主的な遵守」を前提とした仕組みであり、実際のアクセス制御はCDNやWAF(Web Application Firewall)、リバースプロキシの設定で別途行われている場合がある。CloudflareやAkamaiなどのCDNサービスを利用している場合、管理画面でBot Managementやファイアウォールルールの設定を確認し、robots.txtでは許可しているにもかかわらず、CDNレベルで特定のAIクローラーのUser-Agentやアクセス元IPレンジがブロックされていないかを点検する必要がある。robots.txtの記述だけを見直しても、CDN側の設定が食い違っていれば実効性がない点に注意したい。

5. User-Agent文字列が最新かどうかを検証する

各AIクローラーが使用する正式なUser-Agent文字列は、運営元の公式ドキュメントで随時公開・更新されている。robots.txt内の記述が、古いUser-Agent名や誤字を含んでいないか、公式情報と照合して確認する。文字列が一致していなければ、意図した通りのブロック(または許可)が実際には機能していない可能性がある。

6. サーバーログで実際のクローラーアクセス状況を確認する

robots.txtの記述内容だけでなく、実際にどのクローラーがどのページにアクセスしているかをサーバーログやCDNのアクセスログから確認する。

grep -i "GPTBot\|ClaudeBot\|PerplexityBot\|Google-Extended\|CCBot" access.log | awk '{print $1, $7}' | sort | uniq -c | sort -rn | head -50

このようなコマンドで、各AIクローラーのUser-Agentごとにアクセス先パスを集計すれば、robots.txtの設定が実際のアクセス状況に反映されているか(ブロックしたつもりのクローラーが実は依然としてアクセスしているケースがないか、逆に許可しているはずのクローラーがそもそも一度もアクセスしていないケースがないか)を具体的に把握できる。クローラーログの体系的な分析手順については、AIクローラー ログ解析完全ガイドで詳しく解説している。

7. 四半期ごとに設定を見直す

今回の調査結果が突きつける最大の教訓は、「一度設定したら終わり」ではなく、「定期的な見直しが前提の運用」に切り替える必要があるということだ。新しいAIクローラーは今後も登場し続けると見込まれ、robots.txtやCDN設定を四半期に一度は棚卸しし、上記1〜6の手順を通しで再実行するサイクルをカレンダーに組み込んでおくことが望ましい。robots.txtとAI学習用・検索用クローラーの使い分け戦略についてはrobots.txtの学習用・検索用クローラー分離戦略、llms.txtとの役割の違いはrobots.txtとllms.txtのSEO/LLMOへの影響の違いも参考にしてほしい。

今後の見通し

Relevanceの調査は50サイトという限定的なサンプルではあるものの、robots.txtの「AIクローラー時代への未対応」という構造的な問題を、業種別・クローラー別の具体的な数値で可視化した点に意義がある。今後、GPTBot・ClaudeBot・PerplexityBotに続く新たなAIクローラーが登場するたびに、同様の「設定の陳腐化」が繰り返される可能性は高く、サイト運営者側には一度きりの設定ではなく継続的な棚卸しの運用が求められる流れが強まると考えられる。また、robots.txtだけでは表現しきれない「学習利用の可否」や「引用時のライセンス条件」を扱う新しい仕組み(llms.txtやContent Signalsポリシーなど)の議論も並行して進んでおり、robots.txt単体でのAIクローラー制御には限界があるという認識も今後さらに広がっていくとみられる。

よくある質問

Q1. 今回の調査は日本のサイトも対象に含まれているのか

含まれていない。調査対象は米国を中心とした50サイトで、日本国内サイトを直接検証したものではない。

Relevanceの調査は、メディア/ニュース、SaaS、eコマース、金融、医療、教育、非営利/政府、ブログ/クリエイター、旅行/地域、マーケティング/SEOという10業種、計50サイトを対象にしており、いずれも英語圏を中心としたサイトとみられる。ただし、robots.txtの標準仕様やAIクローラーの実装はグローバル共通であるため、同様の「設定の陳腐化」が日本国内のサイトでも起こりうる構造的な条件は変わらない。自社サイトについては、本記事で紹介した手順を用いて個別に確認することを推奨する。

Q2. GPTBotをブロックすると何が起こるのか

ChatGPT検索など、GPTBotを情報収集経路とする生成AIサービスでの引用・言及の機会を失う可能性がある。

GPTBotはOpenAIが運営するクローラーで、ChatGPT検索をはじめとするサービスがウェブページを引用・要約する際の情報収集経路の一つとされている。robots.txtでGPTBotをDisallowに設定すると、そのクローラーが自社サイトのコンテンツを収集できなくなり、結果としてChatGPT検索などの回答生成における引用元候補から外れる可能性がある。今回の調査ではGPTBotのブロック率が18%と、CCBotと並んで最も高い水準だった。

Q3. Google-Extendedをブロックすると検索順位に影響するか

影響しない。Google-ExtendedはGooglebotとは別のトークンで、生成AIの学習データ収集のオプトアウト専用として機能する。

Google-Extendedをrobots.txtでブロックしても、Google検索の通常のインデックス構築や検索順位、AI Overviewsでの表示自体には影響しないとされている。あくまで「Geminiなどの生成AIの学習データとしての利用」のみを拒否する設定であり、検索エンジンとしての基本機能を担うGooglebot本体とは別個に制御できる点が技術的な特徴だ。この違いを理解せずに、他のAIクローラーと同列に一括ブロックしてしまうと、意図しない形で選択肢を狭めてしまう可能性がある。

Q4. なぜメディア/ニュース業界のブロック率が71%と突出して高いのか

本調査自体は明確な理由を述べていないが、著作権・コンテンツ盗用への懸念やライセンス交渉との兼ね合いが一般的に語られることが多い。

Relevanceの調査データでは、メディア/ニュース業界のブロック率が71%と、他業種と比べて突出して高いことが示されている。ただし、この調査自体はその背景理由を明言しておらず、著作権保護やライセンス交渉戦略との関連は、あくまで一般的に語られる文脈として理解すべきである。個別サイトごとの意思決定の背景は、公表された調査データからは特定できない。

Q5. NPRが5大クローラー全てをブロックしているのはなぜか

調査データからは、NPRが5大AIクローラー全てをブロックしている唯一のサイトだったことのみが確認されており、その背景理由についての言及はない。

今回の調査では、GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotの5つすべてをブロックしていたサイトはNPRのみだった。これは調査対象50サイトの中でもっとも徹底したブロック方針であり、意図的な方針の結果である可能性が高いが、Relevanceの記事自体はNPRの意思決定の理由には触れていない。

Q6. WebMDとHealthlineの設定が「一貫性がない」とされるのはなぜか

GPTBot・ClaudeBot・CCBotはブロックする一方、Google-ExtendedとPerplexityBotは通過させており、統一的な方針が見えにくいためだ。

両サイトとも、5大クローラーのうち3つ(GPTBot・ClaudeBot・CCBot)をブロックしながら、残り2つ(Google-Extended・PerplexityBot)は許可するという設定になっていた。同じ「生成AIによる情報収集」という目的を持つクローラー群であるにもかかわらず対応が分かれている点は、Kate Shaw氏が指摘する「一度編集して以降見直されていない」設定の典型例として紹介されている。

Q7. eコマース・金融業界のブロック率が0%なのはなぜか

調査データでは0%という結果のみが示されており、明確な理由についての言及はない。

Relevanceの調査では、eコマース業界と金融業界のブロック率がいずれも0%だったことが示されている。この2業種はAI検索経由での商品比較・サービス比較・レコメンド機会を重視し、AIクローラーへのアクセスを積極的に許可する傾向がある可能性は考えられるが、これはあくまで一般的な推測であり、調査自体がその理由を明言しているわけではない点に注意したい。

Q8. robots.txtでAIクローラーをブロックしていないか、自社サイトで今すぐ確認する方法は

curl -s https://自社ドメイン/robots.txtを実行し、GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotの各セクションを直接確認するのが最も簡便だ。

自社サイトのrobots.txtファイルは、https://自社ドメイン/robots.txtにアクセスすれば誰でも直接閲覧できる。ターミナルからcurl -s https://example.com/robots.txtのようにコマンドを実行すれば、テキストとして内容を取得できる。User-agent: GPTBotのような行の直下にDisallow: /が記述されていないか、5つの主要AIクローラーそれぞれについて確認することが第一歩になる。あわせてワイルドカード(User-agent: *)のルールが意図せずAIクローラーにも適用されていないかも確認したい。

Q9. 主要5クローラー以外の小規模AIボットもブロックを確認すべきか

必要に応じて確認すべきだ。今回の調査では32%のサイトが主要5クローラー以外の小規模AIボットをブロックしていたことが分かっている。

GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotの5つは主要なAIクローラーとして広く認知されているが、それ以外にも様々な用途のAIボットが存在する。今回の調査では、調査対象50サイトの32%が、この5大クローラー以外の小規模AIボットを何らかの形でブロックしていたことが分かっており、AIクローラー全般への警戒感がすでに一定程度広がっていることを示している。自社の方針としてどこまでを許可するかは、サーバーログでの実際のアクセス状況の把握と合わせて検討することが望ましい。

Q10. robots.txtの設定を見直す際、どのくらいの頻度で行うべきか

Relevanceは四半期ごとの見直しを提言している。

新しいAIクローラーが今後も登場し続けると見込まれる中、robots.txtの設定を一度きりで終わらせるのではなく、定期的に棚卸しする運用に切り替えることが重要だ。Relevanceが提示したチェックリストの最後の項目は「四半期ごとに設定を見直す」ことであり、これは今回の調査が明らかにした「一度設定して放置される」という問題への直接的な処方箋と言える。robots.txtの現状確認、ワイルドカードルールの検証、方針の意図的な決定、CDN/WAFレベルの確認、User-Agent文字列の検証、サーバーログの確認という一連の手順を、四半期に一度のサイクルとして運用に組み込むことが推奨される。

関連記事

参考文献

  1. Blocking AI Crawlers: 1 in 5 Sites Do It by AccidentTechnori(参照: 2026-08-31)

関連用語

  • インデックス

    インデックスとは、クローラーが集めたページをGoogleがデータベースに登録すること。インデックスされて初めて検索結果に表示される対象になります。「索引」とイメージすると分かりやすい用語です。

  • llms.txt

    llms.txtとは、サイト運営者がAIクローラーに「このサイトの重要な情報はここ」と伝えるためのMarkdownファイルの提案。2024年9月にJeremy Howard氏が提唱し、急速に普及しつつある新しい標準です。

  • クローラー

    クローラーとは、Web上のページを自動巡回してデータを集めるプログラムのこと。Googleの「Googlebot」が代表例で、これに見つけてもらわないと検索結果に表示されません。

  • ChatGPT検索

    ChatGPT検索(ChatGPT Search)とは、OpenAIが2024年10月に公開した、ChatGPTがWebをリアルタイム検索して出典付きで回答する機能。Perplexityと並ぶLLMO主戦場のひとつです。

  • トークン

    トークンとは、LLMが文章を処理する最小単位。「単語」より細かく、英語なら約4文字 = 1トークン、日本語なら1〜2文字 = 1トークンが目安。API料金もトークン単位で決まります。

  • Perplexity

    Perplexity(パープレキシティ)とは、回答に必ず引用元(出典URL)を表示する米国発のAI検索エンジン。2022年公開で急速に成長中。LLMOで「サイテーションされる」最初の主戦場として重視されています。

関連記事

最新記事

LLMモニタリングツール比較7選|おすすめ・料金と順位の実測【2026年9月】 (llm-monitoring-tools-comparison-2026)
ツール比較基礎2026/06/07

LLMモニタリングツール比較7選|おすすめ・料金と順位の実測【2026年9月】

LLMモニタリングツール比較7選の料金実額に加え、検索上位10ページと本記事を自社スコアラーで採点した2026年9月19日の実測(LLMOスコアと検索順位は逆相関)を掲載。無料で足りる範囲と有料化の境界線を数値で示す。

#LLMモニタリングツール#LLMモニタリングツール おすすめ#モニタリングツール比較検討#AI回答引用
YouTube SEO 完全ガイド 2026 年版|雑学ショートから学べる検索流入の作り方 (youtube-seo-2026-japan-complete-guide)
SEO基礎2026/05/23

YouTube SEO 完全ガイド 2026 年版|雑学ショートから学べる検索流入の作り方

YouTube SEO の本質を 2026 年のアルゴリズムと AI 検索の文脈で再整理。雑学ショート動画運営者でも実践できる KW 選定・タイトル・サムネ・視聴維持率・Shorts と LLMO 引用の関係まで網羅した日本語ピラーガイド。

#YouTube SEO#YouTube アルゴリズム#YouTube Shorts#雑学チャンネル
YouTube 収益化 完全ガイド【2026 年版】6 つの収益モデルと月収目安の現実 (youtube-monetization-complete-guide-2026)
ツール比較基礎2026/05/17

YouTube 収益化 完全ガイド【2026 年版】6 つの収益モデルと月収目安の現実

YouTube 収益化を 2026 年時点の全 6 モデル(広告・Shorts・メンバーシップ・スパチャ・アフィリエイト・スポンサー)で体系化。YPP 条件・ジャンル別 RPM・月収目安まで、収益化までの最短ロードマップを解説。

#YouTube収益化#YPP#YouTubeパートナープログラム#RPM
動画 SEO 完全ガイド 2026|YouTube・Google・AI 検索の三軸最適化 (video-seo-complete-guide-2026)
ツール比較基礎2026/05/10

動画 SEO 完全ガイド 2026|YouTube・Google・AI 検索の三軸最適化

動画 SEO を YouTube・Google 検索・AI 検索の三軸で網羅。VideoObject スキーマ・字幕・動画サイトマップ・計測ツールまで25,000字で解説する2026年版決定ガイド。

#動画SEO#VideoObject#YouTube#AI検索
無料キーワード調査ツール完全比較 12 選【2026 年版・トラフィック獲得用ハブ】 (free-keyword-tools-master-comparison-2026)
ツール比較基礎2026/05/09

無料キーワード調査ツール完全比較 12 選【2026 年版・トラフィック獲得用ハブ】

無料で使えるキーワード調査ツール 12 選を徹底比較。サジェスト精度・検索ボリューム精度・日本語対応を 3 軸で評価し、個人ブロガーから BtoB SaaS まで用途別の最強組み合わせを解説します。

#無料キーワードツール#キーワード調査#比較#2026
Ahrefs無料版でできること・できないこと|エイチレフス無料の全上限【2026年9月】 (ahrefs-free-alternatives)
ツール比較基礎2026/05/06

Ahrefs無料版でできること・できないこと|エイチレフス無料の全上限【2026年9月】

Ahrefs無料版の上限と料金を2026年9月時点の実額で整理。できること・できないこと・0円代替7選。

#Ahrefs#Ahrefs無料#エイチレフス#代替ツール

LLMO カテゴリの他の記事