AIクローラー誤ブロック調査、22%が意図せず遮断
Relevance社の調査で50サイト中11サイト(22%)が主要5大AIクローラーのいずれかをrobots.txtで意図せずブロックしていたと判明。メディア業界は71%が該当。原因と対応策を解説する。
目次(33項目)
- 何が起きたのか
- 調査の概要
- 主要データ:22%が少なくとも1つをブロック
- 業種別のブロック率:メディア業界が突出
- 個別サイトの具体例
- 原因分析:「事故」としてのブロック
- Relevanceが提示した7項目の実務チェックリスト
- aiseo-llmo.com ユーザーへの影響
- 背景・経緯の整理:robots.txtは「検索エンジン向け」に設計された歴史を持つ
- Google-Extendedをブロックする意味を正しく理解する
- 業種別の実務インパクト
- 国内外の反応
- 今すぐできる対応策
- 1. robots.txtの現状を確認する
- 2. ワイルドカードルールの影響範囲を検証する
- 3. 許可/ブロックの方針を意図的に決定する
- 4. CDN・WAF・ファイアウォールレベルの追加ブロックを確認する
- 5. User-Agent文字列が最新かどうかを検証する
- 6. サーバーログで実際のクローラーアクセス状況を確認する
- 7. 四半期ごとに設定を見直す
- 今後の見通し
- よくある質問
- Q1. 今回の調査は日本のサイトも対象に含まれているのか
- Q2. GPTBotをブロックすると何が起こるのか
- Q3. Google-Extendedをブロックすると検索順位に影響するか
- Q4. なぜメディア/ニュース業界のブロック率が71%と突出して高いのか
- Q5. NPRが5大クローラー全てをブロックしているのはなぜか
- Q6. WebMDとHealthlineの設定が「一貫性がない」とされるのはなぜか
- Q7. eコマース・金融業界のブロック率が0%なのはなぜか
- Q8. robots.txtでAIクローラーをブロックしていないか、自社サイトで今すぐ確認する方法は
- Q9. 主要5クローラー以外の小規模AIボットもブロックを確認すべきか
- Q10. robots.txtの設定を見直す際、どのくらいの頻度で行うべきか
- 関連記事
AIクローラー誤ブロック調査、22%が意図せず遮断
要点: メディア・テクノロジー分析を手がけるRelevance社が50サイトのrobots.txtを実地調査した結果、22%(11サイト)が主要5大AIクローラー(GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBot)のいずれかをブロックしていたことが判明した。 業種別ではメディア/ニュース業界が71%、医療業界が50%と突出して高く、eコマース・金融業界はブロック0%だった一方、NPRのみが5大クローラー全てをブロックする唯一のサイトだったなど、対応にはばらつきが大きい。 調査を行ったKate Shaw氏は、多くのケースが「熟慮されたポリシーではなく、一度設定して以来見直されていない放置状態」だと指摘しており、Relevanceは7項目のチェックリストによる定期見直しを提言している。
最終更新日: 2026年8月31日
何が起きたのか
調査の概要
メディア・テクノロジー分析を手がけるRelevance社は2026年8月18日、著者Kate Shaw氏名義でtechnori.comに「Blocking AI Crawlers: 1 in 5 Sites Do It by Accident」と題した調査記事を公開した。タイトルが示す通り、調査の核心は「5サイトに1サイトが、意図せずAIクローラーをブロックしている」という指摘にある。
調査対象は50サイトで、業種はメディア/ニュース、SaaS、eコマース、金融、医療、教育、非営利/政府、ブログ/クリエイター、旅行/地域、マーケティング/SEOの10業種に分類され、各業種あたり4〜7サイトが選定された。手法としては、各ドメインの実際のrobots.txtファイルをプログラムで取得・解析し、GPTBot(OpenAI)、ClaudeBot(Anthropic)、PerplexityBot(Perplexity)、Google-Extended(Googleの生成AI学習オプトアウト用トークン)、CCBot(Common Crawl)という5つの主要AIクローラーに対するアクセス許可・拒否の設定状況を機械的に確認している。
主要データ:22%が少なくとも1つをブロック
調査結果として、50サイト中11サイト(22%)が、5大AIクローラーのうち少なくとも1つをDisallowしていたことが確認された。クローラー別のブロック率は以下の通りだ。
| クローラー | 運営元 | ブロック率 |
|---|---|---|
| GPTBot | OpenAI | 18% |
| CCBot | Common Crawl | 18% |
| ClaudeBot | Anthropic | 14% |
| Google-Extended | 8% | |
| PerplexityBot | Perplexity | 4% |
GPTBotとCCBotが同率でもっともブロック率が高く、次いでClaudeBot、Google-Extended、PerplexityBotの順となっている。これらのクローラーは、ChatGPT検索・Claude・Perplexity等の生成AI検索サービスがウェブページを引用・要約する際の情報収集経路として機能しており、ブロックされたサイトは理論上、これらのサービスからの引用・言及の機会を失っている可能性がある。
業種別のブロック率:メディア業界が突出
業種別に見ると、ブロック傾向には極めて大きな偏りがあることが分かる。
| 業種 | ブロック率(目安) |
|---|---|
| メディア/ニュース | 71% |
| 医療 | 50% |
| その他の業種(SaaS、教育、非営利/政府、ブログ/クリエイター、旅行/地域、マーケティング/SEOなど) | 25%以下 |
| eコマース | 0% |
| 金融 | 0% |
メディア/ニュース業界のブロック率71%は、他業種と比べて突出して高い数値だ。医療業界も50%と高水準であり、この2業種が調査対象50サイト全体のブロック傾向を強く牽引していることがうかがえる。対照的に、eコマースと金融業界はブロック率0%で、AIクローラーを制限なく受け入れる姿勢が明確だった。
さらに、5大クローラー以外にも視野を広げると、調査対象50サイトのうち32%が、主要5クローラー以外の小規模AIボットをブロックしていたことも分かっている。つまり「主要5クローラーはブロックしていないが、その他のAIボットは何らかの形で制限している」というサイトも一定数存在し、AIクローラー全般への警戒感がすでに広がっていることを示している。
個別サイトの具体例
Relevanceの調査では、個別サイトの設定例もいくつか紹介されている。それぞれ異なるパターンを示しており、robots.txt運用の実態を理解する上で参考になる。
- NPR: 調査対象50サイトの中で唯一、5大AIクローラー全てをブロックしていたサイトだった。GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotのいずれも許可しない、もっとも徹底したブロック方針を取っている。
- WebMDとHealthline: いずれもGPTBot・ClaudeBot・CCBotの3クローラーをブロックする一方、Google-ExtendedとPerplexityBotは通過させる設定になっていた。同じ「生成AIの学習・検索利用」を目的とするクローラーであるにもかかわらず、対応にばらつきがある点は、一貫した方針に基づく設定というより、場当たり的な追加・編集の積み重ねを示唆する例として挙げられている。
- Khan Academy: ブロック対象がGPTBotのみという、逆に限定的な設定だった。他の4クローラー(ClaudeBot、PerplexityBot、Google-Extended、CCBot)はすべて許可されており、なぜGPTBotだけが対象になっているのか、明確な方針が見えにくい設定例として紹介されている。
原因分析:「事故」としてのブロック
Kate Shaw氏はこの調査結果について、多くのケースが意図的なポリシーの結果ではないと分析している。氏の指摘の趣旨は、「これらは熟慮されたポリシーには見えない。誰かが一度robots.txtファイルを編集し、その時点で存在していたクローラーをブロックし、その後一度も見直していない」というものだ。
背景には、AIクローラーの多くが2023年前後に相次いで登場・稼働を開始した経緯がある。GPTBotは2023年8月、ClaudeBotやCCBotも同時期以降に広く認知されるようになったが、Relevanceの調査結果を踏まえると、多くのサイトはその当時に一度robots.txtへ設定を加えた後、新しいAIクローラー(PerplexityBotやGoogle-Extendedなど、稼働開始時期が異なるクローラー)が登場しても、設定を更新していない傾向がうかがえる。
WebMDとHealthlineの「一部クローラーのみブロック」という一貫性のない設定や、Khan Academyの「GPTBotだけをブロック」という設定は、いずれも意図的な方針決定というよりも、その時々の事情で個別にクローラー名を追加・削除した結果、全体として一貫性を欠いた状態になっている可能性を示す例と言える。つまり、この調査が示す本質的な問題は「意図的なブロック方針」そのものではなく、放置と設定の継承(inherit)によって生じる「事故」的なブロックにあるというのが、Relevance/Kate Shaw氏の指摘の核心だ。
Relevanceが提示した7項目の実務チェックリスト
Relevanceは記事の中で、サイト運営者がrobots.txtの状態を点検するための実務チェックリストを提示している。趣旨は以下の7項目に整理できる。
- robots.txtの現状を実際に確認する
- ワイルドカードルールの影響範囲を検証する
- どのクローラーを許可/ブロックするか意図的に方針決定する
- CDN・WAF・ファイアウォールレベルでの追加ブロックも確認する(robots.txtだけでは不十分)
- User-Agent文字列が最新かどうかを検証する
- サーバーログで実際のクローラーアクセス状況を確認する
- 四半期ごとに設定を見直す
このチェックリストは、robots.txtというテキストファイル単体の設定だけでなく、CDNやWAF(Web Application Firewall)レベルでの追加的なブロックルールの有無、User-Agent文字列自体の陳腐化(新しいクローラーのUser-Agentがルールに反映されていない状態)、そして実際のアクセスログとの突き合わせまで含めた、多層的な点検を求めている点が特徴的だ。
aiseo-llmo.com ユーザーへの影響
背景・経緯の整理:robots.txtは「検索エンジン向け」に設計された歴史を持つ
robots.txtという仕組みは、そもそも1990年代半ばにGooglebotをはじめとする従来型の検索エンジンクローラーを制御する目的で普及した、長い歴史を持つ標準規格だ。長年にわたり、多くのサイト運営者にとってrobots.txtは「検索エンジンのインデックスをコントロールするためのファイル」という認識で運用されてきた。
しかし、2022年末以降の生成AIサービスの急速な普及に伴い、GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotといった、生成AIの学習データ収集やAI検索の情報収集を目的とする新しいクローラーが次々と登場した。これらのクローラーは、従来の検索エンジンクローラーとは目的も運営元も異なるにもかかわらず、robots.txtという同じ仕組みの中でUser-Agent名を指定してアクセス可否を制御する形になっている。
この結果として起こりうるのが、今回のRelevance調査が示すような「設定の陳腐化」だ。ある時点でのAIクローラー一覧を基準にrobots.txtを設定した後、新しいクローラーが登場しても更新されない状態が続けば、意図せずして「一部の新しいAIクローラーだけが素通り」「一部の古いAIクローラーだけがブロックされたまま」という一貫性のない状態が生まれる。こうした傾向は、本調査に限らず、Cloudflareのネットワークトラフィック分析など他の複数の調査でも類似の指摘が報告されており、robots.txtの「AIクローラー時代への未対応」は業界全体で共通して観測されている論点と言える。
Google-Extendedをブロックする意味を正しく理解する
今回の調査データを解釈する上で、技術的に押さえておくべき重要な点がある。それは、Google-Extendedが検索インデックス構築を担うGooglebotとは別のトークンだということだ。
Google-Extendedは、Geminiをはじめとする生成AIの学習データ収集をオプトアウトするための専用のUser-Agentトークンであり、これをrobots.txtでブロックしても、Google検索やAI Overviewsでのそのサイトの表示自体には影響しない。つまり「学習データとしての利用のみを拒否し、検索結果・AI Overviewsへの表示は維持する」という選択が可能な設計になっている。
この技術的な違いを理解しないまま、GPTBotやClaudeBotと同列に「AIクローラー全般」としてGoogle-Extendedを一括ブロックしてしまうと、本来は区別して運用できたはずの「検索表示の維持」と「AI学習データ提供の拒否」という2つの目的を、意図せず混同してしまう恐れがある。今回の調査でGoogle-Extendedのブロック率が8%と、GPTBot(18%)やCCBot(18%)と比べて低めに出ている背景には、こうした技術的な性質の違いが一定程度反映されている可能性もあるが、この点について本調査自体が明言しているわけではない。
業種別の実務インパクト
今回の調査結果を、業種ごとの実務インパクトという観点で整理すると、以下のような傾向が見えてくる。
| 業種 | 調査でのブロック率 | 想定される実務インパクト |
|---|---|---|
| メディア/ニュース | 71% | AI検索・AIアシスタントでのニュース引用・要約対象から外れる機会損失が大きい。著作権・コンテンツ盗用への懸念、ライセンス交渉との兼ね合いが背景として語られることが多い業種だが、本調査自体はその理由を明言していない |
| 医療 | 50% | 健康・医療情報を求めるユーザーがAI検索で情報源を探す際、専門性の高いサイトが回答生成の情報源候補から外れるリスクがある。WebMD・Healthlineのように一貫性を欠く設定も見られ、方針の再点検が特に必要な業種 |
| SaaS・教育・非営利/政府・ブログ/クリエイター・旅行/地域・マーケティング/SEO | 25%以下 | 業種全体としてはブロック率が低いが、個別サイトごとに設定が異なりうるため、自社の設定を個別に確認する必要がある |
| eコマース | 0% | 調査対象内では全サイトがブロックなし。AI検索経由での商品比較・レコメンド機会を維持する方向で運用されている |
| 金融 | 0% | 調査対象内では全サイトがブロックなし。ただし規制業種特有の情報の正確性・引用リスクへの配慮は別途必要になりうる |
この表からも分かる通り、業種によってブロック傾向には大きな差があり、「自社の業種だから安全/危険」と単純に判断することはできない。同じメディア業界の中でもNPRのように徹底的にブロックするサイトもあれば、逆にブロックを一切していないメディアサイトも存在すると考えられ、最終的には個別サイトごとのrobots.txtを直接確認する以外に実態を把握する方法はない。
国内外の反応
Relevanceの調査結果自体は米国のメディア・SaaS等を中心とした50サイトを対象にしたものであり、日本国内のサイトを直接対象にした調査ではない点は明記しておきたい。ただし、AIクローラーの実装・robots.txtの標準仕様はグローバル共通であり、日本国内のサイトでも同様の「設定の陳腐化」が起こりうる構造的な条件は変わらない。
海外では、今回のRelevanceの調査以前にも、Cloudflareが自社のネットワークトラフィックデータを用いてAIクローラーのアクセス状況を分析するレポートを継続的に公開しており、多くのサイトがAIクローラーへの対応方針を明確化できていない実態が指摘されてきた経緯がある。今回のRelevance調査は、その延長線上で「実際にrobots.txtの記述内容を直接調べる」という手法を取ることで、より具体的な業種別・クローラー別の数値を示した点に特徴があると言える。
今すぐできる対応策
Relevanceが提示した7項目のチェックリストに沿って、具体的な確認手順とrobots.txtの記述例を示す。
1. robots.txtの現状を確認する
まずは自社サイトの実際のrobots.txtファイルの内容を、直接確認することから始める。
curl -s https://example.com/robots.txt
このコマンドで、サイトのルート直下に配置されたrobots.txtの内容をそのまま表示できる。Disallow: /がUser-agent: GPTBotやUser-agent: ClaudeBotなどのブロックの直下に記述されていないか、一行ずつ確認する。
2. ワイルドカードルールの影響範囲を検証する
User-agent: *のように、すべてのクローラーを対象にしたワイルドカードルールが存在する場合、そのルールが意図せずAIクローラーにも適用されていないかを確認する必要がある。例えば以下のような記述は、明示的に個別クローラーを指定していない限り、GPTBotやClaudeBotを含むすべてのクローラーに影響する。
User-agent: *
Disallow: /admin/
Disallow: /search/
このようなワイルドカードルールの範囲に、意図せず主要なコンテンツディレクトリが含まれていないか、パス単位で洗い出す。
3. 許可/ブロックの方針を意図的に決定する
「なんとなく」ではなく、自社のビジネス方針として、各AIクローラーを許可するかブロックするかを明文化する。方針決定の例として、以下のような記述パターンが考えられる。
AI検索での引用・言及を積極的に狙う場合(すべて許可)
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: CCBot
Allow: /
AI検索での引用は許可しつつ、生成AIの学習データ提供のみを避けたい場合
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
この設定例では、AI検索エンジン(ChatGPT検索、Claude、Perplexity)からの引用・言及の経路となるクローラーは許可しつつ、Google-Extended(Geminiなどの学習データ収集専用トークン)とCCBot(学習データセットとして広く再配布されるCommon Crawl)についてのみ拒否する、という区別を明示的に行っている。前述の通り、Google-Extendedのブロックは検索表示自体には影響しない設定であるため、こうした使い分けが技術的に可能だ。
特定のクローラーのみをブロックしたい場合(意図を明記するコメント付き)
# 2026年8月方針レビュー: 著作権懸念によりCCBotのみブロック
# 他のAIクローラー(GPTBot/ClaudeBot/PerplexityBot/Google-Extended)は許可
User-agent: CCBot
Disallow: /
コメント(#から始まる行)に方針決定の日付と理由を残しておくことで、今回の調査が指摘するような「誰が何のために設定したか分からない」状態を防ぎ、次回の見直し時に判断の経緯を追いやすくなる。
4. CDN・WAF・ファイアウォールレベルの追加ブロックを確認する
robots.txtはあくまでクローラー側の「自主的な遵守」を前提とした仕組みであり、実際のアクセス制御はCDNやWAF(Web Application Firewall)、リバースプロキシの設定で別途行われている場合がある。CloudflareやAkamaiなどのCDNサービスを利用している場合、管理画面でBot Managementやファイアウォールルールの設定を確認し、robots.txtでは許可しているにもかかわらず、CDNレベルで特定のAIクローラーのUser-Agentやアクセス元IPレンジがブロックされていないかを点検する必要がある。robots.txtの記述だけを見直しても、CDN側の設定が食い違っていれば実効性がない点に注意したい。
5. User-Agent文字列が最新かどうかを検証する
各AIクローラーが使用する正式なUser-Agent文字列は、運営元の公式ドキュメントで随時公開・更新されている。robots.txt内の記述が、古いUser-Agent名や誤字を含んでいないか、公式情報と照合して確認する。文字列が一致していなければ、意図した通りのブロック(または許可)が実際には機能していない可能性がある。
6. サーバーログで実際のクローラーアクセス状況を確認する
robots.txtの記述内容だけでなく、実際にどのクローラーがどのページにアクセスしているかをサーバーログやCDNのアクセスログから確認する。
grep -i "GPTBot\|ClaudeBot\|PerplexityBot\|Google-Extended\|CCBot" access.log | awk '{print $1, $7}' | sort | uniq -c | sort -rn | head -50
このようなコマンドで、各AIクローラーのUser-Agentごとにアクセス先パスを集計すれば、robots.txtの設定が実際のアクセス状況に反映されているか(ブロックしたつもりのクローラーが実は依然としてアクセスしているケースがないか、逆に許可しているはずのクローラーがそもそも一度もアクセスしていないケースがないか)を具体的に把握できる。クローラーログの体系的な分析手順については、AIクローラー ログ解析完全ガイドで詳しく解説している。
7. 四半期ごとに設定を見直す
今回の調査結果が突きつける最大の教訓は、「一度設定したら終わり」ではなく、「定期的な見直しが前提の運用」に切り替える必要があるということだ。新しいAIクローラーは今後も登場し続けると見込まれ、robots.txtやCDN設定を四半期に一度は棚卸しし、上記1〜6の手順を通しで再実行するサイクルをカレンダーに組み込んでおくことが望ましい。robots.txtとAI学習用・検索用クローラーの使い分け戦略についてはrobots.txtの学習用・検索用クローラー分離戦略、llms.txtとの役割の違いはrobots.txtとllms.txtのSEO/LLMOへの影響の違いも参考にしてほしい。
今後の見通し
Relevanceの調査は50サイトという限定的なサンプルではあるものの、robots.txtの「AIクローラー時代への未対応」という構造的な問題を、業種別・クローラー別の具体的な数値で可視化した点に意義がある。今後、GPTBot・ClaudeBot・PerplexityBotに続く新たなAIクローラーが登場するたびに、同様の「設定の陳腐化」が繰り返される可能性は高く、サイト運営者側には一度きりの設定ではなく継続的な棚卸しの運用が求められる流れが強まると考えられる。また、robots.txtだけでは表現しきれない「学習利用の可否」や「引用時のライセンス条件」を扱う新しい仕組み(llms.txtやContent Signalsポリシーなど)の議論も並行して進んでおり、robots.txt単体でのAIクローラー制御には限界があるという認識も今後さらに広がっていくとみられる。
よくある質問
Q1. 今回の調査は日本のサイトも対象に含まれているのか
含まれていない。調査対象は米国を中心とした50サイトで、日本国内サイトを直接検証したものではない。
Relevanceの調査は、メディア/ニュース、SaaS、eコマース、金融、医療、教育、非営利/政府、ブログ/クリエイター、旅行/地域、マーケティング/SEOという10業種、計50サイトを対象にしており、いずれも英語圏を中心としたサイトとみられる。ただし、robots.txtの標準仕様やAIクローラーの実装はグローバル共通であるため、同様の「設定の陳腐化」が日本国内のサイトでも起こりうる構造的な条件は変わらない。自社サイトについては、本記事で紹介した手順を用いて個別に確認することを推奨する。
Q2. GPTBotをブロックすると何が起こるのか
ChatGPT検索など、GPTBotを情報収集経路とする生成AIサービスでの引用・言及の機会を失う可能性がある。
GPTBotはOpenAIが運営するクローラーで、ChatGPT検索をはじめとするサービスがウェブページを引用・要約する際の情報収集経路の一つとされている。robots.txtでGPTBotをDisallowに設定すると、そのクローラーが自社サイトのコンテンツを収集できなくなり、結果としてChatGPT検索などの回答生成における引用元候補から外れる可能性がある。今回の調査ではGPTBotのブロック率が18%と、CCBotと並んで最も高い水準だった。
Q3. Google-Extendedをブロックすると検索順位に影響するか
影響しない。Google-ExtendedはGooglebotとは別のトークンで、生成AIの学習データ収集のオプトアウト専用として機能する。
Google-Extendedをrobots.txtでブロックしても、Google検索の通常のインデックス構築や検索順位、AI Overviewsでの表示自体には影響しないとされている。あくまで「Geminiなどの生成AIの学習データとしての利用」のみを拒否する設定であり、検索エンジンとしての基本機能を担うGooglebot本体とは別個に制御できる点が技術的な特徴だ。この違いを理解せずに、他のAIクローラーと同列に一括ブロックしてしまうと、意図しない形で選択肢を狭めてしまう可能性がある。
Q4. なぜメディア/ニュース業界のブロック率が71%と突出して高いのか
本調査自体は明確な理由を述べていないが、著作権・コンテンツ盗用への懸念やライセンス交渉との兼ね合いが一般的に語られることが多い。
Relevanceの調査データでは、メディア/ニュース業界のブロック率が71%と、他業種と比べて突出して高いことが示されている。ただし、この調査自体はその背景理由を明言しておらず、著作権保護やライセンス交渉戦略との関連は、あくまで一般的に語られる文脈として理解すべきである。個別サイトごとの意思決定の背景は、公表された調査データからは特定できない。
Q5. NPRが5大クローラー全てをブロックしているのはなぜか
調査データからは、NPRが5大AIクローラー全てをブロックしている唯一のサイトだったことのみが確認されており、その背景理由についての言及はない。
今回の調査では、GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotの5つすべてをブロックしていたサイトはNPRのみだった。これは調査対象50サイトの中でもっとも徹底したブロック方針であり、意図的な方針の結果である可能性が高いが、Relevanceの記事自体はNPRの意思決定の理由には触れていない。
Q6. WebMDとHealthlineの設定が「一貫性がない」とされるのはなぜか
GPTBot・ClaudeBot・CCBotはブロックする一方、Google-ExtendedとPerplexityBotは通過させており、統一的な方針が見えにくいためだ。
両サイトとも、5大クローラーのうち3つ(GPTBot・ClaudeBot・CCBot)をブロックしながら、残り2つ(Google-Extended・PerplexityBot)は許可するという設定になっていた。同じ「生成AIによる情報収集」という目的を持つクローラー群であるにもかかわらず対応が分かれている点は、Kate Shaw氏が指摘する「一度編集して以降見直されていない」設定の典型例として紹介されている。
Q7. eコマース・金融業界のブロック率が0%なのはなぜか
調査データでは0%という結果のみが示されており、明確な理由についての言及はない。
Relevanceの調査では、eコマース業界と金融業界のブロック率がいずれも0%だったことが示されている。この2業種はAI検索経由での商品比較・サービス比較・レコメンド機会を重視し、AIクローラーへのアクセスを積極的に許可する傾向がある可能性は考えられるが、これはあくまで一般的な推測であり、調査自体がその理由を明言しているわけではない点に注意したい。
Q8. robots.txtでAIクローラーをブロックしていないか、自社サイトで今すぐ確認する方法は
curl -s https://自社ドメイン/robots.txtを実行し、GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotの各セクションを直接確認するのが最も簡便だ。
自社サイトのrobots.txtファイルは、https://自社ドメイン/robots.txtにアクセスすれば誰でも直接閲覧できる。ターミナルからcurl -s https://example.com/robots.txtのようにコマンドを実行すれば、テキストとして内容を取得できる。User-agent: GPTBotのような行の直下にDisallow: /が記述されていないか、5つの主要AIクローラーそれぞれについて確認することが第一歩になる。あわせてワイルドカード(User-agent: *)のルールが意図せずAIクローラーにも適用されていないかも確認したい。
Q9. 主要5クローラー以外の小規模AIボットもブロックを確認すべきか
必要に応じて確認すべきだ。今回の調査では32%のサイトが主要5クローラー以外の小規模AIボットをブロックしていたことが分かっている。
GPTBot・ClaudeBot・PerplexityBot・Google-Extended・CCBotの5つは主要なAIクローラーとして広く認知されているが、それ以外にも様々な用途のAIボットが存在する。今回の調査では、調査対象50サイトの32%が、この5大クローラー以外の小規模AIボットを何らかの形でブロックしていたことが分かっており、AIクローラー全般への警戒感がすでに一定程度広がっていることを示している。自社の方針としてどこまでを許可するかは、サーバーログでの実際のアクセス状況の把握と合わせて検討することが望ましい。
Q10. robots.txtの設定を見直す際、どのくらいの頻度で行うべきか
Relevanceは四半期ごとの見直しを提言している。
新しいAIクローラーが今後も登場し続けると見込まれる中、robots.txtの設定を一度きりで終わらせるのではなく、定期的に棚卸しする運用に切り替えることが重要だ。Relevanceが提示したチェックリストの最後の項目は「四半期ごとに設定を見直す」ことであり、これは今回の調査が明らかにした「一度設定して放置される」という問題への直接的な処方箋と言える。robots.txtの現状確認、ワイルドカードルールの検証、方針の意図的な決定、CDN/WAFレベルの確認、User-Agent文字列の検証、サーバーログの確認という一連の手順を、四半期に一度のサイクルとして運用に組み込むことが推奨される。
関連記事
参考文献
- Blocking AI Crawlers: 1 in 5 Sites Do It by Accident — Technori(参照: 2026-08-31)
関連用語
- インデックス
インデックスとは、クローラーが集めたページをGoogleがデータベースに登録すること。インデックスされて初めて検索結果に表示される対象になります。「索引」とイメージすると分かりやすい用語です。
- llms.txt
llms.txtとは、サイト運営者がAIクローラーに「このサイトの重要な情報はここ」と伝えるためのMarkdownファイルの提案。2024年9月にJeremy Howard氏が提唱し、急速に普及しつつある新しい標準です。
- クローラー
クローラーとは、Web上のページを自動巡回してデータを集めるプログラムのこと。Googleの「Googlebot」が代表例で、これに見つけてもらわないと検索結果に表示されません。
- ChatGPT検索
ChatGPT検索(ChatGPT Search)とは、OpenAIが2024年10月に公開した、ChatGPTがWebをリアルタイム検索して出典付きで回答する機能。Perplexityと並ぶLLMO主戦場のひとつです。
- トークン
トークンとは、LLMが文章を処理する最小単位。「単語」より細かく、英語なら約4文字 = 1トークン、日本語なら1〜2文字 = 1トークンが目安。API料金もトークン単位で決まります。
- Perplexity
Perplexity(パープレキシティ)とは、回答に必ず引用元(出典URL)を表示する米国発のAI検索エンジン。2022年公開で急速に成長中。LLMOで「サイテーションされる」最初の主戦場として重視されています。
関連記事
最新記事
LLMO カテゴリの他の記事
- Googleがスクレイピング遮断を再強化、ランク追跡ツールで約80%失敗
- フロリダ企業94%がAI検索で不可視、28,488社調査で判明
- Podcast Citation Index 2026で読むポッドキャストAI引用の実態
- Google、検索結果ページの検索バーに『AI Mode』ボタンをテスト
- Google Search Profiles、フォロワー要件が1万人に大幅緩和
- Googleローカルナレッジパネルが「AI Overview」化、店舗情報もAI生成へ
- GSCのAI掲載順位計測、Mueller氏「仕組み自体が今後も進化する」と発言
- コンテンツマーケの成果、過去12年で最低水準に AI活用92%でも相関なしと調査
- Google Ads実データが示す検索クエリ語数シフト、AI Mode時代の広告と検索
- AI検索引用シェアが4日で86%消失、Itera「2026年8月LLMOトレンドレポート」
- SEO専門家131人調査で判明、2026年Googleランキング要因とAI回答への含意
- Google Mueller氏「低品質な量産ページで信頼失う」プログラマティックSEOに警鐘
- AI検索の引用ドメイン、YouTubeが2か月連続首位に――2026年8月号
- ChatGPTユーザーの95%はGoogleも併用、外部クリックは18.8pt減──検索行動の研究が示す実態
- 米サイト訪問数調査、ChatGPT+48%増と『未計測トラフィック』急増の実態
- ChatGPT、EUで「非常に大規模な検索エンジン」に正式指定——DSA厳格規制へ
- Anthropicの『見えない透かし』義務化、LLMO/SEOコンテンツ制作者への実務インパクトをSELが分析
- 通話・クリック減少、ルート案内急増——Google Mapsが「目的地」化するデータ
- AI検索で画像が「新しい仕事」を持つ時代へ ― Google特許が示す画像優先の兆候
- ChatGPT拡張機能でYouTube動画に質問するやり方|要約後の深掘りプロンプトとLLMO視点
- ChatGPT、EUユーザー限定でShoppingタブをサイドバーに常設化
- Google、site reputation abuse手動ペナルティをEEA域内で不適用に
- Google検索結果のリンクが「goto」リダイレクト化、スクレイピング対策が本格展開
- Google August 2026スパムアップデート、通常の1.8倍の順位変動とSE Ranking調査で判明
- SOCi Local Visibility Index 2026とは?多店舗ブランドのAI推薦率を独自データで解説
- GSC「生成AIレポート」にロギングバグ、8/13〜17分のインプレッションが過少計上
- GoogleのJohn Mueller氏『GEOに特別な対応は不要』と明言 ― LLMO実務者の読み解き方
- PR Newswire AEO GEO Brand Reportとは|機能と指標を日本語で先行解説
- llms.txt W3C標準化提案とは?2026年6月の転換点を解説
- 4,100万件の通話データが示す「AI検索が値切り済みの買い手を連れてくる」現象
- LLMO/GEOはまだ「SEO」と呼ばれている――343人調査で判明した用語・予算・ベンダー選定の実態
- バリ島飲食店4,776軒調査、AIが85.6%を一度も推薦せず
- Ahrefs業界別AI引用傾向調査2026|YouTubeが9パターン中8割で1位
- Google AIO、Facebookを1,950万回引用──BrightEdge300万検索調査
- Claude MCPでYouTube要約を設定する方法|インストールから運営者の視点まで
- ChatGPT・Perplexity・Gemini、同じ質問でも引用104ソース一致せず
- Google検索ファビコン表示不具合、AI Overview引用のブランド視認性への影響を整理
- Google August 2026スパムアップデート完了、AI大量生成コンテンツのリスクを再点検する
- YouTube Studio「Ask Studio」の使い方とLLMO活用ガイド
- Perplexity Comet AIチューターでYouTubeを学ぶ活用法完全ガイド
- Gemini in Chrome YouTube要約とは?動画がAIに正しく引用される対策5つ【2026年8月】
- GeminiはWebサイト、ChatGPTはReddit依存──ローカルAI引用調査
- Substack Citation Index 2026|ニュースレターAI引用ランキング調査を読み解く
- JavaScriptナビゲーションはAI検索から見えない——41日間の実験が実証
- AI引用ランキング要因23シグナル完全ガイド|Zyppy最新研究を徹底解説
- RedditのChatGPT Search引用が4日で86%急落、Promptwatch報告
- AI Overview流入の22.4%が『Direct』に誤集計――9ヶ月・5万件超の実測研究
- 『引用されるパッセージ』と『吸収されるパッセージ』の違いをAdvanced Web Rankingが実証
- Cloudflare AEO可視化ダッシュボードとは?引用スコアの仕組みを解説
- Fractl調査、SEO強者でもAI検索で消えるブランド格差が判明
- Google研究:AIの誤答は『知識不足』でなく『想起失敗』が主因
- HEO(ハイブリッドエンジン最適化)とは|SEO・AEO・GEOを統合する新戦略
- A-Comm Evidence Protocol(AEP)とは?エージェント商取引の証跡標準を解説
- Similarweb「AI Ads」発表、ChatGPT/Google AI広告の可視化開始
- AI可視性の向上は「技術的負債の返済」に過ぎない場合が多い
- Time誌のAI向け隠し広告をPerplexityがブロック、クローキング論争が再燃
- AI経由の直接リファラルはわずか1.1%、だが言及されると来訪+20pt――Scrunch調査
- Google AI Overview、ローカル検索で低品質リスト記事を引用する問題が発覚
- Microsoft Publisher Content Marketplaceとは?Copilot引用収益化の仕組み
- ChatGPTの『Sources』ボタンが消える?『More actions』内に移動するテスト確認
- GSC生成AIレポートが「事実上グローバル全展開」に――ポップアップ通知も初確認
- AI検索時代、従来の被リンク構築モデルはなぜ機能しなくなったのか
- Meta、独自AI検索エンジン構築か クローラー急増で『脱Google』観測情報
- 『cats.txt』実験が示すllms.txt「証拠」の脆弱さとGEO業界の課題
- GenZがClaude・OpenAIを消費財ブランド視——信頼度は42ポイント差
- Cloudflareの「AI Training ブロック」設定でGooglebotも巻き添えに
- 税理士サイト1000件調査、AI検索対応はわずか5.8%の衝撃
- ChatGPT/Claude/Geminiへの戦略相談、鍵は「プロンプト」より「ビジネス文脈」
- 『群盲象を評す』――AI検索の需要創出、6つの視点をSEJが整理
- 順位トラッキングの死角――『1位』でも顧客に見えない検索結果の実態
- AIリードの8〜9割が『オーガニック』に誤分類――SEJが示す新計測の3本柱
- ChatGPTの英語バイアス指数2.6倍——多言語サイトのAI可視性調査
- 採用広報のLLMO対策|候補者がChatGPTで会社を調べる時代の評判管理
- 「広く展開」か「狭く深く」か——Semrushデータが示すトピカルフォーカスの正体
- ChatGPTが自社の間違った情報を答えるときの修正方法|原因と5つの対処手順
- 「LLMO対策は意味ない」は本当か?効果が出るケースと出ないケースを検証
- LLMO対策のデメリットと7つのリスク|やってはいけない施策も解説【2026年】
- 士業のLLMO対策|税理士・弁護士がAIに「おすすめ事務所」と挙げられる方法
- BtoB SaaSのLLMO対策を代行に頼むなら|AIに比較候補として挙げられる条件
- Aleyda Solis氏調査:AI検索は「第三者引用問題」、15ブランド分析
- ChatGPT引用の89%は「無主地」――Semrushデータが示すカテゴリ支配の窓
- AI生成記事は9カ月でほぼ消滅、人間執筆は1位獲得8倍――SELの実データ検証
- GSCの生成AIレポートは『罠』――インプレッション偏重の落とし穴をSEJが指摘
- Citadex調査:AI引用は多言語で56%消える、30ブランド横断データを読む
- AIブランド認知96%でも89%が未言及、Victorious調査の衝撃
- データ主導PRはAI引用が3.5倍——LeadCoverage実測レポート
- GSC「プラットフォームプロパティ」が全世界展開完了――SNS投稿のAI検索可視性を計測
- Claudeの共有チャットが検索に露出——disallowとnoindexの落とし穴
- 「アイデンティティ・リーク」とは――AI検索が企業を検証できない構造、71社調査で判明
- AI Overviews表示率が1年で15%→43%に急増、Similarweb調査で判明
- GEO対策「45件のレビューで判明」実は効果不明?批判的サーベイ論文を解説
- AI Overviewsオプトアウト機能とCMA規制の全体像|日本への波及可能性を読む
- ホワイトペーパー引用率わずか0.4% Optyino.ai調査25,001件が示す現実
- 中小企業がChatGPTに引用される方法|予算なしでできる90日ステップ
- AI引用25,337件の大規模調査——業界ごとに「引用フィンガープリント」が全く違うことが判明
- GoogleがAI生成コンテンツ起因のクロール・インデックス抑制を明言、「AIと分かる」記事は未登録リスク
- Instagramリールがai検索に引用される対策|2026年最新LLMO実践ガイド
- EU AI Act 第50条の透明性義務が8月2日適用開始 — AI記事量産の運用が変わる
- LinkedIn LLMO対策 BtoB企業が知るべき引用構造と日本の限界
- TikTok動画がAI検索に引用される対策|Perplexity統合時代のLLMO実践ガイド
- Pinterestビジュアル検索でAI引用と商品ピンを最適化する方法
- Cloudflare、AIクローラーを「Search/Agent/Training」の3分類で個別制御可能に
- NotebookLM動画概要にソースとして選ばれる最適化2026
- Claude Cowork エージェントのサイト操作に対応するAXO対策の実装手順
- Ask YouTube 会話型検索の動画対策|Geminiに引用される作り方
- Claude AI検索で引用されるサイトの作り方|3種ボットとllms.txt完全設定
- Perplexity Comet エージェント最適化 対策|AXOで操作を完遂させる実装
- 記事に埋め込んだYouTube動画のAI引用率は何倍になるか|独自診断データで検証
- 検索上位10位とAI引用の重複が76%→38%に急落:「順位=引用」神話の終焉
- 日本サイトのLLMO引用率調査2026|80万件分析でわかった実態
- Bing Copilotに引用されるYouTube LLMO最適化ガイド 日本語版2026
- Google Search Consoleに生成AIパフォーマンスレポート登場――AI引用の可視化が始まった
- Google June 2026スパムアップデート:AI OverviewsとAI Modeへのスパムポリシーが正式拡張、不自然な言及操作・大規模AI生成コンテンツが明示的禁止に
- ChatGPT Atlasに引用されるには?AIブラウザ時代の最適化ガイド2026
- YouTube動画をAIに要約されやすくする最適化ガイド
- Perplexityの通常検索でYouTube動画が引用される条件【2026年版】
- Gemini YouTube動画理解の仕組みと最適化:グラウンディングで引用される条件
- YouTubeチャンネルのE-E-A-T設計でAI引用の信頼性を高める方法
- PerplexityのYouTubeソース指定で動画を引用させる戦略【2026年7月時点】
- AIエージェントYouTube動画引用条件2026|視聴データより字幕構造が鍵
- YouTubeチャンネル説明で話者の専門性を明示してAI引用を獲得する実践ガイド
- NotebookLMでYouTubeが読み込めない原因と対処法|字幕なし動画の解決策
- YouTubeチャンネルのトピック権威性とAI推薦設計:海外ローカライズ戦略の核心
- NotebookLMでYouTube動画を記事に再利用する方法とAI引用戦略
- ChatGPTにYouTubeチャンネルをおすすめ・推薦させる方法【LLMO最適化】
- Perplexity YouTube動画引用シェア戦略:字幕・メタデータで被引用率を高める方法
- YouTube動画をAIに引用させる方法:ChatGPT・Perplexityに選ばれる条件と最適化手順
- AI Overview引用元トップ10比率が76%→38%に急落:順位依存SEOの終焉
- 著者情報あり/なしでAI引用率はどう変わるか|実測データで差を測定【2026年版】
- ローカルSEO×AI検索引用対策2026:地域ビジネスがAIに引用されるための完全手順
- AI Overview引用率 業種別データ|日本市場2026年版独自集計
- トピックオーソリティ × ピラー・クラスター設計の完全ガイド【独自データ付き】
- オウンドメディアのLLMO戦略完全ガイド|AI検索で引用されるコンテンツ設計と運用
- 不動産会社のLLMO対策完全ガイド|AI検索で引用される信頼性設計と実装手順
- GEO・AEO・LLMO・AIOの違いをわかりやすく解説【2026年版】
- ChatGPTで自分のサイトの引用を確認する方法【手順と注意点】
- ChatGPT引用される記事の書き方:構造・文体・配置の完全ガイド
- YouTube Shorts が AI 検索に引用される条件と最適化手順【2026年版】
- YouTube 文字起こし(字幕)の LLMO 最適化|AI が動画を理解するメカニズムと実践手法
- Perplexity が動画を回答に組み込むパターン分析と引用戦略【2026年版】
- ChatGPT が YouTube 動画を引用する条件と動画・記事セット投資戦略【2026年版】
- Gemini の動画理解とグラウンディング|Knowledge Graph 連携で引用される動画設計
- YouTube 概要欄 × 構造化データ設計で LLMO スコアを上げる実践ガイド
- VideoObject JSON-LD の LLMO 活用|AI 検索引用に効くスキーマ設計の具体実装
- YouTube チャンネルの E-E-A-T 強化戦略:AI 検索引用率を高める信頼設計
- Gemini グラウンディングの仕組みと Knowledge Graph 連携コンテンツ戦略
- NotebookLM の要約・引用品質を高める Sources 構造化最適化ガイド
- Perplexity 引用率を PDCA で改善する実践ガイド【2026年版】
- Claude AI 検索の引用パターン分析と日本語コンテンツ最適化戦略
- ChatGPT Search 引用率を継続改善する 2026 年運用フロー完全ガイド
- ChatGPT ジェネラティブSEO完全ガイド|生成AI時代の検索最適化戦略【2026年版】
- LLMハルシネーション対策|コンテンツ運用で誤情報引用リスクを下げる手法【2026年版】
- 構造化データで LLMO は伸びるか|Article / FAQPage / DefinedTerm の検証【2026年版】
- LLMO 成功事例の探し方|2026年に検索すべき情報源 12 選
- LLMO 監査チェックリスト 32 項目【2026年版・社内レビュー用】
- llms.txt の書き方|業種別テンプレート 6 種【2026年版】
- GEO・AEO・LLMO の違いと使い分け|どの概念を取り入れるべきか【2026年版】
- ChatGPTに引用されない原因を完全網羅|診断から対処法まで実務フローで解説
- AI 引用率の計測方法|手動とツールの再現性比較【2026年版】
- Perplexity SEO 完全ガイド|引用ソース選定の傾向と対策【2026年版】
- ChatGPT SEO の実践12手順|引用される記事の書き方【2026年版】
- ChatGPTに自社サイトを掲載させる方法|2026年版チェックリスト30項目
- LLMOスコアの作り方|100点満点の重み付けと業界平均の読み解き方
- LLMO計測の始め方|サンプリング設計とKPI 6項目を実装ガイド付きで解説
- LLMO分析とは?定義・計測指標・無料ツールの使い方を5分で解説
- SEOとLLMOの違い|従来SEOだけでは足りない理由
- Perplexityに取り上げられる方法|AI検索特化の対策
- llms.txtとは?AIクローラー向け新標準
- LLMが好む文章構造|結論先出し・FAQ・箇条書きの効果
- Google AI Overview(旧SGE)対策|表示される条件
- GEO・AEOとは?LLMOとの違い
- ファクト密度を上げる書き方|LLM引用率を高める
- E-E-A-TとLLMOの関係|AIが信頼するドメインの特徴
- ChatGPTで引用される記事の書き方
- ブランドメンション(言及)の重要性|被リンクと並ぶ評価指標
- AIゼロクリック時代のコンテンツ戦略
- AI生成コンテンツはSEOで通用するか|2026年最新ガイドライン

