Gemini YouTube動画理解の仕組みと最適化:グラウンディングで引用される条件
Gemini APIによるYouTube動画理解の技術仕様とグラウンディングの仕組みを解説し、AI検索で動画コンテンツが引用されるための具体的な最適化手順を示す実践ガイド。
目次(31項目)
- はじめに
- Geminiは動画をどう「見て」いるのか:フレームサンプリングと音声解析の仕組み
- YouTube URLを直接渡す機能の仕様と制約(2026年時点)
- タイムスタンプ・チャプターでGeminiに動画の構造を伝える
- Grounding: AI OverviewとAI ModeがYouTube動画を引用するプロセス
- Gemini向け動画最適化の実践手順
- VideoObjectとClipスキーマの実装例:Key Moments表示とtranscriptプロパティ
- Gemini APIの動画クリッピング機能でトークンコストを抑える
- 業種別に見るGemini/Grounding最適化のシナリオ
- Otterly.AI調査の手法と限界、日本市場への当てはめ方
- よくある失敗とその対処法
- 施策後の効果測定:何を・どこで・どう判断するか
- 周辺論点:多言語字幕と動画の構成がAI引用に与える影響
- ChatGPT・Perplexityとの処理方式の違い
- よくある質問
- Q1. Gemini自体はYouTube動画をよく引用するのか?
- Q2. Gemini APIでYouTube動画を直接読み込ませることはできるのか?
- Q3. YouTube URL機能は無料で使えるのか?
- Q4. Geminiは動画のどこを見ているのか、字幕だけを読んでいるのか?
- Q5. 1リクエストで何本の動画を扱えるのか?
- Q6. 非公開・限定公開のYouTube動画も解析できるのか?
- Q7. タイムスタンプはどう指定すればよいのか?
- Q8. AI OverviewとAI ModeとGeminiは同じものなのか?
- Q9. 動画の長さはAI引用に影響するのか?
- Q10. VideoObjectのhasPart/Clipマークアップは必ず実装すべきか?
- Q11. Otterly.AIの調査データはどこまで信頼できるのか?
- Q12. この記事の内容は日本語動画・日本市場にもそのまま当てはまるのか?
- Q13. Gemini APIで動画の一部分だけを解析対象にすることはできるか?
- まとめ
- 関連用語
- 関連記事
Gemini YouTube動画理解の仕組みと最適化:グラウンディングで引用される条件
この記事の結論: Geminiは字幕やメタデータだけでなく、映像フレームと音声そのものを解析してYouTube動画を理解する。しかしGemini本体(gemini.google.com)がYouTube動画を直接引用する頻度は他プラットフォームより低く、実際の効果はGrounding経由でAI OverviewやAI Modeに反映される形で表れる。この構造差を理解したうえで最適化するのが最短ルートだ。
最終更新日: 2026年7月4日
はじめに
「Geminiに動画を読み込ませたら要約が的確だったのに、YouTube検索でAI概要に自社動画が出てこない」——動画制作者やコンテンツマーケターからこうした戸惑いの声をよく聞く。
原因は単純だ。Geminiには「動画を深く理解する能力」と「その動画をAI検索の回答で引用する頻度」という、まったく別の二つの軸が存在する。前者は技術的に業界随一だが、後者はOtterlyAIの大規模調査で最下位クラスという結果が出ている。この落差を知らずに対策すると、労力の投下先を誤ることになる。
本記事では、Gemini APIが公開しているYouTube動画理解の技術仕様を出発点に、グラウンディング(Grounding)の仕組みがAI OverviewやAI Modeでの引用にどうつながるのかを整理し、Gemini特有の「見え方」を踏まえた具体的な最適化手順を示す。
Geminiは動画をどう「見て」いるのか:フレームサンプリングと音声解析の仕組み
Geminiが動画を処理する方式は、ChatGPTやPerplexityが行っている「字幕テキストの読み取り」とは根本的に異なる。Google公式ドキュメントによれば、Geminiは動画を1秒あたり1フレーム(1 FPS)でサンプリングし、音声は1Kbpsのシングルチャンネルとして別途処理する。つまりGeminiは字幕という中間テキストを介さず、映像そのものと音声そのものを直接読み取っている。
この処理はトークン消費量にも表れる。デフォルトの解像度設定では1フレームあたり258トークン、音声が1秒あたり32トークン加算され、合計で1秒あたりおよそ300トークンを消費する。低解像度設定に切り替えると1フレームあたり66トークンとなり、1秒あたりの消費はおよそ100トークンまで下がる。この差によって、1Mトークンのコンテキストウィンドウを持つモデルで処理できる動画の長さも変わり、デフォルト解像度ではおよそ1時間、低解像度ではおよそ3時間まで一本の動画を扱えるとされている。
映像フレームを直接解析しているという事実は、コンテンツ設計に重要な示唆を与える。画面内のテロップ・図表・グラフ・商品パッケージの文字といった「音声にも字幕にも現れない情報」も、Geminiは映像として認識できる可能性がある。字幕とメタデータしか読まないテキストベースのAIとは、参照できる情報の種類そのものが異なるわけだ。
YouTube URLを直接渡す機能の仕様と制約(2026年時点)
Gemini APIおよびGoogle AI Studioでは、プロンプトの中にYouTube動画のURL文字列をそのまま含めるだけで、動画をダウンロードすることなく内容を解析させられる。この機能は2026年7月時点でもプレビュー扱いであり、無料枠と有料枠で条件が分かれている。
- 無料枠: 1日あたり合計8時間分の動画までを解析可能
- 有料枠: 動画の長さに制限なし
- Gemini 2.5以降のモデル: 1リクエストにつき最大10本の動画をまとめて処理可能(それ以前のモデルは1リクエスト1本まで)
- 対応範囲: 公開設定の動画のみが対象で、非公開・限定公開の動画は解析できない
この制約から読み取れるのは、Geminiの動画理解は「誰でもアクセスできる公開情報」を前提に設計されているという点だ。限定公開でメンバーだけに配信している動画や、地域制限をかけている動画は、そもそもGeminiの解析対象から外れる。AI引用を狙うのであれば、対象動画は完全公開設定にしておくことが大前提になる。
タイムスタンプ・チャプターでGeminiに動画の構造を伝える
Geminiに動画内の特定の場面について質問したり回答させたりする際は、MM:SS形式(例: 01:15なら1分15秒)のタイムスタンプを使う。この形式に沿ってチャプター区切りが動画側に用意されていると、Geminiは動画全体を一つの塊として処理するのではなく、話題ごとのセグメントとして切り分けて参照しやすくなる。
公式ドキュメントのベストプラクティスでは、1リクエストにつき1本の動画に絞ること、テキストのプロンプトは動画パーツより後に配置することが推奨されている。また1 FPSでのサンプリングという仕様上、1秒未満で切り替わる高速なカット割りやフラッシュ的な演出は情報が欠落しやすい。逆に言えば、チャプターごとに主張とその結論をワンテーマで落ち着いて話す構成のほうが、Geminiの解析精度と相性がよい。
YouTube側のチャプター機能(タイムスタンプ付きの概要欄表記)は、Geminiのこのセグメント理解の仕組みと直接噛み合う。各チャプターマーカーのタイトルを「その区間で何を話しているか」が一読でわかる表現にしておくことが、Gemini・人間双方にとっての可読性を高める。
Grounding: AI OverviewとAI ModeがYouTube動画を引用するプロセス
ここまで見た「動画理解」はGemini APIの技術仕様だが、実際に検索結果でYouTube動画が引用されるかどうかは、グラウンディングという別の仕組みが決定する。グラウンディングとは、生成AIが回答の根拠を外部の情報源に紐づけ、その情報源へのリンクとして提示するプロセスを指す。
Googleは2025年11月にGemini 3をAI Modeへ投入し、2026年1月28日にはGoogle検索のAI概要(AI Overview)のデフォルトモデルもGemini 3に切り替えたと発表している。つまりAI OverviewとAI Modeは、いずれもGeminiモデルを基盤とした製品であり、両者は同じGroundingの仕組みを共有しながら、検索結果ページとチャット的な対話ページという異なる体験を提供している。
ただし「Geminiモデルが基盤にある」ことと「Gemini(gemini.google.com)自体がYouTube動画をよく引用する」ことはイコールではない。OtterlyAIが1億件超のAI引用データを分析した調査によると、YouTube動画の引用シェアはPerplexityが38.7%、Google AI Overviewsが36.6%、Google AI Modeが19.6%、ChatGPTが4.4%である一方、Gemini本体はわずか0.2%にとどまる。同調査は「GeminiとMicrosoft Copilotのソーシャル系引用はYouTube・Reddit・LinkedIn・TikTokの4つに限られ、その中でもYouTubeの引用量はほぼゼロに近い」と分析している。
この非対称性がGemini対策の核心だ。動画コンテンツをGemini経由で可視化したい場合、狙うべき主戦場はGeminiチャットそのものではなく、同じ基盤技術で動くAI OverviewとAI Modeである。加えて、Gemini APIやAI Studioを使った自社ツール(動画要約サービス、社内ナレッジ検索など)に組み込まれた際の「解析対象として選ばれる動画」であり続けることも、副次的だが無視できない導線になる。
Gemini向け動画最適化の実践手順
以下の手順は、Geminiの技術仕様(フレーム解析・タイムスタンプ・公開設定の制約)とGrounding経由の引用構造の両方を踏まえた対策の順序だ。
- 公開設定を完全公開にする: 限定公開・年齢制限つきの動画はYouTube URL機能・Groundingいずれの対象からも外れるため、まず公開設定を見直す
- 字幕を手動で校正する: 自動生成字幕の誤認識はAIモデル横断で引用の妨げになる。専門用語・固有名詞・数字を優先的に修正する
- チャプターをMM:SS形式のタイムスタンプで整備する: 「その区間の結論」がわかるタイトルにし、Geminiのセグメント理解と噛み合わせる
- 概要欄冒頭200字に結論とキーワードを配置する: メタデータとしての一次シグナルであることに変わりはない
- 画面内テロップ・図表を充実させる: Geminiはフレームを直接解析するため、音声や字幕に出てこない視覚情報も参照材料になり得る
- VideoObjectスキーマを実装しtranscriptプロパティを埋める: 自社サイトに動画を埋め込むページ側の構造化データ対応も並行して進める
- Gemini APIまたはAI Studioで自社動画を実際に解析してみる: プロンプトにYouTube URLを渡して要約させ、Geminiが動画の要点を正しく認識できているかを事前に検証する
- Google検索でAI Overview・AI Modeの表示を定期的に確認する: 実際の引用状況はGemini単体ではなくこの二つの画面で追う
VideoObjectとClipスキーマの実装例:Key Moments表示とtranscriptプロパティ
実践手順の6番目に挙げたVideoObjectスキーマは、単に動画の存在をGoogleに伝えるだけの構造化データではない。Google Search Central公式ドキュメントによれば、hasPartプロパティにClip型のオブジェクトを配列で追加すると、動画内の主要な場面を検索結果上でタイムスタンプ付きリンクとして表示できる。これは「Key Moments(重要な瞬間)」と呼ばれる機能で、Googleは1本の動画につき最大5件までのKey Momentsを検索結果に表示するとしている。
各Clipオブジェクトにはname(その区間の見出し)、startOffsetとendOffset(秒単位の開始・終了位置)、そしてurl(タイムスタンプ付きURL)を指定する。これはGeminiがMM:SS形式のタイムスタンプでセグメントを理解する仕組みと構造的に対応しており、YouTube側のチャプター・Google検索側のKey Moments・Geminiの内部理解という三つのレイヤーで同じ「区切り」の情報を重複させることになる。実装例は次のとおりだ。
{
"@context": "https://schema.org",
"@type": "VideoObject",
"name": "動画タイトルをここに記述",
"description": "概要欄冒頭200字と揃えた要約",
"thumbnailUrl": "https://example.com/thumbnail.jpg",
"uploadDate": "2026-07-04",
"duration": "PT12M30S",
"contentUrl": "https://www.youtube.com/watch?v=VIDEO_ID",
"transcript": "字幕全文をここに記載する",
"hasPart": [
{
"@type": "Clip",
"name": "課題の整理",
"startOffset": 0,
"endOffset": 75,
"url": "https://www.youtube.com/watch?v=VIDEO_ID&t=0s"
},
{
"@type": "Clip",
"name": "設定手順のデモンストレーション",
"startOffset": 75,
"endOffset": 320,
"url": "https://www.youtube.com/watch?v=VIDEO_ID&t=75s"
}
]
}
transcriptプロパティに字幕全文を流し込んでおくと、映像・音声を直接解析するGeminiとは別の経路で、テキストベースのクローラーやAIにも動画の内容を伝えられる。Clip分割は10分を超える長尺動画や、章立てがはっきりしたチュートリアル・インタビュー・ウェビナー録画で特に効果を発揮するとされ、逆に数分程度の短い動画では分割の効果が薄い。実装後はJSON-LDとしてページに埋め込み、Rich Results Testなどのツールで構文エラーがないかを確認しておく。
Gemini APIの動画クリッピング機能でトークンコストを抑える
自社ツールにGemini APIを組み込んで動画要約や検索を提供している場合、動画全体を毎回フルで解析するとトークンコストと処理時間が膨らむ。Gemini APIは動画パーツにvideoMetadataとしてstart_offset・end_offset・fpsを指定でき、これによって解析範囲を動画の一部分に絞ったり、フレームサンプリングのレートそのものを変更したりできる。この機能はすべてのモデルで利用できるが、Gemini 2.5系のモデルの方が精度が高いとされている。
fpsを既定の1より下げる設定は、講義動画のように画面がほとんど変化しない長尺コンテンツで有効だ。逆に、画面の切り替わりが速い動画やデモの操作画面を細かく追いたい場合は、既定値かそれ以上のfpsを指定したほうが情報の取りこぼしが減る。start_offsetとend_offsetで解析範囲を絞る手法は、1本30分のウェビナー録画のうち製品デモの5分間だけを社内ナレッジベースの索引対象にする、といった運用と相性がよい。
自社サイトやアプリでGemini APIを使った動画検索・要約機能を提供している事業者にとって、この設定はコスト管理だけの話ではない。解析対象として選ばれやすい動画にするには、章立てがはっきりしていてstart_offset/end_offsetで機械的に切り出しやすい構成にしておくことが、地味だが効く工夫になる。
業種別に見るGemini/Grounding最適化のシナリオ
Gemini・Groundingへの最適化は業種によって優先順位が変わる。ここでは4つの代表的な業種で、何を優先すべきかを整理する。
EC・D2C(通販商品紹介動画): 商品パッケージの型番・成分表示・価格をテロップで画面に大きく映しておくと、Geminiのフレーム解析がそれを読み取れる可能性がある。概要欄には型番・価格・購入リンクをテキストとして明記し、Groundingが参照する一次シグナルを厚くする。開封・使用感・比較といった構成ごとにチャプターを切ると、レビュー動画としての引用価値が上がる。
BtoB SaaS(製品デモ・ウェビナー): 30分を超える長尺になりやすいため、チャプター整備は必須に近い。画面共有スライドの文字はフレーム解析の対象になるので、1枚のスライドに主張を詰め込みすぎない設計が地味に効く。製品名・機能名といった固有名詞は自動字幕が誤認識しやすく、手動校正の優先度が高い。
メディア・解説チャンネル: 複数トピックを1本に詰め込むと、1 FPSでのセグメント理解と噛み合いにくい。速報性の高いテーマは概要欄冒頭に結論と日付を明記し、Groundingにとっての鮮度シグナルとして機能させる。トピックが大きく変わるなら、チャプターを切るよりも動画自体を分けたほうが引用されやすい構成になる場合もある。
ローカルビジネス(店舗・サービス紹介): 施術風景・調理風景・店内の様子といった映像そのものが差別化要素になり、Geminiのフレーム解析と相性がよい。営業時間・住所・料金は動画内テロップと概要欄の両方に重複掲載し、非公開・限定公開の設定は避ける。地域名を含むキーワードは概要欄冒頭200字の中に自然な形で含めておく。
Otterly.AI調査の手法と限界、日本市場への当てはめ方
本記事で引用しているOtterly.AIの調査は、ChatGPT・Google AI Overviews・Google AI Mode・Perplexity・Microsoft Copilot・Geminiの6つのAI検索エンジンを対象に、30日間で発生した1億件超のAI引用インスタンスを分析したものだ。この規模のデータから「YouTube動画の引用シェアはPerplexityが38.7%、Gemini本体はわずか0.2%」という差が導き出されている。
ただし調査元自身が2つの限界を明示している。一つは「相関関係は因果関係を意味しない」という点、もう一つは「データセットに含まれるのはすでに引用された動画のみであり、結果は繰り返し引用される挙動の説明として最も強いが、最初に引用対象として選ばれる過程(initial eligibility)の説明にはならない」という点だ。つまりこの調査は「一度選ばれた動画がなぜ何度も選ばれ続けるか」には強い説明力を持つが、「まだ一度も引用されていない動画がどうすれば最初の一回を勝ち取れるか」については別の検証が必要になる。
さらに調査では、AI引用全体におけるソーシャル系ソースの内訳(Reddit 46.4%、YouTube 31.8%、LinkedIn 13%、Facebook 5%、Instagram 2.2%、TikTok 0.7%)も示されており、Google AI OverviewsとAI Modeはソーシャル系引用の過半数をYouTubeが占める一方、ChatGPTとPerplexityはソーシャル系引用の53.6%〜62.8%をRedditが占めるという、エンジンごとの明確な選好差も確認できる。
日本市場への当てはめには注意が要る。この調査はグローバル(英語圏中心と見られる)のサンプルであり、言語別・地域別の内訳は公開されていない。AI Overviewは2024年8月以降日本を含む各国に展開され、AI Modeも日本語検索に対応しているため、Groundingという仕組み自体は日本語検索にもそのまま働く。しかし日本語動画・日本語字幕特有の引用挙動(自動字幕の認識精度の違いや、話者の言語がGeminiの音声解析に与える影響など)については、本調査からは読み取れない。日本語コンテンツの担当者は、この記事で示した施策の方向性は参考にしつつ、自社の実データ(後述の効果測定)で検証するプロセスを省略しないほうがよい。
よくある失敗とその対処法
Gemini・Grounding対策では、技術仕様を理解していても運用段階でつまずくケースが多い。代表的な失敗パターンを挙げる。
- 限定公開のまま放置する: 社内承認待ちで限定公開のまま先行公開し、そのまま忘れられているケースが多い。公開後に設定を「公開」へ切り替える工程をチェックリスト化して対処する。
- 自動生成字幕を校正しない: 専門用語や固有名詞の誤認識はGemini・ChatGPT・Perplexityいずれの引用にも影響する。用語集を作成し、字幕編集時に必ず突き合わせる運用に変える。
- 1本の動画に話題を詰め込みすぎる: 1 FPSでのフレームサンプリングという仕様上、話題転換が頻繁だとセグメントとして切り分けにくい。チャプターを細分化するか、テーマごとに動画自体を分割する。
- 概要欄を空欄・ハッシュタグの羅列だけにする: Groundingが参照する一次シグナルを自ら放棄している状態だ。冒頭200字に結論・キーワード・関連リンクを明記する形に変える。
- VideoObjectスキーマを実装しない、またはtranscriptプロパティを省略する: 構造化データを実装していても、
transcriptが空だとテキストベースの参照経路を一つ失う。字幕全文を流し込む工程を実装フローに組み込む。 - 高速カットやフラッシュ演出を多用する: 1秒未満で切り替わる演出はフレームサンプリングで情報が欠落しやすい。主張の核となる場面は最低でも1〜2秒は静止させる編集に調整する。
- Gemini本体での引用を過度に期待する: Otterly.AIの調査どおり、Gemini本体のYouTube引用シェアは0.2%と低い。効果測定の対象をAI OverviewとAI Modeに切り替え、Gemini本体での確認は補助的な位置づけにとどめる。
施策後の効果測定:何を・どこで・どう判断するか
最適化を実施したあとは、次の4つの経路で効果を確認する。
- GSC(Google Search Console): 動画を埋め込んだページの検索パフォーマンスレポートで、対象クエリのインプレッション・掲載順位・CTRの推移を追う。AI Overviewが表示された検索での挙動は個別クエリの変化から間接的に読み取ることになる。
- AI OverviewとAI Modeの目視確認: 狙っているクエリでGoogle検索を定期的に実行し、自社動画・チャンネルが情報源として表示されているかを確認する。この手順の詳細はYouTubeチャンネルのAI可視性を確認・計測する方法にまとめている。
- サードパーティのAI可視性トラッキングツール: Otterly.AI・Peec AI・Profoundのようなツールを使うと、複数のAIエンジンでの引用状況を横断的に定点観測できる。ツール選定の比較はOtterly・Peec・Profound 料金3社比較を参考にできる。
- YouTube Studioのアナリティクス: 「AI経由」を単独の流入元として切り分けることはできないが、リファラーなしの直接流入や検索流入の変化は間接的な指標になる。
判断基準としては、Groundingの再クロールとインデックス反映にはタイムラグがあるため、施策実施から4〜8週間は様子見したうえで評価するのが現実的だ。露出頻度(表示回数)だけでなく、実際のクリック・視聴時間まで踏み込んで見ないと、「表示はされているが誰も見ていない」状態を見落とす。
周辺論点:多言語字幕と動画の構成がAI引用に与える影響
Gemini・Grounding対策を進めるうえで、本筋からやや離れるが無視できない論点が二つある。
一つは多言語字幕だ。Geminiは音声とフレームを直接解析するため、字幕そのものがなくても内容理解は可能とされている。しかし複数言語の字幕を用意しておけば、テキストベースで動画を参照するChatGPTやPerplexity側の理解を助けることになり、Gemini・非Geminiのどちらの経路でも取りこぼしを減らせる。ただし多言語字幕がAI引用率そのものをどの程度押し上げるかを定量化した公開データは、本記事の執筆時点では確認できていない。
もう一つは動画の長さと構成だ。ロングフォームとショートでAI引用率に大きな差があるという実測データもあり、詳細はYouTubeロングフォームとショートのAI引用率は94.3%対5.7%で扱っている。Geminiのフレームサンプリングという仕組みに照らすと、尺が短いショート動画は解析対象となるフレーム数自体が少なくなるため、テロップや図表で情報密度を補う工夫がロングフォーム以上に重要になると考えられる。
ChatGPT・Perplexityとの処理方式の違い
| 項目 | Gemini | ChatGPT | Perplexity |
|---|---|---|---|
| 動画の読み取り方式 | 映像フレーム(1 FPS)+音声+テキストを直接解析 | 字幕・概要欄などテキストメタデータを参照 | 字幕・概要欄などテキストメタデータを参照 |
| YouTube URLの直接入力 | 対応(API/AI Studio、プレビュー機能、公開動画のみ) | 非対応(ウェブ検索経由でメタデータ取得) | 対応(検索結果経由でメタデータ取得) |
| 画面内テキスト・図表の認識 | 可能(フレーム解析による) | 不可 | 不可 |
| YouTube引用シェア(Otterly.AI調査) | 0.2% | 4.4% | 38.7% |
| 1リクエストの動画処理上限 | 最大10本(Gemini 2.5以降) | 非公開 | 非公開 |
表からわかる通り、Geminiは動画そのものへのアクセスの深さでは他を上回るのに、実際の引用シェアでは最も低い。動画対策の投資配分を考える際は、この「理解の深さ」と「引用の頻度」を混同しないことが重要だ。
よくある質問
Q1. Gemini自体はYouTube動画をよく引用するのか?
直接引用は少ない。Otterly.AIの調査でGeminiのYouTube引用シェアは0.2%と、他の主要AI検索の中で最も低い水準だった。
Gemini(gemini.google.com)は社会的な情報源としてYouTube・Reddit・LinkedIn・TikTokの4つに限定して参照する傾向があり、その中でもYouTubeの引用量はほぼゼロに近いと分析されている。動画対策の主戦場はGemini本体よりもAI OverviewやAI Modeになる。
Q2. Gemini APIでYouTube動画を直接読み込ませることはできるのか?
できる。プロンプトにYouTube動画のURLをそのまま渡すだけで、ダウンロードなしに内容を解析できるプレビュー機能が用意されている。
対応は公開設定の動画のみで、非公開・限定公開の動画は対象外となる。テキスト部分は動画パーツより後に配置するのが推奨手順だ。
Q3. YouTube URL機能は無料で使えるのか?
無料枠は1日あたり合計8時間分の動画までで、有料枠には動画長の制限がない。
長尺動画や複数本をまとめて検証したい場合は、有料枠での利用を前提に検証設計を組んだほうが現実的だ。
Q4. Geminiは動画のどこを見ているのか、字幕だけを読んでいるのか?
字幕だけでなく、1秒に1フレームの映像と音声そのものを直接解析している。
このためGeminiは、音声にも字幕にも現れない画面内のテロップや図表といった視覚情報も、原理的には参照材料にできる。他のテキストベースのAIとの根本的な違いがここにある。
Q5. 1リクエストで何本の動画を扱えるのか?
Gemini 2.5以降のモデルは、1リクエストにつき最大10本の動画をまとめて処理できる。
それ以前のモデルは1リクエストにつき1本までという制約があった。ただし公式のベストプラクティスでは、精度を優先するなら1リクエスト1本に絞ることが推奨されている。
Q6. 非公開・限定公開のYouTube動画も解析できるのか?
できない。YouTube URL機能で解析できるのは公開設定の動画のみである。
会員限定配信やアーカイブ限定公開の動画は、そもそもGeminiの解析対象にもGroundingの引用対象にもなり得ない。AI経由での可視化を狙う動画は公開設定を維持する必要がある。
Q7. タイムスタンプはどう指定すればよいのか?
MM:SS形式(例: 01:15)で指定すると、その時点の内容について質問したり回答させたりできる。
動画側でこの形式に沿ったチャプター(タイムスタンプ付き概要欄表記)を用意しておくと、Geminiが動画をセグメント単位で切り分けて参照しやすくなる。
Q8. AI OverviewとAI ModeとGeminiは同じものなのか?
別々の製品だが、同じGeminiモデルを基盤としており、Groundingの仕組みを共有している。
Googleは2025年11月のAI Modeへの投入に続き、2026年1月にはGoogle検索のAI概要のデフォルトモデルもGemini 3に切り替えたと発表した。ただし引用挙動は製品ごとに異なるため、対策効果もそれぞれ個別に確認する必要がある。
Q9. 動画の長さはAI引用に影響するのか?
明確な相関は確認されていないが、1つのトピックを深く扱う構成の動画の方がGroundingの根拠として選ばれやすい傾向がある。
1 FPSのフレームサンプリングという仕様上、話題が頻繁に切り替わる構成よりも、チャプターごとに落ち着いて1テーマを掘り下げる構成の方がGeminiの解析精度とも相性がよい。
Q10. VideoObjectのhasPart/Clipマークアップは必ず実装すべきか?
必須ではないが、10分を超える長尺動画や章立てがはっきりした動画では効果が見込める。
GoogleはClipマークアップをもとに、検索結果に最大5件までのKey Moments(タイムスタンプ付きリンク)を表示するとしている。数分程度の短い動画では分割の効果が薄いため、動画の長さに応じて実装の優先度を判断するとよい。
Q11. Otterly.AIの調査データはどこまで信頼できるのか?
1億件超のAI引用データを30日間分析した大規模調査だが、調査元自身が「相関関係は因果関係を意味しない」「データセットに含まれるのはすでに引用された動画のみ」という2つの限界を明示している。
そのため調査結果は「一度引用された動画がなぜ繰り返し引用されるか」の説明として読むべきで、「まだ引用されていない動画が最初にどう選ばれるか」の答えとしては別途検証が必要だ。
Q12. この記事の内容は日本語動画・日本市場にもそのまま当てはまるのか?
Groundingの仕組み自体は日本語検索にも働くが、Otterly.AIの調査データに言語別・地域別の内訳は公開されていない。
AI Overviewは2024年8月以降日本を含む各国に展開され、AI Modeも日本語に対応しているため、施策の方向性としては参考になる。ただし日本語字幕特有の認識精度などは調査対象外のため、自社データでの検証を省略しないことが望ましい。
Q13. Gemini APIで動画の一部分だけを解析対象にすることはできるか?
できる。動画パーツにvideoMetadataとしてstart_offset・end_offsetを指定すれば、解析範囲を動画の一部に絞り込める。
同じくvideoMetadataのfpsパラメータでフレームサンプリングのレートを既定の1から変更することも可能で、静止画中心の長尺動画では下げてコストを抑え、変化の速い映像では上げて精度を優先する、といった使い分けができる。
まとめ
- Geminiは字幕ではなく映像フレーム(1 FPS)と音声そのものを直接解析しており、画面内のテロップや図表も参照材料になり得る
- しかしGemini本体(gemini.google.com)のYouTube引用シェアは0.2%と低く、主戦場はGrounding経由のAI OverviewとAI Modeである
- 最適化の起点は公開設定を完全公開にすることであり、限定公開・非公開の動画はそもそも解析対象にも引用対象にもならない
- チャプター・概要欄・VideoObject+Clipスキーマは、Geminiのセグメント理解とGoogle検索のKey Moments表示の両方に効く重複投資になる
- Otterly.AIの調査は「繰り返し引用される理由」の説明力が強く、「最初に引用される条件」の説明にはならない点を踏まえて解釈する
- 効果測定はGemini本体ではなくAI OverviewとAI Modeを中心に、4〜8週間のタイムラグを見込んで判断する
次のアクションとしては、まず自社の主力動画1本を選び、公開設定・字幕・チャプター・VideoObjectスキーマの4点を棚卸しし、欠けている部分から着手するのが最短ルートだ。
関連用語
- グラウンディング — LLMが回答の根拠を外部の情報源に紐づける仕組み。AI OverviewとAI ModeがYouTube動画を引用する際の中核メカニズム。
- Gemini SEO — Geminiおよびその基盤で動くGoogle製品に引用・参照されるためのコンテンツ最適化手法。
- YouTube SEO — YouTube内外の検索・AI引用で発見されるための最適化施策全般。
- VideoObject スキーマ — 動画メタデータをAIに機械的に伝えるための構造化データ形式。
- チャプターマーカー — 動画内のタイムスタンプ区切り。Geminiのセグメント単位での動画理解と直結する。
- AI Overview — Google検索結果の最上部にGeminiが生成する要約回答。Groundingの仕組みでYouTube動画を引用元として表示する主要な経路。
- GSC(Google Search Console) — 検索パフォーマンスを計測するGoogle公式の無料ツール。動画埋め込みページのクエリ・掲載順位・CTRを追う際の基本ツール。
- JSON-LD — 構造化データをJSON形式で記述する実装方式。VideoObject/Clipスキーマの実装フォーマットとして使う。
関連記事
- aiseo YouTube(ユーチューブ)× LLMO 完全ガイド|AI引用されるチャンネル最適化【2026年版】
- YouTube動画をAIに引用させる方法:ChatGPT・Perplexityに選ばれる条件と最適化手順
- 字幕チャプター説明欄の3シグナルでYouTube動画をAIに引用させる設計
- YouTubeロングフォームとショートのAI引用率は94.3%対5.7%——実測データの示す差
- YouTubeがAI引用ソース1位に——Redditを超えた構造的理由と日本市場対応
- PerplexityのYouTubeソース指定で動画を引用させる戦略【2026年7月時点】
- YouTubeクエリファンアウト×複数AI引用を獲得する戦略ガイド2026
- YouTubeチャンネルのAI可視性を確認・計測する方法【2026年版】
- Google Search Consoleに生成AIパフォーマンスレポート登場――AI引用の可視化が始まった
参考文献
- Video understanding | Gemini API | Google AI for Developers — Google AI for Developers(参照: 2026-07-04)
- YouTube AI Citation Study 2026 — Otterly.AI(参照: 2026-07-04)
- Gemini 3: our most intelligent model, now in Search — Google Blog(参照: 2026-07-04)
- Google検索、Gemini 3をAI概要のデフォルトAIに設定 — テクノエッジ(参照: 2026-07-04)
- YouTube vs Reddit: Which Platform Drives More AI Citations in 2026? — Superlines(参照: 2026-07-04)
- Video (VideoObject, Clip, BroadcastEvent) Schema Markup — Google Search Central(参照: 2026-07-04)
関連用語
- インデックス
インデックスとは、クローラーが集めたページをGoogleがデータベースに登録すること。インデックスされて初めて検索結果に表示される対象になります。「索引」とイメージすると分かりやすい用語です。
- キーワード
キーワードとは、ユーザーが検索エンジンやChatGPT等のAI検索に打ち込む単語・フレーズ。SEO・LLMO両対策の出発点。ビッグ/ロングテール選定基準と無料ツールを使った選び方を初心者向けに解説します。
- クエリ
クエリとは、ユーザーが実際に検索窓に入力した検索語のこと。SEOで使う「キーワード」と似ていますが、キーワードが事前に狙う言葉、クエリが実際に打たれた言葉、というニュアンスの違いがあります。
- グラウンディング
グラウンディングとは、LLMの回答を信頼できる外部情報源(Web・社内文書)に「接地」させて、ハルシネーション(嘘)を防ぐ仕組み。RAGはグラウンディングの代表的な実装方法です。
- クローラー
クローラーとは、Web上のページを自動巡回してデータを集めるプログラムのこと。Googleの「Googlebot」が代表例で、これに見つけてもらわないと検索結果に表示されません。
- 構造化データ
構造化データとは、Webページの内容を検索エンジンが理解しやすい形式で記述したメタ情報。記事の著者・公開日、商品の価格・在庫などを機械可読にすることでリッチリザルトやAI引用の対象になります。
関連記事
最新記事
LLMO カテゴリの他の記事
- AI生成記事は9カ月でほぼ消滅、人間執筆は1位獲得8倍――SELの実データ検証
- GSCの生成AIレポートは『罠』――インプレッション偏重の落とし穴をSEJが指摘
- AIブランド認知96%でも89%が未言及、Victorious調査の衝撃
- Citadex調査:AI引用は多言語で56%消える、30ブランド横断データを読む
- データ主導PRはAI引用が3.5倍——LeadCoverage実測レポート
- GSC「プラットフォームプロパティ」が全世界展開完了――SNS投稿のAI検索可視性を計測
- Claudeの共有チャットが検索に露出——disallowとnoindexの落とし穴
- 「アイデンティティ・リーク」とは――AI検索が企業を検証できない構造、71社調査で判明
- AI Overviews表示率が1年で15%→43%に急増、Similarweb調査で判明
- GEO対策「45件のレビューで判明」実は効果不明?批判的サーベイ論文を解説
- AI Overviewsオプトアウト機能とCMA規制の全体像|日本への波及可能性を読む
- ホワイトペーパー引用率わずか0.4% Optyino.ai調査25,001件が示す現実
- 中小企業がChatGPTに引用される方法|予算なしでできる90日ステップ
- AI引用25,337件の大規模調査——業界ごとに「引用フィンガープリント」が全く違うことが判明
- GoogleがAI生成コンテンツ起因のクロール・インデックス抑制を明言、「AIと分かる」記事は未登録リスク
- Instagramリールがai検索に引用される対策|2026年最新LLMO実践ガイド
- EU AI Act 第50条の透明性義務が8月2日適用開始 — AI記事量産の運用が変わる
- LinkedIn LLMO対策 BtoB企業が知るべき引用構造と日本の限界
- Pinterestビジュアル検索でAI引用と商品ピンを最適化する方法
- TikTok動画がAI検索に引用される対策|Perplexity統合時代のLLMO実践ガイド
- Cloudflare、AIクローラーを「Search/Agent/Training」の3分類で個別制御可能に
- Claude Cowork エージェントのサイト操作に対応するAXO対策の実装手順
- NotebookLM動画概要にソースとして選ばれる最適化2026
- Claude AI検索で引用されるサイトの作り方|3種ボットとllms.txt完全設定
- Ask YouTube 会話型検索の動画対策|Geminiに引用される作り方
- Perplexity Comet エージェント最適化 対策|AXOで操作を完遂させる実装
- 記事に埋め込んだYouTube動画のAI引用率は何倍になるか|独自診断データで検証
- 検索上位10位とAI引用の重複が76%→38%に急落:「順位=引用」神話の終焉
- 日本サイトのLLMO引用率調査2026|80万件分析でわかった実態
- Bing Copilotに引用されるYouTube LLMO最適化ガイド 日本語版2026
- Google June 2026スパムアップデート:AI OverviewsとAI Modeへのスパムポリシーが正式拡張、不自然な言及操作・大規模AI生成コンテンツが明示的禁止に
- Google Search Consoleに生成AIパフォーマンスレポート登場――AI引用の可視化が始まった
- YouTubeチャンネルのE-E-A-T設計でAI引用の信頼性を高める方法
- Perplexityの通常検索でYouTube動画が引用される条件【2026年版】
- YouTube動画をAIに要約されやすくする最適化ガイド
- ChatGPT Atlasに引用されるには?AIブラウザ時代の最適化ガイド2026
- PerplexityのYouTubeソース指定で動画を引用させる戦略【2026年7月時点】
- AIエージェントYouTube動画引用条件2026|視聴データより字幕構造が鍵
- YouTubeチャンネル説明で話者の専門性を明示してAI引用を獲得する実践ガイド
- YouTubeチャンネルのトピック権威性とAI推薦設計:海外ローカライズ戦略の核心
- NotebookLMでYouTubeが読み込めない原因と対処法|字幕なし動画の解決策
- ChatGPTにYouTubeチャンネルをおすすめ・推薦させる方法【LLMO最適化】
- NotebookLMでYouTube動画を記事に再利用する方法とAI引用戦略
- Perplexity YouTube動画引用シェア戦略:字幕・メタデータで被引用率を高める方法
- YouTube動画をAIに引用させる方法:ChatGPT・Perplexityに選ばれる条件と最適化手順
- AI Overview引用元トップ10比率が76%→38%に急落:順位依存SEOの終焉
- 著者情報あり/なしでAI引用率はどう変わるか|実測データで差を測定【2026年版】
- ローカルSEO×AI検索引用対策2026:地域ビジネスがAIに引用されるための完全手順
- AI Overview引用率 業種別データ|日本市場2026年版独自集計
- トピックオーソリティ × ピラー・クラスター設計の完全ガイド【独自データ付き】
- 不動産会社のLLMO対策完全ガイド|AI検索で引用される信頼性設計と実装手順
- オウンドメディアのLLMO戦略完全ガイド|AI検索で引用されるコンテンツ設計と運用
- ChatGPT引用される記事の書き方:構造・文体・配置の完全ガイド
- ChatGPTで自分のサイトの引用を確認する方法【手順と注意点】
- GEO・AEO・LLMO・AIOの違いをわかりやすく解説【2026年版】
- YouTube チャンネルの E-E-A-T 強化戦略:AI 検索引用率を高める信頼設計
- VideoObject JSON-LD の LLMO 活用|AI 検索引用に効くスキーマ設計の具体実装
- YouTube 概要欄 × 構造化データ設計で LLMO スコアを上げる実践ガイド
- Gemini の動画理解とグラウンディング|Knowledge Graph 連携で引用される動画設計
- ChatGPT が YouTube 動画を引用する条件と動画・記事セット投資戦略【2026年版】
- Perplexity が動画を回答に組み込むパターン分析と引用戦略【2026年版】
- YouTube 文字起こし(字幕)の LLMO 最適化|AI が動画を理解するメカニズムと実践手法
- YouTube Shorts が AI 検索に引用される条件と最適化手順【2026年版】
- ChatGPT Search 引用率を継続改善する 2026 年運用フロー完全ガイド
- Claude AI 検索の引用パターン分析と日本語コンテンツ最適化戦略
- Perplexity 引用率を PDCA で改善する実践ガイド【2026年版】
- NotebookLM の要約・引用品質を高める Sources 構造化最適化ガイド
- Gemini グラウンディングの仕組みと Knowledge Graph 連携コンテンツ戦略
- LLMハルシネーション対策|コンテンツ運用で誤情報引用リスクを下げる手法【2026年版】
- ChatGPT ジェネラティブSEO完全ガイド|生成AI時代の検索最適化戦略【2026年版】
- 構造化データで LLMO は伸びるか|Article / FAQPage / DefinedTerm の検証【2026年版】
- LLMO 成功事例の探し方|2026年に検索すべき情報源 12 選
- LLMO 監査チェックリスト 32 項目【2026年版・社内レビュー用】
- llms.txt の書き方|業種別テンプレート 6 種【2026年版】
- GEO・AEO・LLMO の違いと使い分け|どの概念を取り入れるべきか【2026年版】
- ChatGPTに引用されない原因を完全網羅|診断から対処法まで実務フローで解説
- AI 引用率の計測方法|手動とツールの再現性比較【2026年版】
- Perplexity SEO 完全ガイド|引用ソース選定の傾向と対策【2026年版】
- ChatGPT SEO の実践12手順|引用される記事の書き方【2026年版】
- ChatGPTに自社サイトを掲載させる方法|2026年版チェックリスト30項目
- LLMOスコアの作り方|100点満点の重み付けと業界平均の読み解き方
- LLMO計測の始め方|サンプリング設計とKPI 6項目を実装ガイド付きで解説
- LLMO分析とは?定義・計測指標・無料ツールの使い方を5分で解説
- SEOとLLMOの違い|従来SEOだけでは足りない理由
- Perplexityに取り上げられる方法|AI検索特化の対策
- llms.txtとは?AIクローラー向け新標準
- LLMが好む文章構造|結論先出し・FAQ・箇条書きの効果
- Google AI Overview(旧SGE)対策|表示される条件
- GEO・AEOとは?LLMOとの違い
- ファクト密度を上げる書き方|LLM引用率を高める
- E-E-A-TとLLMOの関係|AIが信頼するドメインの特徴
- ChatGPTで引用される記事の書き方
- ブランドメンション(言及)の重要性|被リンクと並ぶ評価指標
- AIゼロクリック時代のコンテンツ戦略
- AI生成コンテンツはSEOで通用するか|2026年最新ガイドライン

