AISEO/LLMO分析
Gemini YouTube動画理解の仕組みと最適化:グラウンディングで引用される条件 (gemini-youtube-video-understanding-optimization)
LLMO最終更新日: 2026年8月3日初出: 2026年7月4日

Gemini YouTube動画理解の仕組みと最適化:グラウンディングで引用される条件

Gemini APIによるYouTube動画理解の技術仕様とグラウンディングの仕組みを解説し、AI検索で動画コンテンツが引用されるための具体的な最適化手順を示す実践ガイド。

#Gemini#YouTube動画理解#グラウンディング#動画SEO#AI Overview#AI Mode#LLMO#動画最適化#Gemini API
目次(31項目)

Gemini YouTube動画理解の仕組みと最適化:グラウンディングで引用される条件

この記事の結論: Geminiは字幕やメタデータだけでなく、映像フレームと音声そのものを解析してYouTube動画を理解する。しかしGemini本体(gemini.google.com)がYouTube動画を直接引用する頻度は他プラットフォームより低く、実際の効果はGrounding経由でAI OverviewやAI Modeに反映される形で表れる。この構造差を理解したうえで最適化するのが最短ルートだ。

最終更新日: 2026年7月4日

はじめに

「Geminiに動画を読み込ませたら要約が的確だったのに、YouTube検索でAI概要に自社動画が出てこない」——動画制作者やコンテンツマーケターからこうした戸惑いの声をよく聞く。

原因は単純だ。Geminiには「動画を深く理解する能力」と「その動画をAI検索の回答で引用する頻度」という、まったく別の二つの軸が存在する。前者は技術的に業界随一だが、後者はOtterlyAIの大規模調査で最下位クラスという結果が出ている。この落差を知らずに対策すると、労力の投下先を誤ることになる。

本記事では、Gemini APIが公開しているYouTube動画理解の技術仕様を出発点に、グラウンディング(Grounding)の仕組みがAI OverviewやAI Modeでの引用にどうつながるのかを整理し、Gemini特有の「見え方」を踏まえた具体的な最適化手順を示す。

Geminiは動画をどう「見て」いるのか:フレームサンプリングと音声解析の仕組み

Geminiが動画を処理する方式は、ChatGPTやPerplexityが行っている「字幕テキストの読み取り」とは根本的に異なる。Google公式ドキュメントによれば、Geminiは動画を1秒あたり1フレーム(1 FPS)でサンプリングし、音声は1Kbpsのシングルチャンネルとして別途処理する。つまりGeminiは字幕という中間テキストを介さず、映像そのものと音声そのものを直接読み取っている。

この処理はトークン消費量にも表れる。デフォルトの解像度設定では1フレームあたり258トークン、音声が1秒あたり32トークン加算され、合計で1秒あたりおよそ300トークンを消費する。低解像度設定に切り替えると1フレームあたり66トークンとなり、1秒あたりの消費はおよそ100トークンまで下がる。この差によって、1Mトークンのコンテキストウィンドウを持つモデルで処理できる動画の長さも変わり、デフォルト解像度ではおよそ1時間、低解像度ではおよそ3時間まで一本の動画を扱えるとされている。

映像フレームを直接解析しているという事実は、コンテンツ設計に重要な示唆を与える。画面内のテロップ・図表・グラフ・商品パッケージの文字といった「音声にも字幕にも現れない情報」も、Geminiは映像として認識できる可能性がある。字幕とメタデータしか読まないテキストベースのAIとは、参照できる情報の種類そのものが異なるわけだ。

YouTube URLを直接渡す機能の仕様と制約(2026年時点)

Gemini APIおよびGoogle AI Studioでは、プロンプトの中にYouTube動画のURL文字列をそのまま含めるだけで、動画をダウンロードすることなく内容を解析させられる。この機能は2026年7月時点でもプレビュー扱いであり、無料枠と有料枠で条件が分かれている。

  • 無料枠: 1日あたり合計8時間分の動画までを解析可能
  • 有料枠: 動画の長さに制限なし
  • Gemini 2.5以降のモデル: 1リクエストにつき最大10本の動画をまとめて処理可能(それ以前のモデルは1リクエスト1本まで)
  • 対応範囲: 公開設定の動画のみが対象で、非公開・限定公開の動画は解析できない

この制約から読み取れるのは、Geminiの動画理解は「誰でもアクセスできる公開情報」を前提に設計されているという点だ。限定公開でメンバーだけに配信している動画や、地域制限をかけている動画は、そもそもGeminiの解析対象から外れる。AI引用を狙うのであれば、対象動画は完全公開設定にしておくことが大前提になる。

タイムスタンプ・チャプターでGeminiに動画の構造を伝える

Geminiに動画内の特定の場面について質問したり回答させたりする際は、MM:SS形式(例: 01:15なら1分15秒)のタイムスタンプを使う。この形式に沿ってチャプター区切りが動画側に用意されていると、Geminiは動画全体を一つの塊として処理するのではなく、話題ごとのセグメントとして切り分けて参照しやすくなる。

公式ドキュメントのベストプラクティスでは、1リクエストにつき1本の動画に絞ること、テキストのプロンプトは動画パーツより後に配置することが推奨されている。また1 FPSでのサンプリングという仕様上、1秒未満で切り替わる高速なカット割りやフラッシュ的な演出は情報が欠落しやすい。逆に言えば、チャプターごとに主張とその結論をワンテーマで落ち着いて話す構成のほうが、Geminiの解析精度と相性がよい。

YouTube側のチャプター機能(タイムスタンプ付きの概要欄表記)は、Geminiのこのセグメント理解の仕組みと直接噛み合う。各チャプターマーカーのタイトルを「その区間で何を話しているか」が一読でわかる表現にしておくことが、Gemini・人間双方にとっての可読性を高める。

Grounding: AI OverviewとAI ModeがYouTube動画を引用するプロセス

ここまで見た「動画理解」はGemini APIの技術仕様だが、実際に検索結果でYouTube動画が引用されるかどうかは、グラウンディングという別の仕組みが決定する。グラウンディングとは、生成AIが回答の根拠を外部の情報源に紐づけ、その情報源へのリンクとして提示するプロセスを指す。

Googleは2025年11月にGemini 3をAI Modeへ投入し、2026年1月28日にはGoogle検索のAI概要(AI Overview)のデフォルトモデルもGemini 3に切り替えたと発表している。つまりAI OverviewとAI Modeは、いずれもGeminiモデルを基盤とした製品であり、両者は同じGroundingの仕組みを共有しながら、検索結果ページとチャット的な対話ページという異なる体験を提供している。

ただし「Geminiモデルが基盤にある」ことと「Gemini(gemini.google.com)自体がYouTube動画をよく引用する」ことはイコールではない。OtterlyAIが1億件超のAI引用データを分析した調査によると、YouTube動画の引用シェアはPerplexityが38.7%、Google AI Overviewsが36.6%、Google AI Modeが19.6%、ChatGPTが4.4%である一方、Gemini本体はわずか0.2%にとどまる。同調査は「GeminiとMicrosoft Copilotのソーシャル系引用はYouTube・Reddit・LinkedIn・TikTokの4つに限られ、その中でもYouTubeの引用量はほぼゼロに近い」と分析している。

この非対称性がGemini対策の核心だ。動画コンテンツをGemini経由で可視化したい場合、狙うべき主戦場はGeminiチャットそのものではなく、同じ基盤技術で動くAI OverviewとAI Modeである。加えて、Gemini APIやAI Studioを使った自社ツール(動画要約サービス、社内ナレッジ検索など)に組み込まれた際の「解析対象として選ばれる動画」であり続けることも、副次的だが無視できない導線になる。

Gemini向け動画最適化の実践手順

以下の手順は、Geminiの技術仕様(フレーム解析・タイムスタンプ・公開設定の制約)とGrounding経由の引用構造の両方を踏まえた対策の順序だ。

  1. 公開設定を完全公開にする: 限定公開・年齢制限つきの動画はYouTube URL機能・Groundingいずれの対象からも外れるため、まず公開設定を見直す
  2. 字幕を手動で校正する: 自動生成字幕の誤認識はAIモデル横断で引用の妨げになる。専門用語・固有名詞・数字を優先的に修正する
  3. チャプターをMM:SS形式のタイムスタンプで整備する: 「その区間の結論」がわかるタイトルにし、Geminiのセグメント理解と噛み合わせる
  4. 概要欄冒頭200字に結論とキーワードを配置する: メタデータとしての一次シグナルであることに変わりはない
  5. 画面内テロップ・図表を充実させる: Geminiはフレームを直接解析するため、音声や字幕に出てこない視覚情報も参照材料になり得る
  6. VideoObjectスキーマを実装しtranscriptプロパティを埋める: 自社サイトに動画を埋め込むページ側の構造化データ対応も並行して進める
  7. Gemini APIまたはAI Studioで自社動画を実際に解析してみる: プロンプトにYouTube URLを渡して要約させ、Geminiが動画の要点を正しく認識できているかを事前に検証する
  8. Google検索でAI Overview・AI Modeの表示を定期的に確認する: 実際の引用状況はGemini単体ではなくこの二つの画面で追う

VideoObjectとClipスキーマの実装例:Key Moments表示とtranscriptプロパティ

実践手順の6番目に挙げたVideoObjectスキーマは、単に動画の存在をGoogleに伝えるだけの構造化データではない。Google Search Central公式ドキュメントによれば、hasPartプロパティにClip型のオブジェクトを配列で追加すると、動画内の主要な場面を検索結果上でタイムスタンプ付きリンクとして表示できる。これは「Key Moments(重要な瞬間)」と呼ばれる機能で、Googleは1本の動画につき最大5件までのKey Momentsを検索結果に表示するとしている。

各Clipオブジェクトにはname(その区間の見出し)、startOffsetendOffset(秒単位の開始・終了位置)、そしてurl(タイムスタンプ付きURL)を指定する。これはGeminiがMM:SS形式のタイムスタンプでセグメントを理解する仕組みと構造的に対応しており、YouTube側のチャプター・Google検索側のKey Moments・Geminiの内部理解という三つのレイヤーで同じ「区切り」の情報を重複させることになる。実装例は次のとおりだ。

{
  "@context": "https://schema.org",
  "@type": "VideoObject",
  "name": "動画タイトルをここに記述",
  "description": "概要欄冒頭200字と揃えた要約",
  "thumbnailUrl": "https://example.com/thumbnail.jpg",
  "uploadDate": "2026-07-04",
  "duration": "PT12M30S",
  "contentUrl": "https://www.youtube.com/watch?v=VIDEO_ID",
  "transcript": "字幕全文をここに記載する",
  "hasPart": [
    {
      "@type": "Clip",
      "name": "課題の整理",
      "startOffset": 0,
      "endOffset": 75,
      "url": "https://www.youtube.com/watch?v=VIDEO_ID&t=0s"
    },
    {
      "@type": "Clip",
      "name": "設定手順のデモンストレーション",
      "startOffset": 75,
      "endOffset": 320,
      "url": "https://www.youtube.com/watch?v=VIDEO_ID&t=75s"
    }
  ]
}

transcriptプロパティに字幕全文を流し込んでおくと、映像・音声を直接解析するGeminiとは別の経路で、テキストベースのクローラーやAIにも動画の内容を伝えられる。Clip分割は10分を超える長尺動画や、章立てがはっきりしたチュートリアル・インタビュー・ウェビナー録画で特に効果を発揮するとされ、逆に数分程度の短い動画では分割の効果が薄い。実装後はJSON-LDとしてページに埋め込み、Rich Results Testなどのツールで構文エラーがないかを確認しておく。

Gemini APIの動画クリッピング機能でトークンコストを抑える

自社ツールにGemini APIを組み込んで動画要約や検索を提供している場合、動画全体を毎回フルで解析するとトークンコストと処理時間が膨らむ。Gemini APIは動画パーツにvideoMetadataとしてstart_offsetend_offsetfpsを指定でき、これによって解析範囲を動画の一部分に絞ったり、フレームサンプリングのレートそのものを変更したりできる。この機能はすべてのモデルで利用できるが、Gemini 2.5系のモデルの方が精度が高いとされている。

fpsを既定の1より下げる設定は、講義動画のように画面がほとんど変化しない長尺コンテンツで有効だ。逆に、画面の切り替わりが速い動画やデモの操作画面を細かく追いたい場合は、既定値かそれ以上のfpsを指定したほうが情報の取りこぼしが減る。start_offsetend_offsetで解析範囲を絞る手法は、1本30分のウェビナー録画のうち製品デモの5分間だけを社内ナレッジベースの索引対象にする、といった運用と相性がよい。

自社サイトやアプリでGemini APIを使った動画検索・要約機能を提供している事業者にとって、この設定はコスト管理だけの話ではない。解析対象として選ばれやすい動画にするには、章立てがはっきりしていてstart_offset/end_offsetで機械的に切り出しやすい構成にしておくことが、地味だが効く工夫になる。

業種別に見るGemini/Grounding最適化のシナリオ

Gemini・Groundingへの最適化は業種によって優先順位が変わる。ここでは4つの代表的な業種で、何を優先すべきかを整理する。

EC・D2C(通販商品紹介動画): 商品パッケージの型番・成分表示・価格をテロップで画面に大きく映しておくと、Geminiのフレーム解析がそれを読み取れる可能性がある。概要欄には型番・価格・購入リンクをテキストとして明記し、Groundingが参照する一次シグナルを厚くする。開封・使用感・比較といった構成ごとにチャプターを切ると、レビュー動画としての引用価値が上がる。

BtoB SaaS(製品デモ・ウェビナー): 30分を超える長尺になりやすいため、チャプター整備は必須に近い。画面共有スライドの文字はフレーム解析の対象になるので、1枚のスライドに主張を詰め込みすぎない設計が地味に効く。製品名・機能名といった固有名詞は自動字幕が誤認識しやすく、手動校正の優先度が高い。

メディア・解説チャンネル: 複数トピックを1本に詰め込むと、1 FPSでのセグメント理解と噛み合いにくい。速報性の高いテーマは概要欄冒頭に結論と日付を明記し、Groundingにとっての鮮度シグナルとして機能させる。トピックが大きく変わるなら、チャプターを切るよりも動画自体を分けたほうが引用されやすい構成になる場合もある。

ローカルビジネス(店舗・サービス紹介): 施術風景・調理風景・店内の様子といった映像そのものが差別化要素になり、Geminiのフレーム解析と相性がよい。営業時間・住所・料金は動画内テロップと概要欄の両方に重複掲載し、非公開・限定公開の設定は避ける。地域名を含むキーワードは概要欄冒頭200字の中に自然な形で含めておく。

Otterly.AI調査の手法と限界、日本市場への当てはめ方

本記事で引用しているOtterly.AIの調査は、ChatGPT・Google AI Overviews・Google AI Mode・Perplexity・Microsoft Copilot・Geminiの6つのAI検索エンジンを対象に、30日間で発生した1億件超のAI引用インスタンスを分析したものだ。この規模のデータから「YouTube動画の引用シェアはPerplexityが38.7%、Gemini本体はわずか0.2%」という差が導き出されている。

ただし調査元自身が2つの限界を明示している。一つは「相関関係は因果関係を意味しない」という点、もう一つは「データセットに含まれるのはすでに引用された動画のみであり、結果は繰り返し引用される挙動の説明として最も強いが、最初に引用対象として選ばれる過程(initial eligibility)の説明にはならない」という点だ。つまりこの調査は「一度選ばれた動画がなぜ何度も選ばれ続けるか」には強い説明力を持つが、「まだ一度も引用されていない動画がどうすれば最初の一回を勝ち取れるか」については別の検証が必要になる。

さらに調査では、AI引用全体におけるソーシャル系ソースの内訳(Reddit 46.4%、YouTube 31.8%、LinkedIn 13%、Facebook 5%、Instagram 2.2%、TikTok 0.7%)も示されており、Google AI OverviewsとAI Modeはソーシャル系引用の過半数をYouTubeが占める一方、ChatGPTとPerplexityはソーシャル系引用の53.6%〜62.8%をRedditが占めるという、エンジンごとの明確な選好差も確認できる。

日本市場への当てはめには注意が要る。この調査はグローバル(英語圏中心と見られる)のサンプルであり、言語別・地域別の内訳は公開されていない。AI Overviewは2024年8月以降日本を含む各国に展開され、AI Modeも日本語検索に対応しているため、Groundingという仕組み自体は日本語検索にもそのまま働く。しかし日本語動画・日本語字幕特有の引用挙動(自動字幕の認識精度の違いや、話者の言語がGeminiの音声解析に与える影響など)については、本調査からは読み取れない。日本語コンテンツの担当者は、この記事で示した施策の方向性は参考にしつつ、自社の実データ(後述の効果測定)で検証するプロセスを省略しないほうがよい。

よくある失敗とその対処法

Gemini・Grounding対策では、技術仕様を理解していても運用段階でつまずくケースが多い。代表的な失敗パターンを挙げる。

  1. 限定公開のまま放置する: 社内承認待ちで限定公開のまま先行公開し、そのまま忘れられているケースが多い。公開後に設定を「公開」へ切り替える工程をチェックリスト化して対処する。
  2. 自動生成字幕を校正しない: 専門用語や固有名詞の誤認識はGemini・ChatGPT・Perplexityいずれの引用にも影響する。用語集を作成し、字幕編集時に必ず突き合わせる運用に変える。
  3. 1本の動画に話題を詰め込みすぎる: 1 FPSでのフレームサンプリングという仕様上、話題転換が頻繁だとセグメントとして切り分けにくい。チャプターを細分化するか、テーマごとに動画自体を分割する。
  4. 概要欄を空欄・ハッシュタグの羅列だけにする: Groundingが参照する一次シグナルを自ら放棄している状態だ。冒頭200字に結論・キーワード・関連リンクを明記する形に変える。
  5. VideoObjectスキーマを実装しない、またはtranscriptプロパティを省略する: 構造化データを実装していても、transcriptが空だとテキストベースの参照経路を一つ失う。字幕全文を流し込む工程を実装フローに組み込む。
  6. 高速カットやフラッシュ演出を多用する: 1秒未満で切り替わる演出はフレームサンプリングで情報が欠落しやすい。主張の核となる場面は最低でも1〜2秒は静止させる編集に調整する。
  7. Gemini本体での引用を過度に期待する: Otterly.AIの調査どおり、Gemini本体のYouTube引用シェアは0.2%と低い。効果測定の対象をAI OverviewとAI Modeに切り替え、Gemini本体での確認は補助的な位置づけにとどめる。

施策後の効果測定:何を・どこで・どう判断するか

最適化を実施したあとは、次の4つの経路で効果を確認する。

  • GSC(Google Search Console): 動画を埋め込んだページの検索パフォーマンスレポートで、対象クエリのインプレッション・掲載順位・CTRの推移を追う。AI Overviewが表示された検索での挙動は個別クエリの変化から間接的に読み取ることになる。
  • AI OverviewとAI Modeの目視確認: 狙っているクエリでGoogle検索を定期的に実行し、自社動画・チャンネルが情報源として表示されているかを確認する。この手順の詳細はYouTubeチャンネルのAI可視性を確認・計測する方法にまとめている。
  • サードパーティのAI可視性トラッキングツール: Otterly.AI・Peec AI・Profoundのようなツールを使うと、複数のAIエンジンでの引用状況を横断的に定点観測できる。ツール選定の比較はOtterly・Peec・Profound 料金3社比較を参考にできる。
  • YouTube Studioのアナリティクス: 「AI経由」を単独の流入元として切り分けることはできないが、リファラーなしの直接流入や検索流入の変化は間接的な指標になる。

判断基準としては、Groundingの再クロールとインデックス反映にはタイムラグがあるため、施策実施から4〜8週間は様子見したうえで評価するのが現実的だ。露出頻度(表示回数)だけでなく、実際のクリック・視聴時間まで踏み込んで見ないと、「表示はされているが誰も見ていない」状態を見落とす。

周辺論点:多言語字幕と動画の構成がAI引用に与える影響

Gemini・Grounding対策を進めるうえで、本筋からやや離れるが無視できない論点が二つある。

一つは多言語字幕だ。Geminiは音声とフレームを直接解析するため、字幕そのものがなくても内容理解は可能とされている。しかし複数言語の字幕を用意しておけば、テキストベースで動画を参照するChatGPTやPerplexity側の理解を助けることになり、Gemini・非Geminiのどちらの経路でも取りこぼしを減らせる。ただし多言語字幕がAI引用率そのものをどの程度押し上げるかを定量化した公開データは、本記事の執筆時点では確認できていない。

もう一つは動画の長さと構成だ。ロングフォームとショートでAI引用率に大きな差があるという実測データもあり、詳細はYouTubeロングフォームとショートのAI引用率は94.3%対5.7%で扱っている。Geminiのフレームサンプリングという仕組みに照らすと、尺が短いショート動画は解析対象となるフレーム数自体が少なくなるため、テロップや図表で情報密度を補う工夫がロングフォーム以上に重要になると考えられる。

ChatGPT・Perplexityとの処理方式の違い

項目GeminiChatGPTPerplexity
動画の読み取り方式映像フレーム(1 FPS)+音声+テキストを直接解析字幕・概要欄などテキストメタデータを参照字幕・概要欄などテキストメタデータを参照
YouTube URLの直接入力対応(API/AI Studio、プレビュー機能、公開動画のみ)非対応(ウェブ検索経由でメタデータ取得)対応(検索結果経由でメタデータ取得)
画面内テキスト・図表の認識可能(フレーム解析による)不可不可
YouTube引用シェア(Otterly.AI調査)0.2%4.4%38.7%
1リクエストの動画処理上限最大10本(Gemini 2.5以降)非公開非公開

表からわかる通り、Geminiは動画そのものへのアクセスの深さでは他を上回るのに、実際の引用シェアでは最も低い。動画対策の投資配分を考える際は、この「理解の深さ」と「引用の頻度」を混同しないことが重要だ。

よくある質問

Q1. Gemini自体はYouTube動画をよく引用するのか?

直接引用は少ない。Otterly.AIの調査でGeminiのYouTube引用シェアは0.2%と、他の主要AI検索の中で最も低い水準だった。

Gemini(gemini.google.com)は社会的な情報源としてYouTube・Reddit・LinkedIn・TikTokの4つに限定して参照する傾向があり、その中でもYouTubeの引用量はほぼゼロに近いと分析されている。動画対策の主戦場はGemini本体よりもAI OverviewやAI Modeになる。

Q2. Gemini APIでYouTube動画を直接読み込ませることはできるのか?

できる。プロンプトにYouTube動画のURLをそのまま渡すだけで、ダウンロードなしに内容を解析できるプレビュー機能が用意されている。

対応は公開設定の動画のみで、非公開・限定公開の動画は対象外となる。テキスト部分は動画パーツより後に配置するのが推奨手順だ。

Q3. YouTube URL機能は無料で使えるのか?

無料枠は1日あたり合計8時間分の動画までで、有料枠には動画長の制限がない。

長尺動画や複数本をまとめて検証したい場合は、有料枠での利用を前提に検証設計を組んだほうが現実的だ。

Q4. Geminiは動画のどこを見ているのか、字幕だけを読んでいるのか?

字幕だけでなく、1秒に1フレームの映像と音声そのものを直接解析している。

このためGeminiは、音声にも字幕にも現れない画面内のテロップや図表といった視覚情報も、原理的には参照材料にできる。他のテキストベースのAIとの根本的な違いがここにある。

Q5. 1リクエストで何本の動画を扱えるのか?

Gemini 2.5以降のモデルは、1リクエストにつき最大10本の動画をまとめて処理できる。

それ以前のモデルは1リクエストにつき1本までという制約があった。ただし公式のベストプラクティスでは、精度を優先するなら1リクエスト1本に絞ることが推奨されている。

Q6. 非公開・限定公開のYouTube動画も解析できるのか?

できない。YouTube URL機能で解析できるのは公開設定の動画のみである。

会員限定配信やアーカイブ限定公開の動画は、そもそもGeminiの解析対象にもGroundingの引用対象にもなり得ない。AI経由での可視化を狙う動画は公開設定を維持する必要がある。

Q7. タイムスタンプはどう指定すればよいのか?

MM:SS形式(例: 01:15)で指定すると、その時点の内容について質問したり回答させたりできる。

動画側でこの形式に沿ったチャプター(タイムスタンプ付き概要欄表記)を用意しておくと、Geminiが動画をセグメント単位で切り分けて参照しやすくなる。

Q8. AI OverviewとAI ModeとGeminiは同じものなのか?

別々の製品だが、同じGeminiモデルを基盤としており、Groundingの仕組みを共有している。

Googleは2025年11月のAI Modeへの投入に続き、2026年1月にはGoogle検索のAI概要のデフォルトモデルもGemini 3に切り替えたと発表した。ただし引用挙動は製品ごとに異なるため、対策効果もそれぞれ個別に確認する必要がある。

Q9. 動画の長さはAI引用に影響するのか?

明確な相関は確認されていないが、1つのトピックを深く扱う構成の動画の方がGroundingの根拠として選ばれやすい傾向がある。

1 FPSのフレームサンプリングという仕様上、話題が頻繁に切り替わる構成よりも、チャプターごとに落ち着いて1テーマを掘り下げる構成の方がGeminiの解析精度とも相性がよい。

Q10. VideoObjectのhasPart/Clipマークアップは必ず実装すべきか?

必須ではないが、10分を超える長尺動画や章立てがはっきりした動画では効果が見込める。

GoogleはClipマークアップをもとに、検索結果に最大5件までのKey Moments(タイムスタンプ付きリンク)を表示するとしている。数分程度の短い動画では分割の効果が薄いため、動画の長さに応じて実装の優先度を判断するとよい。

Q11. Otterly.AIの調査データはどこまで信頼できるのか?

1億件超のAI引用データを30日間分析した大規模調査だが、調査元自身が「相関関係は因果関係を意味しない」「データセットに含まれるのはすでに引用された動画のみ」という2つの限界を明示している。

そのため調査結果は「一度引用された動画がなぜ繰り返し引用されるか」の説明として読むべきで、「まだ引用されていない動画が最初にどう選ばれるか」の答えとしては別途検証が必要だ。

Q12. この記事の内容は日本語動画・日本市場にもそのまま当てはまるのか?

Groundingの仕組み自体は日本語検索にも働くが、Otterly.AIの調査データに言語別・地域別の内訳は公開されていない。

AI Overviewは2024年8月以降日本を含む各国に展開され、AI Modeも日本語に対応しているため、施策の方向性としては参考になる。ただし日本語字幕特有の認識精度などは調査対象外のため、自社データでの検証を省略しないことが望ましい。

Q13. Gemini APIで動画の一部分だけを解析対象にすることはできるか?

できる。動画パーツにvideoMetadataとしてstart_offset・end_offsetを指定すれば、解析範囲を動画の一部に絞り込める。

同じくvideoMetadataのfpsパラメータでフレームサンプリングのレートを既定の1から変更することも可能で、静止画中心の長尺動画では下げてコストを抑え、変化の速い映像では上げて精度を優先する、といった使い分けができる。

まとめ

  • Geminiは字幕ではなく映像フレーム(1 FPS)と音声そのものを直接解析しており、画面内のテロップや図表も参照材料になり得る
  • しかしGemini本体(gemini.google.com)のYouTube引用シェアは0.2%と低く、主戦場はGrounding経由のAI OverviewとAI Modeである
  • 最適化の起点は公開設定を完全公開にすることであり、限定公開・非公開の動画はそもそも解析対象にも引用対象にもならない
  • チャプター・概要欄・VideoObject+Clipスキーマは、Geminiのセグメント理解とGoogle検索のKey Moments表示の両方に効く重複投資になる
  • Otterly.AIの調査は「繰り返し引用される理由」の説明力が強く、「最初に引用される条件」の説明にはならない点を踏まえて解釈する
  • 効果測定はGemini本体ではなくAI OverviewとAI Modeを中心に、4〜8週間のタイムラグを見込んで判断する

次のアクションとしては、まず自社の主力動画1本を選び、公開設定・字幕・チャプター・VideoObjectスキーマの4点を棚卸しし、欠けている部分から着手するのが最短ルートだ。

関連用語

  • グラウンディング — LLMが回答の根拠を外部の情報源に紐づける仕組み。AI OverviewとAI ModeがYouTube動画を引用する際の中核メカニズム。
  • Gemini SEO — Geminiおよびその基盤で動くGoogle製品に引用・参照されるためのコンテンツ最適化手法。
  • YouTube SEO — YouTube内外の検索・AI引用で発見されるための最適化施策全般。
  • VideoObject スキーマ — 動画メタデータをAIに機械的に伝えるための構造化データ形式。
  • チャプターマーカー — 動画内のタイムスタンプ区切り。Geminiのセグメント単位での動画理解と直結する。
  • AI Overview — Google検索結果の最上部にGeminiが生成する要約回答。Groundingの仕組みでYouTube動画を引用元として表示する主要な経路。
  • GSC(Google Search Console) — 検索パフォーマンスを計測するGoogle公式の無料ツール。動画埋め込みページのクエリ・掲載順位・CTRを追う際の基本ツール。
  • JSON-LD — 構造化データをJSON形式で記述する実装方式。VideoObject/Clipスキーマの実装フォーマットとして使う。

関連記事

参考文献

  1. Video understanding | Gemini API | Google AI for DevelopersGoogle AI for Developers(参照: 2026-07-04)
  2. YouTube AI Citation Study 2026Otterly.AI(参照: 2026-07-04)
  3. Gemini 3: our most intelligent model, now in SearchGoogle Blog(参照: 2026-07-04)
  4. Google検索、Gemini 3をAI概要のデフォルトAIに設定テクノエッジ(参照: 2026-07-04)
  5. YouTube vs Reddit: Which Platform Drives More AI Citations in 2026?Superlines(参照: 2026-07-04)
  6. Video (VideoObject, Clip, BroadcastEvent) Schema MarkupGoogle Search Central(参照: 2026-07-04)

関連用語

  • インデックス

    インデックスとは、クローラーが集めたページをGoogleがデータベースに登録すること。インデックスされて初めて検索結果に表示される対象になります。「索引」とイメージすると分かりやすい用語です。

  • キーワード

    キーワードとは、ユーザーが検索エンジンやChatGPT等のAI検索に打ち込む単語・フレーズ。SEO・LLMO両対策の出発点。ビッグ/ロングテール選定基準と無料ツールを使った選び方を初心者向けに解説します。

  • クエリ

    クエリとは、ユーザーが実際に検索窓に入力した検索語のこと。SEOで使う「キーワード」と似ていますが、キーワードが事前に狙う言葉、クエリが実際に打たれた言葉、というニュアンスの違いがあります。

  • グラウンディング

    グラウンディングとは、LLMの回答を信頼できる外部情報源(Web・社内文書)に「接地」させて、ハルシネーション(嘘)を防ぐ仕組み。RAGはグラウンディングの代表的な実装方法です。

  • クローラー

    クローラーとは、Web上のページを自動巡回してデータを集めるプログラムのこと。Googleの「Googlebot」が代表例で、これに見つけてもらわないと検索結果に表示されません。

  • 構造化データ

    構造化データとは、Webページの内容を検索エンジンが理解しやすい形式で記述したメタ情報。記事の著者・公開日、商品の価格・在庫などを機械可読にすることでリッチリザルトやAI引用の対象になります。

関連記事

最新記事

LLMモニタリングツールおすすめ7選|2026年7月最新の料金で比較検討 (llm-monitoring-tools-comparison-2026)
ツール比較基礎2026/06/07

LLMモニタリングツールおすすめ7選|2026年7月最新の料金で比較検討

LLMモニタリングツールのおすすめを用途別・予算別にランキングで結論提示。Profound・Otterly AI・Peec AI等を2026年7月最新料金で比較検討し、無料で足りる範囲と有料化すべき閾値まで解説する。

#LLMモニタリングツール#LLMモニタリングツール おすすめ#モニタリングツール比較検討#AI回答引用
YouTube SEO 完全ガイド 2026 年版|雑学ショートから学べる検索流入の作り方 (youtube-seo-2026-japan-complete-guide)
SEO基礎2026/05/23

YouTube SEO 完全ガイド 2026 年版|雑学ショートから学べる検索流入の作り方

YouTube SEO の本質を 2026 年のアルゴリズムと AI 検索の文脈で再整理。雑学ショート動画運営者でも実践できる KW 選定・タイトル・サムネ・視聴維持率・Shorts と LLMO 引用の関係まで網羅した日本語ピラーガイド。

#YouTube SEO#YouTube アルゴリズム#YouTube Shorts#雑学チャンネル
YouTube 収益化 完全ガイド【2026 年版】6 つの収益モデルと月収目安の現実 (youtube-monetization-complete-guide-2026)
ツール比較基礎2026/05/17

YouTube 収益化 完全ガイド【2026 年版】6 つの収益モデルと月収目安の現実

YouTube 収益化を 2026 年時点の全 6 モデル(広告・Shorts・メンバーシップ・スパチャ・アフィリエイト・スポンサー)で体系化。YPP 条件・ジャンル別 RPM・月収目安まで、収益化までの最短ロードマップを解説。

#YouTube収益化#YPP#YouTubeパートナープログラム#RPM
動画 SEO 完全ガイド 2026|YouTube・Google・AI 検索の三軸最適化 (video-seo-complete-guide-2026)
ツール比較基礎2026/05/10

動画 SEO 完全ガイド 2026|YouTube・Google・AI 検索の三軸最適化

動画 SEO を YouTube・Google 検索・AI 検索の三軸で網羅。VideoObject スキーマ・字幕・動画サイトマップ・計測ツールまで25,000字で解説する2026年版決定ガイド。

#動画SEO#VideoObject#YouTube#AI検索
無料キーワード調査ツール完全比較 12 選【2026 年版・トラフィック獲得用ハブ】 (free-keyword-tools-master-comparison-2026)
ツール比較基礎2026/05/09

無料キーワード調査ツール完全比較 12 選【2026 年版・トラフィック獲得用ハブ】

無料で使えるキーワード調査ツール 12 選を徹底比較。サジェスト精度・検索ボリューム精度・日本語対応を 3 軸で評価し、個人ブロガーから BtoB SaaS まで用途別の最強組み合わせを解説します。

#無料キーワードツール#キーワード調査#比較#2026
Ahrefs 無料は表示1,000件まで|エイチレフス無料版の上限・料金・代替7選【2026年7月】 (ahrefs-free-alternatives)
ツール比較基礎2026/05/06

Ahrefs 無料は表示1,000件まで|エイチレフス無料版の上限・料金・代替7選【2026年7月】

Ahrefs 無料版(エイチレフス)の上限と料金を2026年7月時点の実額で整理。0円代替7選も比較。

#Ahrefs#Ahrefs無料#エイチレフス#代替ツール

LLMO カテゴリの他の記事