Gemini Flashの動画理解がどう変わったのか
これまでのGeminiモデルでは、動画の内容を解析する際、90分の講義動画であっても1秒あたり1フレームという固定レートで全タイムラインを取り込んでいました。これは、たとえ「特定の価格スライドがいつ表示されたか」というピンポイントの質問であっても、動画全体を処理する必要があったため、非常にコストと時間がかかる非効率な方法でした。開発者としては、この「全タイムライン処理」か「事前チャンク化による情報欠損リスク」のトレードオフに悩まされてきたのではないでしょうか。
Googleは、最大88%のトークン削減、最大66%のコスト削減、そして最大7%の精度向上を報告しています。
今回導入された「エージェント型動画理解」は、この問題を根本から解決します。Geminiモデルが動画のタイムラインを単に「取り込む」のではなく、「何を、どのフレームレートで、どのモダリティ(フレーム、音声、トランスクリプト)で見るべきか」を自ら判断し、ナビゲートするようになります。
これにより、必要な部分だけをオンデマンドでロードできるようになり、トークン数とコストを大幅に削減できるというわけです。これは、開発者にとって待望の機能だと感じます。
旧来の処理とエージェント型処理の比較
| 項目 | 旧来の静的処理(デフォルト) | エージェント型処理(新機能) |
|---|---|---|
| 動画取り込み | 1 FPSで全フレームを単一パスで抽出 | モデルが「何を視聴するか」を判断し、必要なセグメントのみをロード |
| 音声処理 | 1 Kbpsシングルチャンネルで単一パス処理 | モデルの推論とネイティブ動画ツールを組み合わせ、オンデマンドで処理 |
| タイムスタンプ | 1秒ごとに挿入 | プロンプトに応じて特定のセグメントを検索、スキャン、検査 |
| 開発オーバーヘッド | 開発者が手動でループを構築する必要あり | Geminiが内部でループを実行するため、開発オーバーヘッドが消失 |
| 効率性向上 | 短尺動画での効率は一定 | 長尺コンテンツ(10分〜数時間)で効率が大幅に向上 |
この変更により、Gemini 3.7 Flashは、Googleの評価において、動画分析における精度とコストのパレート最適解(Pareto frontier)に位置するとのことです。特に、10分のハウツーガイドから数時間の録画まで、長尺コンテンツでの効率性が顕著に向上すると報告されています。
これは、私のようにローカルLLMで動画分析を試みているエンジニアにとっては、クラウドAPIの強力な選択肢として非常に魅力的です。自宅のRTX 3090でどこまでできるかという挑戦も楽しいですが、実用性ではやはりGCPのようなクラウド基盤のAPIには敵いませんね。
APIからのレスポンスとトークン課金
エージェント型処理を有効にした場合、APIのレスポンスのsteps配列にprocessing_callとprocessing_resultという2種類のステップが追加されます。processing_callはモデルがセグメントやトランスクリプトを要求した際、processing_resultはそのロードが完了した際に返されます。
これらはthoughtステップと交互に現れ、model_outputの前に出力されるため、UIでリアルタイムの進捗状況を追跡することが可能です。このステップの存在こそが、エージェントモードが実際に実行されたことを確認する手立てにもなります。
トークン課金は、ナビゲーション推論が思考トークン(
total_thought_tokens)として、オンデマンドでロードされたフレーム、音声、トランスクリプトがツール利用トークン(total_tool_use_tokens)として計上されます。
課金についても、この新しいトークン種別で明確に区別されるとのことです。これにより、開発者はどの部分にどれだけのコストがかかっているかを把握しやすくなります。Gemini APIの通常のトークン課金が適用され、追加機能料金は発生しないため、既存のワークフローへの組み込みもスムーズに行えるでしょう。
これは非常に開発者フレンドリーな設計だと感じます。個人的なプロダクトで動画解析を導入する際には、このコスト構造は非常に重要なポイントになるはずです。
計画の精度に関する注意点
余談ですが、Google Geminiを活用した計画の精度については、注意を促すニュースも出ています。例えば、TechCrunchの報道によると、2026年9月5日に米国のシャスタ山で遭難した3人のハイカーが、Google Geminiを使って遠征計画を立てた結果、必要な食料や水を大幅に少なく見積もってしまい、多日間にわたる遭難につながった事例が報告されています(出典)。AIは強力なツールですが、その出力はあくまで参考情報であり、特に生命に関わるような重要な意思決定においては、専門家の意見や現地情報を必ず確認する必要があることを改めて認識させられます。