論文の概要: VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding
- arxiv url: http://arxiv.org/abs/2607.28463v1
- Date: Thu, 30 Jul 2026 16:23:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.659043
- Title: VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding
- Title(参考訳): VisualRouter: 長いビデオ理解のためのクエリを囲むビジュアルサンプリング
- Abstract要約: 本稿では,クエリグラウンドビジュアルサンプリングのためのトレーニングフリーかつプラグイン・アンド・プレイフレームワークを提案する。
Visual Firstは、各クエリをグローバルまたはローカルに分類し、それに対応するサンプリング戦略を適用する。
実験の結果、Visualは均一サンプリングよりも複数のLVLMを継続的に改善し、ビデオ-MME、LongVideoBench、MLVUで5.2%、7.7%、11.6%を達成し、Qwen2.5-VL-7Bで既存のトレーニング不要のビジュアルサンプリング手法より優れていた。
- 参考スコア(独自算出の注目度): 60.161767365040554
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large vision-language models (LVLMs) have achieved significant progress in video understanding, yet understanding long videos remains challenging due to the large number of visual tokens and limited context windows. Visual sampling provides a practical solution by selecting an informative subset of frames. However, existing methods typically either rely on relevance-aware sampling, leading to redundant frame selection and insufficient temporal coverage, or adopt a fixed sampling strategy regardless of query type. In this paper, we propose VisualRouter, a training-free and plug-and-play framework for query-grounded visual sampling. VisualRouter first classifies each query as either global or local and then applies the corresponding sampling strategy. For global queries, it employs a relevance-coverage hybrid strategy that preserves temporal coverage while retaining query-relevant visual evidence. For local queries, it adopts an event-aware frame selection strategy that performs event partitioning, segment-level frame allocation, and intra-event frame selection, jointly balancing relevance, coverage, and diversity with a limited number of input frames. Experiments show that VisualRouter consistently improves multiple LVLMs over uniform sampling, achieving gains of 5.2%, 7.7%, and 11.6% on Video-MME, LongVideoBench, and MLVU with Qwen2.5-VL-7B, and outperforming existing training-free visual sampling methods under the same setting.
- Abstract(参考訳): 大規模な視覚言語モデル(LVLM)は、ビデオ理解において大きな進歩を遂げているが、多くの視覚トークンと限られたコンテキストウィンドウのために、長いビデオを理解することは困難である。
ビジュアルサンプリングは、フレームの情報サブセットを選択することで、実用的なソリューションを提供する。
しかし、既存の手法は通常、関連性を認識したサンプリングに依存し、冗長なフレーム選択と時間的カバレッジの不足につながるか、あるいはクエリの種類に関わらず、固定的なサンプリング戦略を採用する。
本稿では,クエリ・グラウンド・ビジュアル・サンプリングのためのトレーニングフリー・プラグイン・アンド・プレイ・フレームワークであるVisualRouterを提案する。
VisualRouterはまず、各クエリをグローバルまたはローカルに分類し、次に対応するサンプリング戦略を適用します。
グローバルクエリでは、クエリ関連視覚的エビデンスを保持しながら、時間的カバレッジを保持する、関連カバレッジハイブリッド戦略を採用している。
ローカルクエリでは、イベントパーティショニング、セグメントレベルのフレーム割り当て、およびイベント内フレーム選択を実行するイベント対応フレーム選択戦略を採用し、関連する関連性、カバレッジ、多様性を限られた数の入力フレームと共同でバランスさせる。
実験の結果、VisualRouterは、一様サンプリングよりも複数のLVLMを継続的に改善し、ビデオMME、LongVideoBench、MLVUで5.2%、7.7%、11.6%を達成し、Qwen2.5-VL-7Bで既存のトレーニング不要のビジュアルサンプリング方法より優れていた。
関連論文リスト
- Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors [69.75895255395702]
MLLMの検証選択抽出層におけるクロスモーダルな注意は、自己回帰生成を必要とせずに、クエリ関連フレーム証拠を既に提供している。
2Bパラメータしか持たない軽量MLLMセレクタは、クエリ条件アグリゲーションにより、選択した層注目値を関連スコアに変換することにより、フレームレベルのエビデンスを抽出することができる。
32フレームの予算下では,ビデオMMEで最大6.4ポイントの均一サンプリングを改良し,フレーム予算の一致したトレーニングベースセレクタよりも優れていた。
論文 参考訳(メタデータ) (2026-07-17T07:04:31Z) - Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language [60.91064560080974]
本稿では,クエリ関連クリップをトリムするスポットVMRを提案する。
提案するSpotVMRは,最新のVMR手法の効率性を実現するプラグイン・アンド・プレイモジュールとして機能する。
論文 参考訳(メタデータ) (2026-05-28T11:42:28Z) - Event-Anchored Frame Selection for Effective Long-Video Understanding [67.56884568828508]
Event-Anchored Frame Selection (EFS)は階層的なイベント認識パイプラインである。
トレーニング不要のプラグイン・アンド・プレイモジュールとして、EFSは既製のLVLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-03-01T08:25:37Z) - VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding [9.415923244280542]
VideoBrainは、Vision-Language Modelsが学習したサンプリングポリシーを通じて視覚情報を適応的に取得することを可能にするエンドツーエンドフレームワークである。
提案手法は,ビデオ間の意味検索を行うCLIPエージェントと,時間間隔内での高密度サンプリングを行うUniformエージェントの2つの補完エージェントを特徴とする。
論文 参考訳(メタデータ) (2026-02-04T00:08:35Z) - Improving Video Question Answering through query-based frame selection [15.416301612152004]
Video Question Answering (VideoQA) モデルは、視聴覚コンテンツに対する理解とインタラクションを強化する。
重い計算要求のため、ビデオQAのほとんどの大きなビジュアル言語モデル(VLM)は、動画を一様にサンプリングすることで固定数のフレームに依存している。
本稿では,サブモジュール相互情報(SMI)関数に基づいて,質問に関連のある新しい問合せベースのフレーム選択を提案する。
論文 参考訳(メタデータ) (2026-01-12T12:10:20Z) - Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding [21.18266593437182]
そこで本研究では,クエリタイプに基づいた学習自由なフレーム選択フレームワークを提案する。
3つの長いビデオ理解ベンチマークの実験は、DIGが既存のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-03T17:36:06Z) - BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding [51.49345400300556]
大規模ビデオ言語モデル (VLM) は様々なビデオ理解タスクにおいて有望な進歩を示した。
均一なフレームサンプリングのような伝統的なアプローチは、必然的に無関係なコンテンツにリソースを割り当てる。
本稿では,フレーム選択戦略の総合的研究を通じて,付加的なトレーニングを伴わずに大規模VLMをブーストする方法であるBOLTを紹介する。
論文 参考訳(メタデータ) (2025-03-27T13:18:40Z) - Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA [40.21221568678641]
広い時間間隔にまたがるロングフォームビデオは、非常に冗長な情報である。
正しい応答を生成するために必要な全ての情報は、しばしばフレームの小さなサブセットに含まれる。
近年の文献では、LVQAベンチマークにおける大きな言語モデルの使用を探求し、例外的な性能を達成している。
論文 参考訳(メタデータ) (2024-06-13T17:59:16Z) - DeepQAMVS: Query-Aware Hierarchical Pointer Networks for Multi-Video
Summarization [127.16984421969529]
DeepQAMVSと呼ばれるマルチビデオ要約のための新しいQuery-Aware階層型ポインタネットワークを紹介します。
DeepQAMVSは強化学習で訓練され、代表性、多様性、クエリ適応性、時間的コヒーレンスを捉えた報酬を取り入れている。
MVS1Kデータセットで最新の結果を達成し、入力されたビデオフレームの数と線形に推論時間をスケーリングします。
論文 参考訳(メタデータ) (2021-05-13T17:33:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。