論文の概要: Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs
- arxiv url: http://arxiv.org/abs/2608.05592v1
- Date: Thu, 06 Aug 2026 04:27:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.81909
- Title: Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs
- Title(参考訳): フレーム選択を超えて - MLLMによる長時間ビデオ理解の再考
- Abstract要約: Video(VR)は、各動画を質問に依存しない時間階層に整理する。
ノードは広いストーリーラインのコンテキストとイベントの進行をキャプチャする。
低レベルのノードは、きめ細かい局所的な詳細と証拠を含む瞬間を保持する。
- 参考スコア(独自算出の注目度): 16.29545034560019
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have achieved strong progress in video understanding, yet it remains challenging because the token limitation makes MLLMs difficult to capture temporally sparse evidence. Existing methods typically rely on uniform sampling, or frame selection, but these strategies usually optimize either broad temporal coverage or local relevance, making it difficult to preserve both global storyline context and fine-grained evidence. We propose VideoRouter(VR) that rethinks long-video understanding as coordinating complementary evidence views rather than selecting a single subset of frames. It first organizes each video into a question-agnostic temporal hierarchy, which partition the video into coarse-to-fine temporally coherent segments. In this hierarchy, upper-level nodes capture broad storyline context and event progression, while lower-level nodes preserve fine-grained local details and evidence-bearing moments. This naturally gives rise to two complementary views: a global view for coverage-oriented reasoning and a local view for detail-oriented evidence recovery. We further introduce a verification-guided router to determine which view is better supported by the selected evidence and select the final answer. We validate the effectiveness of the proposed design through extensive experiments, showing that the verification-guided router effectively coordinates global and local reasoning, and that, on VideoMME, our method outperforms state-of-the-art frame selection methods by 2.9 points, respectively, under the LLaVA-Video-7B backbone. We will release the code.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)はビデオ理解において大きな進歩を遂げているが、トークン制限によってMLLMが時間的に疎らな証拠を捉えるのが難しくなるため、依然として困難である。
既存の手法は通常、一様サンプリングやフレーム選択に頼っているが、これらの戦略は通常、広範囲の時間的カバレッジと局所的な関連性の両方を最適化し、グローバルなストーリーラインコンテキストときめ細かい証拠の保存を困難にしている。
本稿では,フレームの1つのサブセットを選択するのではなく,相補的なエビデンスビューをコーディネートするものとして,長いビデオ理解を再考するVideoRouter(VR)を提案する。
まず、各動画を質問非依存の時間的階層に整理し、ビデオを粗い時間的一貫性のあるセグメントに分割する。
この階層では、上位ノードは広いストーリーラインのコンテキストとイベントの進行をキャプチャし、下位ノードはきめ細かいローカルの詳細とエビデンスを含む瞬間を保存する。
このことは、カバレッジ指向推論のグローバルな見解と、詳細指向のエビデンス回復のローカルな見解という、2つの補完的な見解を生み出します。
さらに、検証誘導ルータを導入し、選択したエビデンスによってどのビューがより良く支持されているかを決定し、最終回答を選択する。
検証誘導ルータはグローバルおよびローカルな推論を効果的にコーディネートし,ビデオMMEでは,LLaVA-Video-7Bバックボーンのフレーム選択法を2.9ポイント上回る性能を示した。
コードを公開します。
関連論文リスト
- VideoScout: Learning Agentic Active Exploration with Adaptive Reasoning Pacing for Long Video Understanding [61.00809248898572]
ロングビデオ理解(英: Long video understanding)とは、エージェントが時間軸に沿って回転してビデオを読み取る問題である。
適応推論によるSEAパラダイムをインスタンス化するマルチターン推論エージェントである textbfVideoScout を提案する。
長いビデオ理解と推論のベンチマーク実験により、我々の7Bモデルは、既存の訓練された7Bエージェントモデルと比較して、強い性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-09-14T14:04:03Z) - RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding [55.75126327155788]
RIDGEはフレーム選択フレームワークであり、時間信号としてフレームクエリの類似性曲線を読み取る。
タイムラインを構造的なリージョンに分割し、固定予算の下でイベントコア、トランジション、ビルドアップ、アフターマス、コンテキストフレームを保存するために、リージョン固有の選択を適用する。
ほとんどの設定で最高のパフォーマンスを達成し、他の設定では競争力を維持します。
論文 参考訳(メタデータ) (2026-08-30T18:40:51Z) - VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding [60.161767365040554]
本稿では,クエリグラウンドビジュアルサンプリングのためのトレーニングフリーかつプラグイン・アンド・プレイフレームワークを提案する。
Visual Firstは、各クエリをグローバルまたはローカルに分類し、それに対応するサンプリング戦略を適用する。
実験の結果、Visualは均一サンプリングよりも複数のLVLMを継続的に改善し、ビデオ-MME、LongVideoBench、MLVUで5.2%、7.7%、11.6%を達成し、Qwen2.5-VL-7Bで既存のトレーニング不要のビジュアルサンプリング手法より優れていた。
論文 参考訳(メタデータ) (2026-07-30T16:23:10Z) - HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization [16.58089288863005]
映像要約のためのハイライト誘導アテンションステアリング法であるHASを提案する。
我々は,様々なベンチマークでHASを評価し,映像要約において説得力のある性能を示した。
論文 参考訳(メタデータ) (2026-07-20T14:27:06Z) - VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding [40.699624658181456]
VideoDetectiveは、長いビデオ質問応答において効果的な手がかり探しのために、クエリ・ツー・セグメンテーションの関連性とセグメンション間の親和性を統合するフレームワークである。
提案手法は,ビデオMME-longで最大7.5%の精度向上を実現し,MLLMの多種多様な性能向上を実現している。
論文 参考訳(メタデータ) (2026-03-23T17:59:51Z) - SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM [36.28285195488772]
大規模言語モデル(LLM)は、テキスト理解において例外的な能力を示した。
Vid-LLMは高品質なフレームレベルのセマンティック情報を同時に保持するのに苦労する。
この制限は、Vid-LLMの微細なビデオ理解への進歩を妨げる。
論文 参考訳(メタデータ) (2026-02-03T14:39:16Z) - SeViCES: Unifying Semantic-Visual Evidence Consensus for Long Video Understanding [36.30263540665245]
本稿では,効果的で信頼性の高いロングビデオ理解のためのフレームワークを提案する。
SeViCESはトレーニング不要でモデルに依存しない2つの重要なコンポーネントを導入している。
長いビデオ理解ベンチマークの実験によると、SeViCESは精度と堅牢性の両方で最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-23T14:55:28Z) - MHSCNet: A Multimodal Hierarchical Shot-aware Convolutional Network for
Video Summarization [61.69587867308656]
本稿では,MHSCNetと呼ばれるマルチモーダル階層型ショット・アウェア・畳み込みネットワークを提案する。
学習したショット認識表現に基づいて、MHSCNetは、ビデオのローカルおよびグローバルビューにおけるフレームレベルの重要度スコアを予測することができる。
論文 参考訳(メタデータ) (2022-04-18T14:53:33Z) - Local-Global Associative Frame Assemble in Video Re-ID [57.7470971197962]
ビデオ列から自動生成されたオブジェクト境界ボックスにおける雑音および非表現フレームは、ビデオ再識別(Re-ID)における識別表現の学習に困難をもたらす
既存の手法の多くは、局所的な部分アライメントまたはグローバルな外観相関によって、ビデオフレームの重要性を個別に評価することで、この問題に対処している。
本研究では,局所的なアライメントとグローバルな相関関係を共同で検討し,相互の促進・強化について考察する。
論文 参考訳(メタデータ) (2021-10-22T19:07:39Z) - Temporally-Weighted Hierarchical Clustering for Unsupervised Action
Segmentation [96.67525775629444]
アクションセグメンテーションとは、ビデオにおける意味的に一貫した視覚概念の境界を推測することを指す。
ビデオ中のセグメンテーション動作に対して,トレーニングを必要としない完全自動かつ教師なしのアプローチを提案する。
提案手法は,ビデオの意味的に一貫性のあるフレームをグループ化できる効果的な時間重み付き階層クラスタリングアルゴリズムである。
論文 参考訳(メタデータ) (2021-03-20T23:30:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。