論文の概要: One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding
- arxiv url: http://arxiv.org/abs/2608.05707v1
- Date: Thu, 06 Aug 2026 07:47:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.846876
- Title: One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding
- Title(参考訳): 一つのランク付けと予算:Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding
- Abstract要約: 本稿では,再利用可能なスパースビデオインデックスを構築するトレーニングフリーフレームワークであるMatryoshka Evidence-to-Context (MEC) Frame Selectionを紹介する。
MECは、均一サンプリングよりも平均精度を3.77ポイント向上し、強い最先端セレクタにマッチし、エンドツーエンドの選択遅延を47.37-51.19%削減する。
- 参考スコア(独自算出の注目度): 43.953366792790625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Frame selection is essential for applying Large Multimodal Models (LMMs) to long videos due to severe frame redundancy and limited context windows. Since the appropriate frame budget varies with the downstream LMM, reasoning demands, and latency constraints, a practical selector should serve multiple budgets. However, existing methods typically optimize an isolated frame subset for each predefined budget: when the budget changes, previously selected evidence may be replaced rather than progressively augmented. Ranking frames by a fixed score would allow prefix reuse across budgets, but it ignores the distinct roles of different ranking positions. In this paper, we formulate long-video frame selection as a Matryoshka ranking problem: constructing a single priority sequence whose small prefixes concentrate query-conditioned evidence, while progressively larger prefixes preserve this evidence and add broader temporal context. Efficiently constructing such a ranking is itself challenging, as densely sampling long videos and evaluating frame-query relevance incurs substantial overhead. We therefore introduce Matryoshka Evidence-to-Context (MEC) Frame Selection, a training-free framework that builds a reusable sparse video index, discovers candidates through sparse probing and local zooming, and greedily constructs a position-adaptive ranking: early positions emphasize evidence; later positions progressively favor temporal coverage while preserving visual diversity. A single ranking can thus be truncated to any target budget without rerunning the selector. Across four benchmarks and six frame budgets, MEC improves average accuracy over uniform sampling by 3.77 percentage points, matches strong state-of-the-art selectors, and reduces end-to-end selection latency by 47.37-51.19%.
- Abstract(参考訳): フレーム選択は、フレームの重大さと限られたコンテキストウィンドウのために、LMM(Large Multimodal Models)を長時間ビデオに適用するために不可欠である。
適切なフレーム予算は、下流のLMM、推論要求、遅延制約によって変化するため、実用的なセレクタは複数の予算を提供する必要がある。
しかし、既存の手法は通常、事前に定義された予算ごとに分離されたフレームサブセットを最適化する。
固定スコアによるランク付けは、予算全体にわたってプレフィックスの再利用を可能にするが、異なるランク付けの異なる役割を無視する。
本稿では,より大規模なプレフィックスがこの証拠を保存し,より広い時間的文脈を付加する一方,小さなプレフィックスがクエリ条件付きエビデンスに集中する単一優先度シーケンスを構築することにより,長ビデオフレーム選択をマトリリシカランキング問題として定式化する。
このようなランク付けを効率的に構築することは、長いビデオの密集サンプリングやフレームクエリの関連性の評価がかなりのオーバーヘッドを引き起こすなど、それ自体が困難である。
そこで我々は,再利用可能なスパースビデオインデックスを構築し,スパース探索と局所ズームにより候補を探索し,位置適応的ランキングを構築する訓練自由フレームワークであるMatryoshka Evidence-to-Context (MEC) Frame Selectionを紹介した。
これにより、セレクタを再起動することなく、単一のランキングを任意の予算に切り離すことができる。
4つのベンチマークと6つのフレーム予算で、MECは均一サンプリングよりも平均精度を3.77ポイント向上し、強力な最先端セレクタにマッチし、エンドツーエンドの選択遅延を47.37-51.19%削減した。
関連論文リスト
- RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding [55.75126327155788]
RIDGEはフレーム選択フレームワークであり、時間信号としてフレームクエリの類似性曲線を読み取る。
タイムラインを構造的なリージョンに分割し、固定予算の下でイベントコア、トランジション、ビルドアップ、アフターマス、コンテキストフレームを保存するために、リージョン固有の選択を適用する。
ほとんどの設定で最高のパフォーマンスを達成し、他の設定では競争力を維持します。
論文 参考訳(メタデータ) (2026-08-30T18:40:51Z) - When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding [17.062781672214104]
低オーバーヘッドクエリ適応型視覚的エビデンススケジューリングのためのフレームワークであるEcoFrameを提案する。
Video-MME、LongVideoBench、MLVUの実験では、EcoFrameは複数のVLMバックボーン間で効率の良いトレードオフを実現する。
論文 参考訳(メタデータ) (2026-08-04T16:49:53Z) - Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering [9.937860041147625]
長いビデオの質問に答えるには、制限された視覚的な予算の下でビデオからスパースで重要な証拠を特定する必要がある。
既存の方法は、単一のパスでクエリ対応フレームを選択するか、検索ガイダンスとしてタイムスタンプ付きテキストに頼るかのいずれかである。
本稿では,固定予算フレーム選択を共同エビデンスキュレーション問題として用いたトレーニングフリーフレームワークであるGCRを提案する。
論文 参考訳(メタデータ) (2026-08-03T03:50:22Z) - Coverage-Driven Adaptive Keyframe Selection for Video Understanding [12.078063042214573]
そこで我々はCSESを提案する。CSESは学習不要なセマンティックセレクタで、スコアとセレクトのためのフレームの数を適応的に決定する。
CSESはフレームクエリの優位性を推定し、アクティブな取得を誘導し、各入力の時間的カバレッジを適応させる。
次に、意味的関連性、時間的冗長性、視覚的冗長性を共同で説明するカバレッジ問題として、選択の妥当性を定式化する。
論文 参考訳(メタデータ) (2026-08-01T15:24:06Z) - Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors [69.75895255395702]
MLLMの検証選択抽出層におけるクロスモーダルな注意は、自己回帰生成を必要とせずに、クエリ関連フレーム証拠を既に提供している。
2Bパラメータしか持たない軽量MLLMセレクタは、クエリ条件アグリゲーションにより、選択した層注目値を関連スコアに変換することにより、フレームレベルのエビデンスを抽出することができる。
32フレームの予算下では,ビデオMMEで最大6.4ポイントの均一サンプリングを改良し,フレーム予算の一致したトレーニングベースセレクタよりも優れていた。
論文 参考訳(メタデータ) (2026-07-17T07:04:31Z) - QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding [78.36929439152566]
本稿では,長いビデオからコンパクトだが情報に富んだフレームを選択可能なクエリ・アンド・コンテント・アウェア(QCA)選択フレームワークを提案する。
QCAは最もクエリ関連性の高いフレームにアンカーし、クエリのセマンティックな関連性を維持しながら、多様性を最大化するために追加のフレームを反復的に組み込む。
我々の方法は追加のトレーニングを必要とせず、既存のVideo-LLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-07-01T14:19:24Z) - GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding [63.62445065977448]
GIFT: Global Irreplaceability Frame Targetingはトレーニング不要のフレームワークで、固有の非配置性を評価してフレームを選択する。
GIFTは,LLaVA-Video-7Bの長文ビデオベンチマークにおいて,一様サンプリングに比べて最大12.5%向上したことを示す。
論文 参考訳(メタデータ) (2026-03-26T06:21:41Z) - Adaptive Greedy Frame Selection for Long Video Understanding [11.923839324117674]
大規模視覚言語モデル(VLM)は、長ビデオ質問応答にますます応用されている。
推論は入力フレームの数と結果の視覚トークンによってボトルネックとなることが多い。
固定フレーム予算下でのクエリ関連性とセマンティックな表現性を協調的に最適化する問合せ適応型グレディフレーム選択法を提案する。
論文 参考訳(メタデータ) (2026-03-20T17:55:32Z) - Event-Anchored Frame Selection for Effective Long-Video Understanding [67.56884568828508]
Event-Anchored Frame Selection (EFS)は階層的なイベント認識パイプラインである。
トレーニング不要のプラグイン・アンド・プレイモジュールとして、EFSは既製のLVLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-03-01T08:25:37Z) - ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding [52.050036778325094]
ReFoCUS(Reinforcement-guided Frame Optimization for Contextual UnderStanding)は、新しいフレームレベルのポリシー最適化フレームワークである。
ReFoCUSは、参照LMMから派生した報酬信号を用いて、フレームに対するモデル固有の嗜好を反映して、強化学習を通じてフレーム選択ポリシーを学習する。
提案手法は複数のビデオQAベンチマークにおける推論性能を継続的に改善する。
論文 参考訳(メタデータ) (2025-06-02T03:08:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。