論文の概要: Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering
- arxiv url: http://arxiv.org/abs/2608.01660v1
- Date: Mon, 03 Aug 2026 03:50:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.32016
- Title: Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering
- Title(参考訳): グラウンド,カバー,リファイン:長ビデオ質問応答のためのエビデンス中心フレーム選択
- Abstract要約: 長いビデオの質問に答えるには、制限された視覚的な予算の下でビデオからスパースで重要な証拠を特定する必要がある。
既存の方法は、単一のパスでクエリ対応フレームを選択するか、検索ガイダンスとしてタイムスタンプ付きテキストに頼るかのいずれかである。
本稿では,固定予算フレーム選択を共同エビデンスキュレーション問題として用いたトレーニングフリーフレームワークであるGCRを提案する。
- 参考スコア(独自算出の注目度): 9.937860041147625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-video question answering requires identifying sparse yet critical evidence from videos containing thousands of frames under a constrained visual-token budget. Existing methods either select query-aware frames in a single pass or rely on timestamped text solely as retrieval guidance, leading to two key limitations. First, selected frames tend to cluster around local relevance peaks, and once the budget is exhausted, omitted evidence cannot be recovered. Second, textual and visual evidence remain weakly aligned. We propose GCR, a training-free framework that casts fixed-budget frame selection as a joint evidence curation problem. Ground converts timestamped text into temporal events, selects query-relevant real frame anchors, and renders each event text onto its temporally aligned frame. Cover supplements grounded events with direct visual anchors for complementary visual evidence and applies global maximal marginal relevance to preserve diverse context. Refine revisits omitted temporal regions and replaces the weakest revisable context frame with a real-frame medoid---but only when the medoid offers greater evidence value. GCR maintains a fixed number of chronologically ordered frames and requires no VLM training or architectural modification. Experiments on LongVideoBench and Video-MME, across three 7B backbones and frame budgets of 8, 32, and 64, demonstrate consistent improvements in long-video QA. With the 7B LLaVA-OV backbone and 32 frames, GCR achieves 64.25% and 62.15% on the two benchmarks, outperforming the strongest reproduced baselines by 2.54 and 1.93 percentage points, respectively.
- Abstract(参考訳): 長いビデオの質問に答えるには、制約のある視覚的な予算の下で数千のフレームを含むビデオから、スパースで重要な証拠を特定する必要がある。
既存の方法は、単一のパスでクエリ対応フレームを選択するか、検索ガイダンスとしてタイムスタンプ付きテキストに頼るかのいずれかで、2つの重要な制限が生じる。
第一に、選択されたフレームは、局所的な関連ピークの周りに集結する傾向があり、予算が枯渇すると、省略された証拠は回収できない。
第二に、文章的証拠と視覚的証拠は弱い一致のままである。
本稿では,固定予算フレーム選択を共同エビデンスキュレーション問題として用いたトレーニングフリーフレームワークであるGCRを提案する。
Groundはタイムスタンプされたテキストを時間的イベントに変換し、クエリ関連の実フレームアンカーを選択し、各イベントテキストを時間的に整列されたフレームにレンダリングする。
補完的な視覚的証拠のための直接的視覚的アンカーによる接地イベントのサプリメントをカバーし、多種多様な文脈を保存するために、グローバルな極端の限界関係を適用している。
Refineリビジョンは時間領域を省略し、最も弱いリビジョン可能なコンテキストフレームを実フレームのメドロイドに置き換える。
GCRは時間順に一定数のフレームを保持しており、VLMのトレーニングやアーキテクチャの変更は必要としない。
LongVideoBenchとVideo-MMEの実験では、7Bのバックボーンと8,32,64のフレーム予算にまたがって、ロングビデオQAの一貫性のある改善が示されている。
7BのLLaVA-OVバックボーンと32フレームで、GCRは2つのベンチマークで64.25%と62.15%を獲得し、それぞれ2.54と1.93ポイントの再生ベースラインを上回った。
関連論文リスト
- Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding [59.773752487686444]
エッジデバイスに対する長いビデオ理解は、厳格な計算と帯域幅の予算の下で何時間ものコンテンツを引き起こす必要がある。
予算対応のエッジクラウドエージェントフレームワークであるCaption-once, Frames-onDemandを提案する。
長時間ビデオベンチマークの実験では、オンラインビジュアル処理を大幅に削減しながら、高い精度と効率のトレードオフを示す。
論文 参考訳(メタデータ) (2026-09-10T17:53:59Z) - Intrinsic Temporal Adaptation of CLIP for Partially Relevant Video Retrieval [40.983482307220676]
PRVRは、テキストクエリに関連するモーメントを含む未編集のビデオを検索することを目的としている。
Intrinsic Temporal Adaptation (ITA) framework for PRVRを提案する。
提案手法は,PRVRベンチマーク上での最先端性能を実現する。
論文 参考訳(メタデータ) (2026-09-04T06:58:59Z) - RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding [55.75126327155788]
RIDGEはフレーム選択フレームワークであり、時間信号としてフレームクエリの類似性曲線を読み取る。
タイムラインを構造的なリージョンに分割し、固定予算の下でイベントコア、トランジション、ビルドアップ、アフターマス、コンテキストフレームを保存するために、リージョン固有の選択を適用する。
ほとんどの設定で最高のパフォーマンスを達成し、他の設定では競争力を維持します。
論文 参考訳(メタデータ) (2026-08-30T18:40:51Z) - One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding [43.953366792790625]
本稿では,再利用可能なスパースビデオインデックスを構築するトレーニングフリーフレームワークであるMatryoshka Evidence-to-Context (MEC) Frame Selectionを紹介する。
MECは、均一サンプリングよりも平均精度を3.77ポイント向上し、強い最先端セレクタにマッチし、エンドツーエンドの選択遅延を47.37-51.19%削減する。
論文 参考訳(メタデータ) (2026-08-06T07:47:15Z) - When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding [17.062781672214104]
低オーバーヘッドクエリ適応型視覚的エビデンススケジューリングのためのフレームワークであるEcoFrameを提案する。
Video-MME、LongVideoBench、MLVUの実験では、EcoFrameは複数のVLMバックボーン間で効率の良いトレードオフを実現する。
論文 参考訳(メタデータ) (2026-08-04T16:49:53Z) - Coverage-Driven Adaptive Keyframe Selection for Video Understanding [12.078063042214573]
そこで我々はCSESを提案する。CSESは学習不要なセマンティックセレクタで、スコアとセレクトのためのフレームの数を適応的に決定する。
CSESはフレームクエリの優位性を推定し、アクティブな取得を誘導し、各入力の時間的カバレッジを適応させる。
次に、意味的関連性、時間的冗長性、視覚的冗長性を共同で説明するカバレッジ問題として、選択の妥当性を定式化する。
論文 参考訳(メタデータ) (2026-08-01T15:24:06Z) - Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding [17.716106078756066]
ロングビデオ理解は、動画を小さなフレームや視覚トークンに圧縮して回答を生成するのが一般的である。
私たちのキーとなる考え方は、選択したフレームを生成前にクエリ関連クロスフレームエビデンスにまとめることです。
4つのベンチマークと2つのVideo-MLLMバックボーンで、GenEvAは一致したフレームのベースラインを一貫して改善している。
論文 参考訳(メタデータ) (2026-07-30T16:55:00Z) - QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding [78.36929439152566]
本稿では,長いビデオからコンパクトだが情報に富んだフレームを選択可能なクエリ・アンド・コンテント・アウェア(QCA)選択フレームワークを提案する。
QCAは最もクエリ関連性の高いフレームにアンカーし、クエリのセマンティックな関連性を維持しながら、多様性を最大化するために追加のフレームを反復的に組み込む。
我々の方法は追加のトレーニングを必要とせず、既存のVideo-LLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-07-01T14:19:24Z) - ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation [69.45329019089041]
マルチショットビデオ外挿(マルチショットビデオ外挿、Multi-Shot Video Extrapolation、MSVE)は、観察されたフレームまたはクリップを撮影的に構造化された一連のショットに拡張するタスクである。
MSVEは、長ビデオの障害は単にコンテキスト長の制限ではなく、コンテキスト割り当ての障害であることを明らかにした。
本稿では,再帰的コンテキスト割当(Recursive Context Allocation, ReCA)を提案する。
論文 参考訳(メタデータ) (2026-05-26T04:16:56Z) - ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting [17.594941754364484]
Video Large Language Models (VideoLLMs) は多様なマルチモーダルビデオタスクで高いパフォーマンスを実現している。
高精細ビデオフレーム処理の計算コストを低減するため,フレーム選択などの効率指向手法が広く採用されている。
本稿では、VPとKFM(Keyword-Frame Mapping)モジュールを組み合わせたトレーニングフリーフレームワークであるViKeyを紹介する。
論文 参考訳(メタデータ) (2026-03-24T13:32:52Z) - Adaptive Greedy Frame Selection for Long Video Understanding [11.923839324117674]
大規模視覚言語モデル(VLM)は、長ビデオ質問応答にますます応用されている。
推論は入力フレームの数と結果の視覚トークンによってボトルネックとなることが多い。
固定フレーム予算下でのクエリ関連性とセマンティックな表現性を協調的に最適化する問合せ適応型グレディフレーム選択法を提案する。
論文 参考訳(メタデータ) (2026-03-20T17:55:32Z) - An Empirical Study of Frame Selection for Text-to-Video Retrieval [62.28080029331507]
テキスト・ツー・ビデオ検索(TVR)は、クエリーテキストが与えられた大きなビデオギャラリーで最も関連性の高いビデオを見つけることを目的としている。
既存の方法は通常、TVRのビデオコンテンツを表すためにビデオ内のフレームのサブセットを選択する。
本稿では,TVRにおけるフレーム選択の実証的研究を行う。
論文 参考訳(メタデータ) (2023-11-01T05:03:48Z) - RIGID: Recurrent GAN Inversion and Editing of Real Face Videos [73.97520691413006]
GANのインバージョンは、実画像に強力な編集可能性を適用するのに不可欠である。
既存のビデオフレームを個別に反転させる手法は、時間の経過とともに望ましくない一貫性のない結果をもたらすことが多い。
我々は、textbfRecurrent vtextbfIdeo textbfGAN textbfInversion and etextbfDiting (RIGID) という統合されたリカレントフレームワークを提案する。
本フレームワークは,入力フレーム間の固有コヒーレンスをエンドツーエンドで学習する。
論文 参考訳(メタデータ) (2023-08-11T12:17:24Z) - Rethinking the Video Sampling and Reasoning Strategies for Temporal
Sentence Grounding [64.99924160432144]
時間的文グラウンドディング(TSG)は、特定のセグメントの時間的境界を文問合せによってビデオから識別することを目的としている。
本稿では,TSG のための新しいサイムズサンプリング・推論ネットワーク (SSRN) を提案し,シムズサンプリング機構を導入し,追加のコンテキストフレームを生成する。
論文 参考訳(メタデータ) (2023-01-02T03:38:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。