論文の概要: Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding
- arxiv url: http://arxiv.org/abs/2607.28516v1
- Date: Thu, 30 Jul 2026 16:55:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.681036
- Title: Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding
- Title(参考訳): フレーム選択を超えて: 長時間ビデオ理解のための生成的潜在証拠集約
- Abstract要約: ロングビデオ理解は、動画を小さなフレームや視覚トークンに圧縮して回答を生成するのが一般的である。
私たちのキーとなる考え方は、選択したフレームを生成前にクエリ関連クロスフレームエビデンスにまとめることです。
4つのベンチマークと2つのVideo-MLLMバックボーンで、GenEvAは一致したフレームのベースラインを一貫して改善している。
- 参考スコア(独自算出の注目度): 17.716106078756066
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-video understanding commonly compresses videos into a small set of frames or visual tokens for answer generation. Existing compact pipelines focus on retaining relevant visual content as explicit evidence. Yet making evidence available does not ensure that complementary cues across moments are integrated for answering. Our key idea is to organize selected frames into query-relevant cross-frame evidence before generation. We formulate this post-selection stage as a latent evidence interface and instantiate it with GenEvA ($\textbf{Gen}erative$ $Latent$ $\textbf{Ev}idence$ $\textbf{A}ggregation$), a distribution-guided latent evidence aggregation framework. Specifically, GenEvA uses a query-conditioned evidence distribution to focus aggregation on relevant frames, forming compact cross-frame latent evidence from their frame-specific information. Since cross-frame integration is not always needed, the same distribution determines whether to insert this latent complement. Across four benchmarks and two Video-MLLM backbones, GenEvA consistently improves matched-frame baselines. At 8 frames, it raises the four-benchmark LLaVA-Video average by $+5.2$ points and Qwen2.5-VL accuracy on LVBench by $+10.1$ points. These gains require only $0.11\%$--$0.40\%$ average video-token overhead; analyses further show task-aware allocation and benefits from Adaptive Evidence Invocation.
- Abstract(参考訳): ロングビデオ理解は、動画を小さなフレームや視覚トークンに圧縮して回答を生成するのが一般的である。
既存のコンパクトパイプラインは、関連する視覚的コンテンツを明確な証拠として保持することに重点を置いている。
しかし、証拠を入手することは、モーメント間の相補的な手がかりが解答のために統合されることを保証するものではない。
私たちのキーとなる考え方は、選択したフレームを生成前にクエリ関連クロスフレームエビデンスにまとめることです。
我々は、この選択後のステージを遅延エビデンスインターフェースとして定式化し、GenEvA ($\textbf{Gen}erative$ $Latent$ $\textbf{Ev}idence$ $\textbf{A}ggregation$でインスタンス化する。
具体的には、GenEvAはクエリ条件付きエビデンス分布を使用して、関連するフレームにアグリゲーションを集中させ、フレーム固有の情報からコンパクトなクロスフレーム潜在エビデンスを形成する。
クロスフレームの統合は必ずしも必要ではないため、同じディストリビューションが、この潜伏した補体を挿入するかどうかを決定する。
4つのベンチマークと2つのVideo-MLLMバックボーンで、GenEvAは一致したフレームのベースラインを一貫して改善している。
8フレームで、LLaVA-Videoの平均値が5.2ドル、LVBench上のQwen2.5-VLの精度が+10.1$ポイント上昇する。
これらのゲインは、平均的なビデオトーケンオーバーヘッドの0.11\%$-0.40\%しか必要とせず、分析により、タスク対応のアロケーションとAdaptive Evidence Invocationのメリットが示される。
関連論文リスト
- RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding [55.75126327155788]
RIDGEはフレーム選択フレームワークであり、時間信号としてフレームクエリの類似性曲線を読み取る。
タイムラインを構造的なリージョンに分割し、固定予算の下でイベントコア、トランジション、ビルドアップ、アフターマス、コンテキストフレームを保存するために、リージョン固有の選択を適用する。
ほとんどの設定で最高のパフォーマンスを達成し、他の設定では競争力を維持します。
論文 参考訳(メタデータ) (2026-08-30T18:40:51Z) - Stable Curves, Unstable Items: Item-Level Scaling Heterogeneity in Video LLMs [16.31176289941024]
ビデオLLMは、視覚的予算が大きくなるにつれて、スムーズに改善されるか、飽和していることを示す。
制御された視覚的予算の下で,各凍結モデルペアを応答軌道で表現する。
我々は、構成の相補性、有害な遷移、およびテキスト上書きの一致したグリッド測度を導出する。
論文 参考訳(メタデータ) (2026-08-07T09:25:20Z) - Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering [9.937860041147625]
長いビデオの質問に答えるには、制限された視覚的な予算の下でビデオからスパースで重要な証拠を特定する必要がある。
既存の方法は、単一のパスでクエリ対応フレームを選択するか、検索ガイダンスとしてタイムスタンプ付きテキストに頼るかのいずれかである。
本稿では,固定予算フレーム選択を共同エビデンスキュレーション問題として用いたトレーニングフリーフレームワークであるGCRを提案する。
論文 参考訳(メタデータ) (2026-08-03T03:50:22Z) - Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors [69.75895255395702]
MLLMの検証選択抽出層におけるクロスモーダルな注意は、自己回帰生成を必要とせずに、クエリ関連フレーム証拠を既に提供している。
2Bパラメータしか持たない軽量MLLMセレクタは、クエリ条件アグリゲーションにより、選択した層注目値を関連スコアに変換することにより、フレームレベルのエビデンスを抽出することができる。
32フレームの予算下では,ビデオMMEで最大6.4ポイントの均一サンプリングを改良し,フレーム予算の一致したトレーニングベースセレクタよりも優れていた。
論文 参考訳(メタデータ) (2026-07-17T07:04:31Z) - QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding [78.36929439152566]
本稿では,長いビデオからコンパクトだが情報に富んだフレームを選択可能なクエリ・アンド・コンテント・アウェア(QCA)選択フレームワークを提案する。
QCAは最もクエリ関連性の高いフレームにアンカーし、クエリのセマンティックな関連性を維持しながら、多様性を最大化するために追加のフレームを反復的に組み込む。
我々の方法は追加のトレーニングを必要とせず、既存のVideo-LLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-07-01T14:19:24Z) - GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs [3.9266376632068485]
GridProbeは、効率的なトレーニング不要な後処理推論パラダイムである。
解答空間における証拠は、凍結したVLM自身の推論を用いて得られる。
疑似関連フレームを適応的に選択し、精度の損失が少なくて、準四分法的な注意コストをもたらす。
論文 参考訳(メタデータ) (2026-05-11T15:57:46Z) - Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions [75.23170605943457]
textbfmodelは、メモリ統合から推論制御を分離するフレームワークである。
emphActive Thinking Decision Maker (ATDM)は、決定プロセスの外部化を行う透明な推論コントローラである。
emphHierarchical Progressive Semantic Integration (HPSI)モジュールは効率的なメモリシステムとして機能する。
論文 参考訳(メタデータ) (2026-04-20T16:15:33Z) - Adaptive Greedy Frame Selection for Long Video Understanding [11.923839324117674]
大規模視覚言語モデル(VLM)は、長ビデオ質問応答にますます応用されている。
推論は入力フレームの数と結果の視覚トークンによってボトルネックとなることが多い。
固定フレーム予算下でのクエリ関連性とセマンティックな表現性を協調的に最適化する問合せ適応型グレディフレーム選択法を提案する。
論文 参考訳(メタデータ) (2026-03-20T17:55:32Z) - Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding [16.537148896706036]
Video Temporal Grounding (VTG)は、クエリ関連モーメントの時間的境界を、長い、トリミングされていないビデオでローカライズする。
本稿では,セマンティックな役割を持つコンパクトだがコヒーレントなトークンサブセットを構成する,トレーニング不要なプルーニングフレームワークSemVIDを提案する。
論文 参考訳(メタデータ) (2026-03-05T20:25:32Z) - Event-Anchored Frame Selection for Effective Long-Video Understanding [67.56884568828508]
Event-Anchored Frame Selection (EFS)は階層的なイベント認識パイプラインである。
トレーニング不要のプラグイン・アンド・プレイモジュールとして、EFSは既製のLVLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-03-01T08:25:37Z) - HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering [13.370338205427911]
HERBenchはビデオQAのベンチマークで、時間をかけてマルチエビデンス統合を評価する。
HERBenchは、12の合成タスクで構成された26Kの5方向の多重選択質問で構成されている。
我々は、HERBenchが以前のデータセットよりもかなり高い需要を課していることを示す。
論文 参考訳(メタデータ) (2025-12-16T19:34:47Z) - Single-Stage Visual Query Localization in Egocentric Videos [79.71065005161566]
エンドツーエンドのトレーニングが可能なシングルステージのVQLフレームワークを提案する。
我々は,クエリとビデオフレーム間の問合せ対応を考慮し,問合せとビデオの関係を確立する。
実験により,提案手法の精度は従来のVQL手法よりも20%向上し,推論速度は10倍向上した。
論文 参考訳(メタデータ) (2023-06-15T17:57:28Z) - Correspondence Matters for Video Referring Expression Comprehension [64.60046797561455]
ビデオ参照表現(REC)は、文章に記述された参照オブジェクトをビデオフレーム内の視覚領域にローカライズすることを目的としている。
既存の手法では,1)ビデオフレーム間の非一貫性な局所化結果,2)参照オブジェクトとコンテキストオブジェクトの混同という2つの問題に悩まされている。
本稿では、フレーム間およびクロスモーダルの両方で密接な関連性を明確に強化する新しいデュアル対応ネットワーク(DCNet)を提案する。
論文 参考訳(メタデータ) (2022-07-21T10:31:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。