論文の概要: Coverage-Driven Adaptive Keyframe Selection for Video Understanding
- arxiv url: http://arxiv.org/abs/2608.00714v1
- Date: Sat, 01 Aug 2026 15:24:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.874415
- Title: Coverage-Driven Adaptive Keyframe Selection for Video Understanding
- Title(参考訳): 映像理解のためのカバレッジ駆動型適応キーフレーム選択
- Authors: Junyang Zhang, Puhan Luo, Chen Tang, Yuxi Shi, Xiang-Yang Li,
- Abstract要約: そこで我々はCSESを提案する。CSESは学習不要なセマンティックセレクタで、スコアとセレクトのためのフレームの数を適応的に決定する。
CSESはフレームクエリの優位性を推定し、アクティブな取得を誘導し、各入力の時間的カバレッジを適応させる。
次に、意味的関連性、時間的冗長性、視覚的冗長性を共同で説明するカバレッジ問題として、選択の妥当性を定式化する。
- 参考スコア(独自算出の注目度): 12.078063042214573
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent advances in large vision-language models (LVLMs) have enabled long-video understanding and analysis. However, processing the large number of frames in a video incurs substantial computational overhead. Existing methods reduce LVLM inference costs by scoring frame-query relevance before inference and selecting keyframes accordingly. Nevertheless, the distribution of relevant frames varies across queries, and these methods often need to score hundreds or thousands of frames. To address this limitation, we propose CSES, a training-free semantic keyframe selector that adaptively determines the numbers of frames to score and keyframes to select. CSES estimates the prominence of the frame-query relevance profile to guide active acquisition and adapt the temporal coverage of each input. It then formulates keyframe selection as a coverage problem that jointly accounts for semantic relevance, temporal redundancy, and visual redundancy. Active acquisition and keyframe selection terminate based on coverage saturation. The selection objective is monotone and submodular, enabling greedy optimization with a standard approximation guarantee. Experiments with four LVLMs on two benchmarks show that our method preserves accuracy while scoring $4$-$13\times$ fewer frames and selecting $18.4\%$-$20.5\%$ fewer input keyframes than existing baselines. CSES further achieves a $3.1$-$5.4\times$ speedup in frame selection over baselines.
- Abstract(参考訳): 大規模視覚言語モデル(LVLM)の最近の進歩により、長いビデオ理解と分析が可能になった。
しかし、ビデオ内の大量のフレームを処理すると、かなりの計算オーバーヘッドが発生する。
既存の手法では、推定前のフレームクエリの関連性を評価し、それに応じてキーフレームを選択することで、LVLM推論コストを削減する。
それでも、関連するフレームの分布はクエリによって異なり、これらのメソッドは数百から数千のフレームをスコアする必要があることが多い。
この制限に対処するために,CSESを提案する。CSESは,スコアするフレーム数と選択するキーフレーム数を適応的に決定する,トレーニング不要なセマンティック・キーフレームセレクタである。
CSESは、フレームクエリ関連プロファイルの優位性を推定し、アクティブな取得を誘導し、各入力の時間的カバレッジを適応させる。
次に、キーフレームの選択を、意味的関連性、時間的冗長性、視覚的冗長性を共同で説明するカバレッジ問題として定式化する。
アクティブな取得とキーフレームの選択は、カバレッジ飽和に基づいて終了する。
選択目標はモノトーンとサブモジュラーであり、標準近似保証によるグリーディ最適化を可能にする。
2つのベンチマークで4つのLVLMを用いて実験したところ、我々の手法は4-$13\times$より少ないフレームと18.4\%$-$20.5\%$既存のベースラインよりも少ない入力キーフレームを選択しながら精度を保っていることがわかった。
CSESはさらに3.1$-5.4\times$ speedup in frame selection over baselinesを達成している。
関連論文リスト
- Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors [69.75895255395702]
MLLMの検証選択抽出層におけるクロスモーダルな注意は、自己回帰生成を必要とせずに、クエリ関連フレーム証拠を既に提供している。
2Bパラメータしか持たない軽量MLLMセレクタは、クエリ条件アグリゲーションにより、選択した層注目値を関連スコアに変換することにより、フレームレベルのエビデンスを抽出することができる。
32フレームの予算下では,ビデオMMEで最大6.4ポイントの均一サンプリングを改良し,フレーム予算の一致したトレーニングベースセレクタよりも優れていた。
論文 参考訳(メタデータ) (2026-07-17T07:04:31Z) - QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding [78.36929439152566]
本稿では,長いビデオからコンパクトだが情報に富んだフレームを選択可能なクエリ・アンド・コンテント・アウェア(QCA)選択フレームワークを提案する。
QCAは最もクエリ関連性の高いフレームにアンカーし、クエリのセマンティックな関連性を維持しながら、多様性を最大化するために追加のフレームを反復的に組み込む。
我々の方法は追加のトレーニングを必要とせず、既存のVideo-LLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-07-01T14:19:24Z) - GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding [63.62445065977448]
GIFT: Global Irreplaceability Frame Targetingはトレーニング不要のフレームワークで、固有の非配置性を評価してフレームを選択する。
GIFTは,LLaVA-Video-7Bの長文ビデオベンチマークにおいて,一様サンプリングに比べて最大12.5%向上したことを示す。
論文 参考訳(メタデータ) (2026-03-26T06:21:41Z) - Adaptive Greedy Frame Selection for Long Video Understanding [11.923839324117674]
大規模視覚言語モデル(VLM)は、長ビデオ質問応答にますます応用されている。
推論は入力フレームの数と結果の視覚トークンによってボトルネックとなることが多い。
固定フレーム予算下でのクエリ関連性とセマンティックな表現性を協調的に最適化する問合せ適応型グレディフレーム選択法を提案する。
論文 参考訳(メタデータ) (2026-03-20T17:55:32Z) - FOCUS: Efficient Keyframe Selection for Long Video Understanding [26.44459739499484]
マルチモーダル大言語モデル(LMLM)は画像とビデオフレームを視覚トークンとして表現する。
FOCUS(Frame-Optimistic Confidence Upbound Selection)は、厳格なトークン予算の下でフレームを選択するモデルに依存しない選択モジュールである。
20分以上のビデオでは、LongVideoBenchingベンチマークで11.9%の精度向上を達成した。
論文 参考訳(メタデータ) (2025-10-31T08:41:13Z) - K-frames: Scene-Driven Any-k Keyframe Selection for long video understanding [38.06179287702453]
Kフレームは、時間的連続性を保存するシーン駆動の選択のための新しいパラダイムである。
個々のフレームを選択する代わりに、Kフレームは意味的に一貫性のあるクエリ関連クリップを予測する。
Kフレームは、様々なスケールで選択するための効果的な、解釈可能な、プラグアンドプレイソリューションを提供する。
論文 参考訳(メタデータ) (2025-10-14T06:23:22Z) - A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering [15.220013605396396]
A.I.R.はAdaptive, Iterative, Reasoningベースのフレーム選択のためのトレーニング不要のアプローチである。
我々は、複雑なクエリに対して深い意味解析を行うために、強力な視覚言語モデル(VLM)を活用している。
提案手法は基礎VLMの性能を大幅に向上させ,計算効率を大幅に向上させる。
論文 参考訳(メタデータ) (2025-10-06T01:51:13Z) - ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding [52.050036778325094]
ReFoCUS(Reinforcement-guided Frame Optimization for Contextual UnderStanding)は、新しいフレームレベルのポリシー最適化フレームワークである。
ReFoCUSは、参照LMMから派生した報酬信号を用いて、フレームに対するモデル固有の嗜好を反映して、強化学習を通じてフレーム選択ポリシーを学習する。
提案手法は複数のビデオQAベンチマークにおける推論性能を継続的に改善する。
論文 参考訳(メタデータ) (2025-06-02T03:08:07Z) - Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders [62.58375366359421]
長いビデオ理解のためのマルチモーダル大言語モデル(MLLM)は依然として難しい問題である。
伝統的な一様サンプリングは、無関係な内容の選択につながる。
数千フレームの訓練後のMLLMは、かなりの計算負担を課す。
本研究では,物語付きスレッディング(Nar-KFC)を提案する。
論文 参考訳(メタデータ) (2025-05-30T03:04:28Z) - Adaptive Keyframe Sampling for Long Video Understanding [75.7837692594814]
本稿では、適応鍵フレームサンプリング(AKS)という、単純だが効果的なアルゴリズムを提案する。
これはAdaptive Keyframe Sampling (AKS)と呼ばれるプラグインとプレイモジュールを挿入し、ビデオトークンの固定数で有用な情報を最大化することを目的としている。
2つの長いビデオ理解ベンチマークの実験は、AKSが情報的出会いを選択する際にビデオQA精度を改善することを検証する。
論文 参考訳(メタデータ) (2025-02-28T17:46:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。