論文の概要: QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding
- arxiv url: http://arxiv.org/abs/2607.00983v1
- Date: Wed, 01 Jul 2026 14:19:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.932001
- Title: QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding
- Title(参考訳): QCA:長いビデオ理解のためのクエリとコンテンツ対応のキーフレーム選択
- Authors: Jun Peng, Baiyang Song, Jie Li, Hui Li, Yiyi Zhou, Rongrong Ji, Yonghong Tian,
- Abstract要約: 本稿では,長いビデオからコンパクトだが情報に富んだフレームを選択可能なクエリ・アンド・コンテント・アウェア(QCA)選択フレームワークを提案する。
QCAは最もクエリ関連性の高いフレームにアンカーし、クエリのセマンティックな関連性を維持しながら、多様性を最大化するために追加のフレームを反復的に組み込む。
我々の方法は追加のトレーニングを必要とせず、既存のVideo-LLMにシームレスに統合できる。
- 参考スコア(独自算出の注目度): 78.36929439152566
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video understanding is often plagued by severe temporal redundancy, where processing dense frame sequences is both semantically inefficient and computationally expensive. This challenge is further amplified when only a small subset of frames is truly relevant to the given query. In this paper, we propose a Query- and Content-Aware (QCA) keyframe selection framework that can select a compact yet information-rich set of frames from long videos. QCA first partitions the video into temporal segments and estimates the information contribution of each segment by jointly modeling query relevance and content deviation, and dynamically allocates keyframe budget to each segment. Within each segment, QCA anchors on the most query-relevant frame and iteratively incorporates additional frames to maximize diversity while maintaining high semantic relevance to the query. Crucially, our method requires no additional training and can be seamlessly integrated into existing Video-LLMs. Extensive experiments across multiple long video understanding benchmarks demonstrate that our proposed approach achieves state-of-the-art performance and has strong generalization ability. For instance, QCA achieves 67.8\% on LongVideoBench using 128 frames, while GPT-4o achieves 66.7\% using 256 frames. Our codes are available in \href{https://github.com/hktk07/QCA}{GitHub}.
- Abstract(参考訳): ビデオ理解は重度の時間的冗長性に悩まされることが多く、複雑なフレームシーケンスの処理は意味的に非効率で計算コストが高い。
この問題は、フレームの小さなサブセットだけが与えられたクエリに本当に関係している場合にさらに増幅される。
本稿では,QCA(Query- and Content-Aware)キーフレーム選択フレームワークを提案する。
QCAは、まずビデオを時間セグメントに分割し、クエリ関連性とコンテンツ偏差を併用して各セグメントの情報コントリビューションを推定し、各セグメントにキーフレーム予算を動的に割り当てる。
各セグメント内で、QCAは最もクエリ関連性の高いフレームにアンカーし、クエリのセマンティックな関連性を維持しながら、多様性を最大化するために追加のフレームを反復的に組み込む。
重要なことは、我々の方法は追加のトレーニングを必要とせず、既存のVideo-LLMにシームレスに統合することができる。
複数の長大なビデオ理解ベンチマークによる大規模な実験により,提案手法が最先端の性能を達成し,強力な一般化能力を有することを示す。
例えば、QCAは128フレームでLongVideoBenchで67.8\%、GPT-4oは256フレームで66.7\%を達成する。
私たちのコードは \href{https://github.com/hktk07/QCA}{GitHub} で利用可能です。
関連論文リスト
- Event-Anchored Frame Selection for Effective Long-Video Understanding [67.56884568828508]
Event-Anchored Frame Selection (EFS)は階層的なイベント認識パイプラインである。
トレーニング不要のプラグイン・アンド・プレイモジュールとして、EFSは既製のLVLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-03-01T08:25:37Z) - Improving Video Question Answering through query-based frame selection [15.416301612152004]
Video Question Answering (VideoQA) モデルは、視聴覚コンテンツに対する理解とインタラクションを強化する。
重い計算要求のため、ビデオQAのほとんどの大きなビジュアル言語モデル(VLM)は、動画を一様にサンプリングすることで固定数のフレームに依存している。
本稿では,サブモジュール相互情報(SMI)関数に基づいて,質問に関連のある新しい問合せベースのフレーム選択を提案する。
論文 参考訳(メタデータ) (2026-01-12T12:10:20Z) - Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs [13.306662159600677]
適応型フレーム選択とマルチテンポラリスケーリングのための新しいアプローチであるビデオQFrameを紹介する。
Q-Frameは、CLIPのようなテキスト画像マッチングネットワークによって生成されたトレーニング不要のプラグイン・アンド・プレイ戦略を採用している。
ベンチマークデータセットの広範な実験を通じて,Q-Frameの有効性を実証する。
論文 参考訳(メタデータ) (2025-06-27T11:30:51Z) - VidCtx: Context-aware Video Question Answering with Image Models [15.1350316858766]
VidCtxは、入力フレームからの視覚情報と他のフレームのテキスト記述の両方を統合する、新しいトレーニング不要なビデオQAフレームワークである。
実験により、VidCtxはオープンモデルに依存するアプローチ間の競争性能を達成することが示された。
論文 参考訳(メタデータ) (2024-12-23T09:26:38Z) - MHSCNet: A Multimodal Hierarchical Shot-aware Convolutional Network for
Video Summarization [61.69587867308656]
本稿では,MHSCNetと呼ばれるマルチモーダル階層型ショット・アウェア・畳み込みネットワークを提案する。
学習したショット認識表現に基づいて、MHSCNetは、ビデオのローカルおよびグローバルビューにおけるフレームレベルの重要度スコアを予測することができる。
論文 参考訳(メタデータ) (2022-04-18T14:53:33Z) - Temporal Context Aggregation for Video Retrieval with Contrastive
Learning [81.12514007044456]
フレームレベルの特徴間の時間的長距離情報を組み込んだビデオ表現学習フレームワークTCAを提案する。
提案手法は,映像レベルの特徴を持つ最先端の手法に対して,FIVR-200Kでは17% mAPの大幅な性能上の優位性を示す。
論文 参考訳(メタデータ) (2020-08-04T05:24:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。