論文の概要: HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
- arxiv url: http://arxiv.org/abs/2603.18850v1
- Date: Thu, 19 Mar 2026 12:53:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.147921
- Title: HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
- Title(参考訳): HORNet:視覚言語モデルを用いたビデオ質問応答のためのタスクガイドフレーム選択
- Authors: Xiangyu Bai, Bishoy Galoaa, Sarah Ostadabbas,
- Abstract要約: HorNetは入力フレームを最大99%、VLM処理時間を最大93%削減する。
我々はこれを、VLM推論から視覚入力を分離するタスクであるSelect Any Frames (SAF) として定式化する。
HorNetのポリシーは、再訓練せずにVLM応答器をまたいで転送し、より強力なモデルと組み合わせると8.5%の相対的な利得が得られる。
- 参考スコア(独自算出の注目度): 6.358055069130984
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Video question answering (VQA) with vision-language models (VLMs) depends critically on which frames are selected from the input video, yet most systems rely on uniform or heuristic sampling that cannot be optimized for downstream answering quality. We introduce \textbf{HORNet}, a lightweight frame selection policy trained with Group Relative Policy Optimization (GRPO) to learn which frames a frozen VLM needs to answer questions correctly. With fewer than 1M trainable parameters, HORNet reduces input frames by up to 99\% and VLM processing time by up to 93\%, while improving answer quality on short-form benchmarks (+1.7\% F1 on MSVD-QA) and achieving strong performance on temporal reasoning tasks (+7.3 points over uniform sampling on NExT-QA). We formalize this as Select Any Frames (SAF), a task that decouples visual input curation from VLM reasoning, and show that GRPO-trained selection generalizes better out-of-distribution than supervised and PPO alternatives. HORNet's policy further transfers across VLM answerers without retraining, yielding an additional 8.5\% relative gain when paired with a stronger model. Evaluated across six benchmarks spanning 341,877 QA pairs and 114.2 hours of video, our results demonstrate that optimizing \emph{what} a VLM sees is a practical and complementary alternative to optimizing what it generates while improving efficiency. Code is available at https://github.com/ostadabbas/HORNet.
- Abstract(参考訳): 映像質問応答(VQA)と視覚言語モデル(VLM)は、どのフレームが入力ビデオから選択されるかに批判的に依存するが、ほとんどのシステムは下流の応答品質に最適化できない均一またはヒューリスティックなサンプリングに依存している。
我々は,グループ相対政策最適化(GRPO)で訓練された軽量フレーム選択ポリシーである‘textbf{HORNet} を導入し,凍結したVLMのどのフレームを正確に解答する必要があるかを学習する。
1M未満のトレーニング可能なパラメータで、HORNetは入力フレームを最大99\%、VLM処理時間を最大93\%削減し、ショートフォームベンチマーク(MSVD-QAでは+1.7\% F1)の回答品質を改善し、時間的推論タスク(NExT-QAでは一様サンプリングで+7.3ポイント)で強いパフォーマンスを達成する。
我々はこれを、VLM推論から視覚入力キュレーションを分離するタスクであるSelect Any Frames (SAF) として形式化し、GRPO学習した選択が、教師付きやPPOの代替よりも、より良いアウト・オブ・ディストリビューションを一般化することを示す。
HORNetのポリシーは、再訓練せずにVLM応答器をまたいで転送し、より強いモデルと組み合わせると8.5\%の相対的な利得が得られる。
341,877対のQAペアと114.2時間のビデオにまたがる6つのベンチマークで評価した結果、VLMが見ている「emph{what}」の最適化は、効率を改善しながら生成するものを最適化する実用的な代替手段であることが示された。
コードはhttps://github.com/ostadabbas/HORNet.comで入手できる。
関連論文リスト
- Event-Anchored Frame Selection for Effective Long-Video Understanding [67.56884568828508]
Event-Anchored Frame Selection (EFS)は階層的なイベント認識パイプラインである。
トレーニング不要のプラグイン・アンド・プレイモジュールとして、EFSは既製のLVLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-03-01T08:25:37Z) - VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding [9.415923244280542]
VideoBrainは、Vision-Language Modelsが学習したサンプリングポリシーを通じて視覚情報を適応的に取得することを可能にするエンドツーエンドフレームワークである。
提案手法は,ビデオ間の意味検索を行うCLIPエージェントと,時間間隔内での高密度サンプリングを行うUniformエージェントの2つの補完エージェントを特徴とする。
論文 参考訳(メタデータ) (2026-02-04T00:08:35Z) - Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames [70.93346841539626]
本稿では,ビデオ質問応答のための推論戦略である思考の時間的連鎖について述べる。
VLM自体を使用して、ビデオから最も関連性の高いフレームを反復的に識別し、抽出する。
推論時により多くの計算を利用すれば、最も関連性の高いコンテキストを選択することで、精度が向上することを示す。
論文 参考訳(メタデータ) (2025-07-01T18:39:26Z) - BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding [51.49345400300556]
大規模ビデオ言語モデル (VLM) は様々なビデオ理解タスクにおいて有望な進歩を示した。
均一なフレームサンプリングのような伝統的なアプローチは、必然的に無関係なコンテンツにリソースを割り当てる。
本稿では,フレーム選択戦略の総合的研究を通じて,付加的なトレーニングを伴わずに大規模VLMをブーストする方法であるBOLTを紹介する。
論文 参考訳(メタデータ) (2025-03-27T13:18:40Z) - Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA [40.21221568678641]
広い時間間隔にまたがるロングフォームビデオは、非常に冗長な情報である。
正しい応答を生成するために必要な全ての情報は、しばしばフレームの小さなサブセットに含まれる。
近年の文献では、LVQAベンチマークにおける大きな言語モデルの使用を探求し、例外的な性能を達成している。
論文 参考訳(メタデータ) (2024-06-13T17:59:16Z) - Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models
with Zero Training [82.30343537942608]
ゼロショットVQAのためのモジュラーフレームワークであるPlug-and-Play VQA(PNP-VQA)を提案する。
まず質問誘導画像キャプションを生成し,そのキャプションを質問応答のコンテキストとしてPLMに渡す。
PNP-VQAはゼロショットVQAv2およびGQAの最先端結果を達成する。
論文 参考訳(メタデータ) (2022-10-17T06:29:54Z) - FAST-VQA: Efficient End-to-end Video Quality Assessment with Fragment
Sampling [54.31355080688127]
現在のDeep Video Quality Assessment (VQA) 法は通常、高解像度ビデオを評価する際に高い計算コストがかかる。
そこで我々はGrid Mini-patch Smpling (GMS)を提案する。
フラグメント・アテンション・ネットワーク(FANet)は,フラグメントを入力として扱うように設計されている。
FAST-VQAは1080P高解像度ビデオで99.5%のFLOPを削減し、最先端の精度を約10%向上させる。
論文 参考訳(メタデータ) (2022-07-06T11:11:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。