論文の概要: ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting
- arxiv url: http://arxiv.org/abs/2603.23186v1
- Date: Tue, 24 Mar 2026 13:32:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.497723
- Title: ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting
- Title(参考訳): ViKey: ビデオの時間的理解を視覚的プロンプトで強化する
- Authors: Yeonkyung Lee, Dayun Ju, Youngmin Kim, Seil Kang, Seong Jae Hwang,
- Abstract要約: Video Large Language Models (VideoLLMs) は多様なマルチモーダルビデオタスクで高いパフォーマンスを実現している。
高精細ビデオフレーム処理の計算コストを低減するため,フレーム選択などの効率指向手法が広く採用されている。
本稿では、VPとKFM(Keyword-Frame Mapping)モジュールを組み合わせたトレーニングフリーフレームワークであるViKeyを紹介する。
- 参考スコア(独自算出の注目度): 17.594941754364484
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advancements in Video Large Language Models (VideoLLMs) have enabled strong performance across diverse multimodal video tasks. To reduce the high computational cost of processing dense video frames, efficiency-oriented methods such as frame selection have been widely adopted. While effective at minimizing redundancy, these methods often cause notable performance drops on tasks requiring temporal reasoning. Unlike humans, who can infer event progression from sparse visual cues, VideoLLMs frequently misinterpret temporal relations when intermediate frames are omitted. To address this limitation, we explore visual prompting (VP) as a lightweight yet effective way to enhance temporal understanding in VideoLLMs. Our analysis reveals that simply annotating each frame with explicit ordinal information helps the model perceive temporal continuity. This visual cue also supports frame-level referencing and mitigates positional ambiguity within a sparsely sampled sequence. Building on these insights, we introduce ViKey, a training-free framework that combines VP with a lightweight Keyword-Frame Mapping (KFM) module. KFM leverages frame indices as dictionary-like keys to link textual cues to the most relevant frames, providing explicit temporal anchors during inference. Despite its simplicity, our approach substantially improves temporal reasoning and, on some datasets, preserves dense-frame baseline performance with as few as 20% of frames.
- Abstract(参考訳): ビデオ言語モデル(VideoLLM)の最近の進歩は、多様なマルチモーダルビデオタスクにおいて、強力なパフォーマンスを実現している。
高精細ビデオフレーム処理の計算コストを低減するため,フレーム選択などの効率指向手法が広く採用されている。
冗長性の最小化には有効であるが、これらの手法は時間的推論を必要とするタスクに対して顕著なパフォーマンス低下を引き起こすことが多い。
微妙な視覚的手がかりから出来事の進行を推測できる人間とは異なり、ビデオLLMは中間フレームが省略されたときに時間的関係をしばしば誤解する。
この制限に対処するために、ビデオLLMにおける時間的理解を高めるために、視覚的プロンプト(VP)を軽量かつ効果的な方法として検討する。
分析の結果,各フレームに明示的な順序情報で注釈を付けるだけで,時間的連続性を知覚できることがわかった。
このビジュアルキューはフレームレベルの参照をサポートし、スパースサンプリングシーケンス内の位置のあいまいさを緩和する。
これらの知見に基づいて,VPとKFM(Keyword-Frame Mapping)モジュールを組み合わせたトレーニングフリーフレームワークであるViKeyを紹介した。
KFMは、フレームインデックスを辞書のようなキーとして利用し、テキストキューを最も関連性の高いフレームにリンクし、推論中に明確な時間アンカーを提供する。
その単純さにもかかわらず、我々のアプローチは時間的推論を大幅に改善し、いくつかのデータセットでは、20%のフレームしか持たない高密度フレームのベースライン性能を維持している。
関連論文リスト
- From Captions to Keyframes: KeyScore for Multimodal Frame Scoring and Video-Language Understanding [1.3856027745141806]
KeyScoreは、キャプションと意味的類似性、時間的代表性、文脈的ドロップインパクトを組み合わせたキャプション対応のフレームスコアリング手法である。
提案手法は効率と性能を両立させ,拡張性とキャプションによる映像理解を可能にする。
論文 参考訳(メタデータ) (2025-10-07T23:02:27Z) - Episodic Memory Representation for Long-form Video Understanding [52.33907540905242]
大きなビデオ言語モデルは、一般的なビデオ理解において優れているが、長い形式のコンテキストウィンドウの制限に苦労する。
人間の記憶の原理にインスパイアされたトレーニングフリーのフレームワークであるVideo-EMを紹介する。
Video-EMでは、各ベースラインに対して4-9%のパフォーマンス向上を実現し、フレームの削減を実現している。
論文 参考訳(メタデータ) (2025-08-13T04:33:07Z) - KFFocus: Highlighting Keyframes for Enhanced Video Understanding [33.69757683688046]
KFFocusは,ビデオトークンを効率よく圧縮し,映像フレーム内に存在する情報的コンテキストを強調する手法である。
KFFocusは、コンテキスト関連性に基づいてフレームに様々な凝縮率を割り当てることで、情報コンテンツの詳細を保存しつつ、トークンの冗長性を効率的に低減する。
また,ビデオフレーム間の時間的関係と各フレーム内の空間構造をエンコードするマルチモーダルモデリングモジュールを導入する。
論文 参考訳(メタデータ) (2025-08-12T14:57:03Z) - Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration [24.337139909108117]
過剰なフレームが文脈の希釈によってパラドックス的に性能を低下させる「レスはそれ以上」現象である。
視覚エコー」は「視覚エコー」という時間的冗長性を有する
AFP"は、ResNet-50とCLIPの機能空間に適応的な階層的クラスタリングアルゴリズムを用いて、これらのエコーを単一の代表に識別し、マージする。
我々の完全なアプローチは、必要なフレームを86.9%まで、合計入力トークンを83.2%まで劇的に削減することを示しています。
論文 参考訳(メタデータ) (2025-08-05T11:31:55Z) - Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders [62.58375366359421]
長いビデオ理解のためのマルチモーダル大言語モデル(MLLM)は依然として難しい問題である。
伝統的な一様サンプリングは、無関係な内容の選択につながる。
数千フレームの訓練後のMLLMは、かなりの計算負担を課す。
本研究では,物語付きスレッディング(Nar-KFC)を提案する。
論文 参考訳(メタデータ) (2025-05-30T03:04:28Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。