論文の概要: Intrinsic Temporal Adaptation of CLIP for Partially Relevant Video Retrieval
- arxiv url: http://arxiv.org/abs/2609.04800v1
- Date: Fri, 04 Sep 2026 06:58:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.938627
- Title: Intrinsic Temporal Adaptation of CLIP for Partially Relevant Video Retrieval
- Title(参考訳): 部分関連ビデオ検索のためのCLIPの内在的時間適応
- Abstract要約: PRVRは、テキストクエリに関連するモーメントを含む未編集のビデオを検索することを目的としている。
Intrinsic Temporal Adaptation (ITA) framework for PRVRを提案する。
提案手法は,PRVRベンチマーク上での最先端性能を実現する。
- 参考スコア(独自算出の注目度): 40.983482307220676
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Partially Relevant Video Retrieval (PRVR) aims to retrieve untrimmed videos that contain moments relevant to a text query. Since the target moment occupies only a portion of the video, PRVR requires retrieval based on fine-grained understanding beyond coarse video-level matching. However, existing methods often rely on frozen CLIP frame features, which lack temporal understanding. Even with recent progress in parameter-efficient CLIP adaptation, video-level predictions can still be supported by imprecise frame-level evidence. In this paper, we propose an Intrinsic Temporal Adaptation (ITA) framework for PRVR. First, our Backbone-Internal Temporal Adaptation allows the last few visual transformer layers to attend over groups of neighboring frames. This provides temporally aware frame embeddings while keeping CLIP frozen and training only adaptation parameters. Second, we introduce Affinity-Weighted Gradient Propagation to address the weakly supervised nature of PRVR, softly aggregating top-$k$ frames based on text-frame affinities and propagating learning signals to multiple query-relevant frames. Our method achieves state-of-the-art performance on PRVR benchmarks, demonstrates robust cross-dataset transfer, and retrieves substantially more accurate frame-level evidence within ground-truth query-relevant moments. Our code is available at github.com/hynnsk/ITA.
- Abstract(参考訳): 部分関連ビデオ検索(PRVR)は、テキストクエリに関連するモーメントを含む未トリムビデオの検索を目的としている。
ターゲットモーメントはビデオの一部しか占有しないため、PRVRは粗いビデオレベルのマッチング以外の細かい理解に基づいて検索する必要がある。
しかし、既存のメソッドはしばしば凍結したCLIPフレーム機能に依存しており、時間的理解が欠如している。
パラメータ効率のCLIP適応の最近の進歩にもかかわらず、ビデオレベルの予測は不正確なフレームレベルのエビデンスによってサポートできる。
本稿では,PRVRのための固有時間適応(ITA)フレームワークを提案する。
第一に、我々のバックボーン・インターナル・テンポラル・アダプティブ(英語版)は、最後の数枚のビジュアル・トランスフォーマー層が隣接するフレームの群に付随することを可能にする。
これは、CLIPを凍結させ、適応パラメータのみをトレーニングしながら、時間的に認識されたフレーム埋め込みを提供する。
第2に、PRVRの弱教師付き性質に対処し、テキストフレーム親和性に基づいて上位$kのフレームをソフトに集約し、学習信号を複数のクエリ関連フレームに伝播するAffinity-Weighted Gradient Propagationを導入する。
提案手法は,PRVRベンチマーク上での最先端性能を実現し,ロバストなクロスデータセット転送を実証し,より正確なフレームレベルのエビデンスを検索する。
私たちのコードはgithub.com/hynnsk/ITAで利用可能です。
関連論文リスト
- TAME: Temporal-Aware Mixture-of-Experts for Text-Video Retrieval [1.4874449172133888]
Text-Video Retrieval (TVR)は、自然言語クエリにマッチしたビデオを取得する。
TVRは時間モデリングの欠如によって制限されている。
テキストビデオ検索(TAME)のためのテンポラル・アウェア・ミックス・オブ・エクササイズを提案する。
論文 参考訳(メタデータ) (2026-09-02T07:12:50Z) - RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding [55.75126327155788]
RIDGEはフレーム選択フレームワークであり、時間信号としてフレームクエリの類似性曲線を読み取る。
タイムラインを構造的なリージョンに分割し、固定予算の下でイベントコア、トランジション、ビルドアップ、アフターマス、コンテキストフレームを保存するために、リージョン固有の選択を適用する。
ほとんどの設定で最高のパフォーマンスを達成し、他の設定では競争力を維持します。
論文 参考訳(メタデータ) (2026-08-30T18:40:51Z) - Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs [81.04673240949074]
強化学習は、大規模言語モデルの推論能力を改善した。
結果のみの報酬をビデオマルチモーダルな大規模言語モデルに適用することは、どの視覚的証拠が答えを支持するべきかを限定的なガイダンスを提供する。
本稿では,エビデンス対応ビデオ推論のための時間アノテーションフリープロセスレベル報酬フレームワークであるConsensus Frame GRPOを紹介する。
論文 参考訳(メタデータ) (2026-06-16T19:42:54Z) - ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting [17.594941754364484]
Video Large Language Models (VideoLLMs) は多様なマルチモーダルビデオタスクで高いパフォーマンスを実現している。
高精細ビデオフレーム処理の計算コストを低減するため,フレーム選択などの効率指向手法が広く採用されている。
本稿では、VPとKFM(Keyword-Frame Mapping)モジュールを組み合わせたトレーニングフリーフレームワークであるViKeyを紹介する。
論文 参考訳(メタデータ) (2026-03-24T13:32:52Z) - From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos [48.666667545084835]
Composed Video Retrieval(CoVR)は、クエリビデオと、意図した変更を記述した修正テキストが与えられたターゲットビデオを取得する。
TF-CoVRは、時間的にきめ細かなCoVRに特化した最初の大規模ベンチマークである。
TF-CoVRは体操とダイビングに重点を置いており、FinGymとFineDivingから180Kのトリプルを提供している。
論文 参考訳(メタデータ) (2025-06-05T17:31:17Z) - APVR: Hour-Level Long Video Understanding with Adaptive Pivot Visual Information Retrieval [41.81696346270799]
現在の大規模言語モデル(LM)は時間レベルのビデオ理解に苦慮している。
bftextAdaptive textbfPivot MLbfVisual information textbfRetrieval (textbfAPVR)は、十分に重要な視覚情報を階層的に検索し保持する、トレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2025-06-05T12:27:10Z) - RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter [77.0205013713008]
Text-Video Retrieval (TVR)は、関連するビデオコンテンツと自然言語クエリを連携させることを目的としている。
現在までに、ほとんどの最先端のTVR手法は、大規模な事前学習された視覚モデルに基づいて、画像からビデオへの変換学習を学習している。
パラメータ化層数で事前学習モデルの微調整を行うためのスパース・アンド・コラージュAdaPter (RAP) を提案する。
論文 参考訳(メタデータ) (2024-05-29T19:23:53Z) - RIGID: Recurrent GAN Inversion and Editing of Real Face Videos [73.97520691413006]
GANのインバージョンは、実画像に強力な編集可能性を適用するのに不可欠である。
既存のビデオフレームを個別に反転させる手法は、時間の経過とともに望ましくない一貫性のない結果をもたらすことが多い。
我々は、textbfRecurrent vtextbfIdeo textbfGAN textbfInversion and etextbfDiting (RIGID) という統合されたリカレントフレームワークを提案する。
本フレームワークは,入力フレーム間の固有コヒーレンスをエンドツーエンドで学習する。
論文 参考訳(メタデータ) (2023-08-11T12:17:24Z) - You Can Ground Earlier than See: An Effective and Efficient Pipeline for
Temporal Sentence Grounding in Compressed Videos [56.676761067861236]
ビデオがトリミングされていない場合、時間的文のグラウンド化は、文問合せに従って目的のモーメントを意味的に見つけることを目的としている。
それまでの優れた作品は、かなり成功したが、それらはデコードされたフレームから抽出されたハイレベルな視覚的特徴にのみ焦点を当てている。
本稿では,圧縮された映像を直接視覚入力として利用する,圧縮された領域のTSGを提案する。
論文 参考訳(メタデータ) (2023-03-14T12:53:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。