論文の概要: TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge
- arxiv url: http://arxiv.org/abs/2605.24470v1
- Date: Sat, 23 May 2026 08:37:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.074053
- Title: TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge
- Title(参考訳): Tempret: CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge における時間的拡張と2段階更新
- Authors: Zixu Li, Yupeng Hu, Zhiwei Chen, Zhiheng Fu, Xiaowei Zhu, Weili Guan, Liqiang Nie,
- Abstract要約: 我々は,CVPR 2026 EPIC-KITCHENS-100 MIRチャレンジに対して,TempRetと呼ばれるソリューションを提示する。
当社のアプローチは,CLIPベースのデュアルエンコーダのバックボーン上に構築されており,時間的および横断的な課題に対処するための2つの重要なコンポーネントを導入している。
EK-100 MIRベンチマークでは,平均mAPは67.97%,平均nDCGは82.92%であった。
- 参考スコア(独自算出の注目度): 71.10535279591527
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video-text retrieval has witnessed remarkable progress driven by large-scale vision-language pretraining, yet most existing approaches inherit an implicit assumption from image-text retrieval: that visual semantics can be captured frame-by-frame. This assumption overlooks the temporal dynamics of egocentric videos. The EPIC-KITCHENS-100 Multi-Instance Retrieval (MIR) challenge further raises the bar by providing soft-label relevance matrices rather than binary labels, demanding models that can resolve graded semantic correspondences across modalities. In this report, we present our solution, termed TempRet, to the CVPR 2026 EPIC-KITCHENS-100 MIR challenge. Our approach builds upon a CLIP-based dual-encoder backbone and introduces two key components to address the temporal and cross-modal challenges. First, a temporal transformer operates exclusively on the video side, modeling inter-frame dependencies through learnable positional encodings and multi-head self-attention over frame-level CLIP features. Second, a two-stage reranking pipeline first retrieves Top-K candidates via the dual-encoder, then refines their scores using a cross-encoder equipped with an Image-Text Matching (ITM) head. The entire system is trained with Symmetric Multi-Similarity Loss to exploit the soft-label relevance matrices provided by the challenge. Our method achieves 67.97% average mAP and 82.92% average nDCG on the EK-100 MIR benchmark, demonstrating the effectiveness of temporal modeling and cross-modal refinement for egocentric video retrieval.
- Abstract(参考訳): ビデオテキスト検索は、大規模な視覚言語による事前訓練によって顕著な進歩をみせたが、既存のほとんどのアプローチは、画像テキスト検索から暗黙の仮定を継承している。
この仮定は、エゴセントリックなビデオの時間的ダイナミクスを見落としている。
EPIC-KITCHENS-100 Multi-Instance Retrieval (MIR) チャレンジは、バイナリラベルよりもソフトラベルの関連性行列を提供することによって、モダリティ間のグレード付きセマンティック通信を解決できるモデルを要求することで、バーをさらに高める。
本稿では,CVPR 2026 EPIC-KITCHENS-100 MIR チャレンジに対して,TempRet というソリューションを提示する。
当社のアプローチは,CLIPベースのデュアルエンコーダのバックボーン上に構築されており,時間的および横断的な課題に対処するための2つの重要なコンポーネントを導入している。
まず、時間変換器はビデオ側のみで動作し、学習可能な位置エンコーディングを通じてフレーム間の依存関係をモデル化し、フレームレベルのCLIP機能に対するマルチヘッド自己アテンションを行う。
次に、2段リカレントパイプラインは、まずデュアルエンコーダを介してトップK候補を取得し、次にイメージテキストマッチング(ITM)ヘッドを備えたクロスエンコーダを使用してスコアを洗練する。
システム全体がSymmetric Multi-Similarity Lossでトレーニングされ、課題によって提供されるソフトラベル関連行列を活用する。
EK-100 MIRベンチマークでは,平均mAP67.97%,平均nDCG82.92%を達成し,時間的モデリングと相互修正の有効性を実証した。
関連論文リスト
- Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models [58.46663983451155]
PixSearchは、地域レベルの認識と検索強化推論を統合する、エンドツーエンドのLMM(Large Multimodal Model)である。
エンコーディング中、PixSearchは検索をトリガーする検索>トークンを出力し、クエリのモダリティ(テキスト、画像、リージョン)を選択し、ビジュアルクエリとして直接機能するピクセルレベルのマスクを生成する。
エゴセントリックでエンティティ中心のVQAベンチマークでは、PixSearchは事実整合性と一般化を大幅に改善する。
論文 参考訳(メタデータ) (2026-01-27T00:46:08Z) - FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing [97.35186681023025]
FFP-300Kは、720p解像度と81フレームの高忠実度ビデオペアの大規模データセットである。
本稿では,第1フレームの外観維持とソース映像の動作保存の緊張を解消する,真の誘導不要なFFPのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-05T01:46:22Z) - Preserving Cross-Modal Consistency for CLIP-based Class-Incremental Learning [77.82901519692378]
クラスインクリメンタルラーニング(CIL)は、モデルが獲得した知識を忘れることなく、シーケンシャルなタスクから新しいカテゴリを継続的に学習することを可能にする。
視覚エンコーダの適応とテキストソフトプロンプトの最適化を分離するCLIPベースのCILのための2段階フレームワークであるDMCを提案する。
CIFAR-100, Imagenet-R, CUB-200, UCF-101 の大規模な実験により, DMC と DMC-OT の両者が最先端の性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-14T05:36:36Z) - Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration [24.337139909108117]
過剰なフレームが文脈の希釈によってパラドックス的に性能を低下させる「レスはそれ以上」現象である。
視覚エコー」は「視覚エコー」という時間的冗長性を有する
AFP"は、ResNet-50とCLIPの機能空間に適応的な階層的クラスタリングアルゴリズムを用いて、これらのエコーを単一の代表に識別し、マージする。
我々の完全なアプローチは、必要なフレームを86.9%まで、合計入力トークンを83.2%まで劇的に削減することを示しています。
論文 参考訳(メタデータ) (2025-08-05T11:31:55Z) - Temporal Context Aggregation for Video Retrieval with Contrastive
Learning [81.12514007044456]
フレームレベルの特徴間の時間的長距離情報を組み込んだビデオ表現学習フレームワークTCAを提案する。
提案手法は,映像レベルの特徴を持つ最先端の手法に対して,FIVR-200Kでは17% mAPの大幅な性能上の優位性を示す。
論文 参考訳(メタデータ) (2020-08-04T05:24:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。