論文の概要: TAME: Temporal-Aware Mixture-of-Experts for Text-Video Retrieval
- arxiv url: http://arxiv.org/abs/2609.02204v1
- Date: Wed, 02 Sep 2026 07:12:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.129655
- Title: TAME: Temporal-Aware Mixture-of-Experts for Text-Video Retrieval
- Title(参考訳): TAME: テキストビデオ検索のための時間認識ミキサー
- Abstract要約: Text-Video Retrieval (TVR)は、自然言語クエリにマッチしたビデオを取得する。
TVRは時間モデリングの欠如によって制限されている。
テキストビデオ検索(TAME)のためのテンポラル・アウェア・ミックス・オブ・エクササイズを提案する。
- 参考スコア(独自算出の注目度): 1.4874449172133888
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Text-Video Retrieval (TVR) retrieves videos that match a natural-language query, but extending image-text models such as CLIP to videos is fundamentally limited by the lack of temporal modeling. Videos exhibit frame-wise heterogeneity in appearance and motion, and compressing all frames into a single representation often obscures temporal structure and semantic transitions. To address this, we propose Temporal-Aware Mixture-of-Experts for Text-Video Retrieval (TAME), a CLIP-based framework that jointly models frame-level structure and temporal relations. First, we integrate sparse Mixture-of-Experts (MoE) layers into both CLIP encoders and apply frame-consistent routing on the vision branch so that experts specialize according to frame-level visual patterns while preserving the original vision-language alignment. Second, we introduce Frame-Temporal (FT) tokens that aggregate global cross-frame information and feed it back to each frame, enabling the visual encoder to capture long-range temporal dependencies without harming local details. Third, we design a Cross-Temporal Interaction and Aggregation (CTIA) module that refines frame-wise sentence-video similarities through staged temporal filtering and fusion. Experiments on standard TVR benchmarks show that TAME consistently improves over CLIP-based baselines. On MSR-VTT, it improves R@1 by 4.0 over CLIP4Clip, and also achieves consistent gains on DiDeMo, MSVD, LSMDC, and ActivityNet. The code is available at https://github.com/sejong-rcv/TAME.
- Abstract(参考訳): Text-Video Retrieval (TVR)は、自然言語クエリにマッチするビデオを取得するが、CLIPのような画像テキストモデルをビデオに拡張することは、時間的モデリングの欠如によって根本的に制限される。
ビデオは外観と動きにおけるフレームワイドの不均一性を示し、全てのフレームを単一の表現に圧縮すると、時間的構造や意味的遷移が曖昧になる。
そこで本研究では,フレームレベルの構造と時間関係を協調的にモデル化するCLIPベースのフレームワークであるTAME(Temporal-Aware Mixture-of-Experts for Text-Video Retrieval)を提案する。
まず,両CLIPエンコーダにSparse Mixture-of-Experts (MoE) レイヤを統合し,フレーム一貫性のルーティングを視覚枝に適用することにより,フレームレベルの視覚パターンに従って専門家が元の視覚言語アライメントを保ちながら専門化できるようにする。
第二に、フレーム・テンポラル(FT)トークンを導入し、グローバルなクロスフレーム情報を集約し、それを各フレームにフィードバックすることで、視覚エンコーダが局所的な詳細を損なうことなく、長時間の時間的依存関係をキャプチャすることを可能にする。
第3に,時間的フィルタリングと融合によるフレームワイズ・ビデオの類似性を改良したCTIAモジュールを設計する。
標準的なTVRベンチマークの実験では、TAMEはCLIPベースのベースラインよりも一貫して改善されている。
MSR-VTTでは、CLIP4ClipよりもR@1を4.0改善し、DiDeMo、MSVD、LSMDC、ActivityNetでも一貫した利益を得ている。
コードはhttps://github.com/sejong-rcv/TAME.comで公開されている。
関連論文リスト
- Intrinsic Temporal Adaptation of CLIP for Partially Relevant Video Retrieval [40.983482307220676]
PRVRは、テキストクエリに関連するモーメントを含む未編集のビデオを検索することを目的としている。
Intrinsic Temporal Adaptation (ITA) framework for PRVRを提案する。
提案手法は,PRVRベンチマーク上での最先端性能を実現する。
論文 参考訳(メタデータ) (2026-09-04T06:58:59Z) - T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding [39.50722040335288]
Video Temporal Groundingは、自然言語クエリに対応するビデオセグメントをローカライズすることを目的としている。
既存のビジョン-LMMは、通常、位置エンコーディング、テキストベースのタイムスタンプ、または視覚フレーム番号による時間ダイナミクスを知覚する。
本稿では,空間的理解タスクとしてビデオの時間的理解を再構築する新しいフレームワークであるT2SGridを提案する。
論文 参考訳(メタデータ) (2026-03-07T01:25:41Z) - TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding [14.570869250170139]
TV-RAGは、時間的アライメントとエントロピー誘導のセマンティクスを結合して、長時間ビデオの推論を改善する、トレーニング不要のアーキテクチャである。
これらの時間的および意味的な信号を織り合わせることで、TV-RAGは、再トレーニングや微調整なしに任意のLVLMに移植できる二重レベルの推論ルーチンを実現する。
論文 参考訳(メタデータ) (2025-12-29T14:10:22Z) - Reuse and Diffuse: Iterative Denoising for Text-to-Video Generation [92.55296042611886]
リユースとディフューズ”と呼ばれるフレームワークを$textitVidRD$と名づけて提案する。
また、既存の複数のデータセットからの多様なコンテンツを含むビデオテキストデータを構成するための一連の戦略を提案する。
論文 参考訳(メタデータ) (2023-09-07T08:12:58Z) - RIGID: Recurrent GAN Inversion and Editing of Real Face Videos [73.97520691413006]
GANのインバージョンは、実画像に強力な編集可能性を適用するのに不可欠である。
既存のビデオフレームを個別に反転させる手法は、時間の経過とともに望ましくない一貫性のない結果をもたらすことが多い。
我々は、textbfRecurrent vtextbfIdeo textbfGAN textbfInversion and etextbfDiting (RIGID) という統合されたリカレントフレームワークを提案する。
本フレームワークは,入力フレーム間の固有コヒーレンスをエンドツーエンドで学習する。
論文 参考訳(メタデータ) (2023-08-11T12:17:24Z) - Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation [93.18163456287164]
本稿では,動画に画像モデルを適用するための新しいテキスト誘導型動画翻訳フレームワークを提案する。
我々のフレームワークは,グローバルなスタイルと局所的なテクスチャの時間的一貫性を低コストで実現している。
論文 参考訳(メタデータ) (2023-06-13T17:52:23Z) - Towards Smooth Video Composition [59.134911550142455]
ビデオ生成には、時間とともに動的コンテンツを伴う一貫した永続的なフレームが必要である。
本研究は, 生成的対向ネットワーク(GAN)を用いて, 任意の長さの映像を構成するための時間的関係を, 数フレームから無限までモデル化するものである。
単体画像生成のためのエイリアスフリー操作は、適切に学習された知識とともに、フレーム単位の品質を損なうことなく、スムーズなフレーム遷移をもたらすことを示す。
論文 参考訳(メタデータ) (2022-12-14T18:54:13Z) - Flow-Guided Sparse Transformer for Video Deblurring [124.11022871999423]
FlowGuided Sparse Transformer (F GST) はビデオデブリのためのフレームワークである。
FGSW-MSAは、推定光流のガイダンスを楽しみ、隣り合うフレームの同じシーンパッチに対応する、空間的にスパースな要素を世界中にサンプリングする。
提案するFGSTは,DVDおよびGOPROデータセットの最先端パッチよりも優れており,実際のビデオの劣化に対して,より視覚的に満足な結果が得られる。
論文 参考訳(メタデータ) (2022-01-06T02:05:32Z) - Zooming SlowMo: An Efficient One-Stage Framework for Space-Time Video
Super-Resolution [100.11355888909102]
時空ビデオ超解像度は低解像度(LR)と低フレームレート(LFR)ビデオシーケンスから高解像度(HR)スローモーションビデオを生成することを目的としている。
入力LRおよびLFRビデオから直接HRスローモーション映像シーケンスを再構成できる一段階の時空間ビデオ超解像フレームワークを提案する。
論文 参考訳(メタデータ) (2021-04-15T17:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。