論文の概要: MARS: What Retrieval Signals Are Hidden in Multimodal Large Language Models for Text-Video Retrieval?
- arxiv url: http://arxiv.org/abs/2609.02565v1
- Date: Wed, 02 Sep 2026 13:16:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.361374
- Title: MARS: What Retrieval Signals Are Hidden in Multimodal Large Language Models for Text-Video Retrieval?
- Title(参考訳): MARS:テキストビデオ検索のための多モーダル大言語モデルにどのような検索信号が隠されているか?
- Authors: Uicheol Jung, Juyoung Hong, Geuntaek Lim, Yukyung Choi,
- Abstract要約: テキストビデオ検索には、似たようなシーン、アクション、時間パターンでビデオを区別できる表現が必要である。
最近の多モーダルな言語モデルは埋め込みモデルとして採用されているが、最終層からの1つのトークンを用いて各入力を表現していることが多い。
テキストビデオ検索のための多層・マルチスロット埋め込みフレームワークMARSを提案する。
- 参考スコア(独自算出の注目度): 2.0824228840987447
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Text-video retrieval requires representations that can distinguish videos with similar scenes, actions, and temporal patterns. Recent multimodal large language models have been adapted as embedding models, but they often represent each input using a single token from the final layer. This can compress diverse video-text cues into a single vector and limit fine-grained retrieval. To address this limitation, we propose MARS, a multi-layer and multi-slot embedding framework for text-video retrieval. MARS constructs multiple adaptive representation slots by combining hidden states from different decoder layers, compares corresponding text and video slots, and aggregates their similarities for retrieval. To better handle confusing candidates, we further introduce a hard-negative-aware slot specialization objective that encourages the slots to capture discriminative matching cues. Experiments on four text-video retrieval benchmarks show that MARS achieves state-of-the-art results in both direct similarity-based retrieval and reranking settings. Ablation studies and analyses demonstrate that multi-layer fusion, multiple slots, and hard-negative-aware slot specialization provide complementary gains. Code is available at https://github.com/sejong-rcv/MARS.
- Abstract(参考訳): テキストビデオ検索には、似たようなシーン、アクション、時間パターンでビデオを区別できる表現が必要である。
最近の多モーダルな言語モデルは埋め込みモデルとして採用されているが、最終層からの1つのトークンを用いて各入力を表現していることが多い。
これにより、多様なビデオテキストキューを1つのベクトルに圧縮し、きめ細かい検索を制限することができる。
この制限に対処するため,テキストビデオ検索のための多層多スロット埋め込みフレームワークMARSを提案する。
MARSは、異なるデコーダ層から隠れた状態を組み合わせて複数の適応表現スロットを構築し、対応するテキストとビデオスロットを比較し、検索の類似性を集約する。
紛らわしい候補をよりよく扱うために、スロットが識別的マッチングの手がかりを捉えることを奨励する、ハード・ネガティブ・アウェアのスロット特殊化目標を導入する。
4つのテキストビデオ検索ベンチマークの実験により、MARSは直接類似性に基づく検索と再ランク設定の両方で最先端の結果を達成することが示された。
アブレーション研究と分析により、多層融合、多重スロット、ハード負のスロット特殊化が相補的な利得をもたらすことが示された。
コードはhttps://github.com/sejong-rcv/MARSで入手できる。
関連論文リスト
- TC-MGC: Text-Conditioned Multi-Grained Contrastive Learning for Text-Video Retrieval [1.8434042562191815]
本稿では,TC-MGC と呼ばれるテキスト記述型マルチグラインドコントラストフレームワークを提案する。
本モデルでは,単語の重み付けとテキストの重み付けに係わる集約されたフレームとビデオ表現を生成するために,言語ビデオのアテンションブロックを用いる。
実証的に、TC-MGCは複数のテキストビデオ検索ベンチマークで競合する結果を得る。
論文 参考訳(メタデータ) (2025-04-07T03:33:14Z) - Video-Text Retrieval by Supervised Sparse Multi-Grained Learning [22.17732989393653]
本稿では,ビデオとテキスト間で共有されるスパース空間を学習し,ビデオテキスト検索のための新しいスパース学習フレームワークであるS3MAを提案する。
テキストデータを手元に置き、提案した類似性とアライメント損失を用いて共有スパース空間を教師付きで学習し、更新する。
学習された共有空間と多粒度類似性から、ビデオテキスト検索ベンチマークによる実験により、既存の手法よりもS3MAの方が優れていることが示された。
論文 参考訳(メタデータ) (2023-02-19T04:03:22Z) - UATVR: Uncertainty-Adaptive Text-Video Retrieval [90.8952122146241]
一般的なプラクティスは、テキストとビデオのペアを同じ埋め込みスペースに転送し、特定のエンティティとのクロスモーダルなインタラクションを構築することである。
UATVRと呼ばれる不確実性言語によるテキスト・ビデオ検索手法を提案し、各ルックアップを分布マッチング手順としてモデル化する。
論文 参考訳(メタデータ) (2023-01-16T08:43:17Z) - RaP: Redundancy-aware Video-language Pre-training for Text-Video
Retrieval [61.77760317554826]
冗長性を考慮したビデオ言語事前学習を提案する。
我々は,ビデオパッチとテキストトークンの冗長性の測定を,クロスモーダルな最小相似性を計算することによって設計する。
提案手法はMSRVTT, MSVD, DiDeMo, LSMDCの4つのベンチマークデータセットを用いて評価した。
論文 参考訳(メタデータ) (2022-10-13T10:11:41Z) - Towards Fast Adaptation of Pretrained Contrastive Models for
Multi-channel Video-Language Retrieval [70.30052749168013]
マルチチャンネルビデオ言語検索は、異なるチャンネルからの情報を理解するためにモデルを必要とする。
対照的なマルチモーダルモデルは、画像やビデオやテキストのエンティティの整合に非常に効果的であることが示されている。
これら2つの行を、限られたデータとリソースを持つマルチチャンネルビデオ言語検索に迅速に適応する方法は、明らかではない。
論文 参考訳(メタデータ) (2022-06-05T01:43:52Z) - BridgeFormer: Bridging Video-text Retrieval with Multiple Choice
Questions [38.843518809230524]
我々は、Multiple Choice Questions (MCQ) と呼ばれる新しいプレテキストタスクを導入する。
BridgeFormerモジュールは、ビデオ機能に頼ってテキスト機能によって構築された"クエスト"に答えるように訓練されている。
質問や回答の形式では、ローカルなビデオテキストの特徴間の意味的関連を適切に確立することができる。
提案手法は,5つのデータセットにおいて,人気テキスト・ビデオ検索タスクにおける最先端の手法よりも優れる。
論文 参考訳(メタデータ) (2022-01-13T09:33:54Z) - Video Corpus Moment Retrieval with Contrastive Learning [56.249924768243375]
ビデオコーパスモーメント検索(VCMR)は、与えられたテキストクエリに意味的に対応する時間モーメントを取得することです。
VCMRのためのコントラシブラーニング(ReLoCLNet)を用いた検索・ローカリゼーションネットワークを提案する。
実験の結果、ReLoCLNetは効率のためにテキストとビデオを個別にエンコードし、その検索精度はクロスモーダル相互作用学習を採用するベースラインと匹敵する。
論文 参考訳(メタデータ) (2021-05-13T12:54:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。