論文の概要: Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis
- arxiv url: http://arxiv.org/abs/2605.00826v1
- Date: Sat, 07 Mar 2026 12:28:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 06:56:26.419832
- Title: Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis
- Title(参考訳): テキスト・ツー・ビデオ検索におけるパフォーマンス・プラトーの理解 : 総合的経験的・言語学的分析
- Authors: Maria-Eirini Pegia, Dimitrios Stefanopoulos, Björn Þór Jónsson, Anastasia Moumtzidou, Ilias Gialampoukidis, Stefanos Vrochidis, Ioannis Kompatsiaris,
- Abstract要約: 広く使われている3つのデータセットを対象とした14の最先端検索手法を評価した。
我々は,長さ,明瞭度,意味カテゴリー,アクション対シーンバランスなどのキャプション特性を分析した。
- 参考スコア(独自算出の注目度): 5.6902579988042135
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-video retrieval enables users to find relevant video content using natural language queries, a task that has grown increasingly important with the rapid expansion of online video. Over the past six years, research has produced numerous methods, such as dual encoders, attention-driven models, and multimodal fusion approaches; however, fundamental questions remain about model behavior, dataset influence, and query difficulty. In this work, we evaluate 14 state-of-the-art retrieval methods across 3 widely used datasets under a unified preprocessing and evaluation framework. We analyze caption characteristics, including length, clarity, semantic category, and Action vs. Scene balance, and link these to model performance. Our results show that short, clear, and simple captions, such as those describing single actions or color attributes, achieve higher recall, while complex events, multi-step activities, or fine-grained scene descriptions remain challenging for all existing models. Attention-driven architectures better handle temporally dependent or multi-step queries, whereas dual-encoder and multimodal fusion models perform well primarily on simpler or single-category captions. Cross-dataset generalization improves with larger, more diverse caption sets, but generative captions do not consistently enhance retrieval accuracy. Overall, our findings highlight key dataset factors, benchmark challenges, and the interplay between query content and model architecture, providing guidance for developing more effective text-to-video retrieval systems.
- Abstract(参考訳): テキスト・ツー・ビデオ検索により、ユーザーは自然言語クエリを使って関連ビデオコンテンツを見つけることができる。
過去6年間で、デュアルエンコーダ、アテンション駆動モデル、マルチモーダル融合アプローチなどの多くの手法が研究されてきたが、モデル挙動、データセットの影響、クエリの難しさに関する根本的な疑問は残る。
本研究では,3つの広く使用されているデータセットを対象とした14の最先端検索手法を,統合された事前処理および評価フレームワークを用いて評価する。
我々は,長さ,明瞭度,意味カテゴリー,アクション対シーンバランスなどのキャプション特性を分析し,それらをモデル性能にリンクする。
以上の結果から,シングルアクションやカラー属性などの簡潔で明快なキャプションはリコール率が高く,複雑なイベントやマルチステップアクティビティ,微粒なシーン記述などは既存のモデルでは依然として困難であることが示唆された。
注意駆動型アーキテクチャは時間依存またはマルチステップのクエリを扱うのがよいが、デュアルエンコーダとマルチモーダル融合モデルは主に単純なキャプションや単一カテゴリのキャプションでうまく機能する。
クロスデータセットの一般化は、より大きな、より多様なキャプションセットで改善されるが、生成キャプションは、常に検索精度を向上しない。
全体としては、重要なデータセット要素、ベンチマーク課題、クエリコンテンツとモデルアーキテクチャ間の相互作用に注目し、より効果的なテキスト・ビデオ検索システムの開発のためのガイダンスを提供する。
関連論文リスト
- IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval [36.33423199468626]
対話型ビデオコーパス検索(IVCR)タスクは,ユーザと検索システム間のマルチターン,対話,現実的な対話を可能にする。
IVCR-200Kは高品質、バイリンガル、マルチターン、会話、抽象的なセマンティックデータセットであり、ビデオ検索やモーメント検索もサポートしている。
本稿では,マルチモーダルな大規模言語モデル(MLLM)に基づく包括的フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-01T06:12:59Z) - MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval [57.891157692501345]
$textbfMultiVENT 2.0$は、大規模かつ多言語なイベント中心のビデオ検索ベンチマークである。
218,000以上のニュースビデオと、特定の世界イベントを対象とした3,906のクエリが提供されている。
予備的な結果は、最先端のビジョン言語モデルは、この課題にかなり苦労していることを示している。
論文 参考訳(メタデータ) (2024-10-15T13:56:34Z) - Personalized Video Summarization using Text-Based Queries and Conditional Modeling [3.4447129363520337]
この論文は、テキストベースのクエリと条件付きモデリングを統合することで、ビデオ要約の強化を探求する。
精度やF1スコアなどの評価指標は、生成された要約の品質を評価する。
論文 参考訳(メタデータ) (2024-08-27T02:43:40Z) - Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach [56.610806615527885]
テキストビデオ検索(TVR)における重要な課題は、ビデオとテキスト間の情報非対称性である。
本稿では,このギャップを埋めるために,テキスト表現を豊かにすることで,映像コンテンツの豊かさに合わせたデータ中心のフレームワークを提案する。
本稿では,最も関連性が高く多様なクエリを識別し,計算コストを低減し,精度を向上するクエリ選択機構を提案する。
論文 参考訳(メタデータ) (2024-08-14T01:24:09Z) - COSMO: COntrastive Streamlined MultimOdal Model with Interleaved
Pre-Training [119.03392147066093]
近年の自己回帰視覚言語モデルは, テキスト生成タスクでは優れているが, アライメントタスクでは課題に直面している。
テキスト生成モデルに対照的な損失を導入し,言語モデルを専用テキスト処理と適応型マルチモーダルデータ処理コンポーネントに分割する。
このギャップを埋めるために、この研究は、包括的なキャプションを備えた最初のインターリーブ付きビデオテキストデータセットであるVideoDatasetNameを導入した。
論文 参考訳(メタデータ) (2024-01-01T18:58:42Z) - Video as Conditional Graph Hierarchy for Multi-Granular Question
Answering [80.94367625007352]
ビデオはフレームシーケンスで表現されるが、視覚要素はシーケンシャルではなく、セマンティック空間において階層的である。
本稿では,異なる粒度の視覚的事実をレベルワイドに織り込む条件付きグラフ階層として,動画をモデル化することを提案する。
論文 参考訳(メタデータ) (2021-12-12T10:35:19Z) - See, Hear, Read: Leveraging Multimodality with Guided Attention for
Abstractive Text Summarization [14.881597737762316]
我々は,NDSS,ICML,NeurIPSなどの著名な学術カンファレンスのプレゼンテーションから収集した,様々な期間のビデオを用いた抽象テキスト要約のための最初の大規模データセットを紹介する。
次に,多モード変換器をベースとしたデコーダのみの言語モデルであるnameを提案し,テキスト要約タスクの様々な入力モードにおけるモーダル内およびモーダル間ダイナミクスを本質的にキャプチャする。
論文 参考訳(メタデータ) (2021-05-20T08:56:33Z) - Fine-grained Video-Text Retrieval with Hierarchical Graph Reasoning [72.52804406378023]
ビデオとテキスト間のクロスモーダル検索は、Web上のビデオの急速な出現により、注目を集めている。
微細なビデオテキスト検索を改善するために,ビデオテキストマッチングをグローバル-ローカルレベルに分解する階層グラフ推論モデルを提案する。
論文 参考訳(メタデータ) (2020-03-01T03:44:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。