Fugu-MT 論文翻訳(概要): Towards Debiasing Frame Length Bias in Text-Video Retrieval via Causal Intervention

論文の概要: Towards Debiasing Frame Length Bias in Text-Video Retrieval via Causal Intervention

arxiv url: http://arxiv.org/abs/2309.09311v1
Date: Sun, 17 Sep 2023 15:58:27 GMT
ステータス: 翻訳完了
システム内更新日: 2023-09-19 16:24:00.108752
Title: Towards Debiasing Frame Length Bias in Text-Video Retrieval via Causal Intervention
Title（参考訳）: 因果干渉によるテキストビデオ検索におけるフレーム長バイアスの除去
Authors: Burak Satar, Hongyuan Zhu, Hanwang Zhang, Joo Hwee Lim
Abstract要約: トリミングビデオクリップのトレーニングセットとテストセットのフレーム長差による時間偏差について,一意かつ体系的に検討した。 Epic-Kitchens-100, YouCook2, MSR-VTTデータセットについて, 因果脱バイアス法を提案し, 広範な実験およびアブレーション研究を行った。
参考スコア（独自算出の注目度）: 72.12974259966592
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Many studies focus on improving pretraining or developing new backbones in text-video retrieval. However, existing methods may suffer from the learning and inference bias issue, as recent research suggests in other text-video-related tasks. For instance, spatial appearance features on action recognition or temporal object co-occurrences on video scene graph generation could induce spurious correlations. In this work, we present a unique and systematic study of a temporal bias due to frame length discrepancy between training and test sets of trimmed video clips, which is the first such attempt for a text-video retrieval task, to the best of our knowledge. We first hypothesise and verify the bias on how it would affect the model illustrated with a baseline study. Then, we propose a causal debiasing approach and perform extensive experiments and ablation studies on the Epic-Kitchens-100, YouCook2, and MSR-VTT datasets. Our model overpasses the baseline and SOTA on nDCG, a semantic-relevancy-focused evaluation metric which proves the bias is mitigated, as well as on the other conventional metrics.
Abstract（参考訳）: 多くの研究は、テキストビデオ検索における事前学習の改善や新しいバックボーンの開発に焦点を当てている。しかし、既存の手法は、他のテキストビデオ関連タスクで示唆されているように、学習と推論バイアスの問題に悩まされる可能性がある。例えば、アクション認識における空間的外観特徴や、ビデオシーングラフ生成における時間的オブジェクトの共起は、散発的な相関を引き起こす可能性がある。本研究では,テキスト・ビデオ検索タスクにおける最初の試みであるトリミングビデオクリップのトレーニングセットとテストセットのフレーム長の相違による時間的偏りに関する一意的かつ体系的な研究を,我々の知る限りにおいて提示する。まず、ベースライン研究で示されたモデルにどのように影響するかのバイアスを仮説化し検証します。次に、因果脱バイアス法を提案し、Epic-Kitchens-100, YouCook2, MSR-VTTデータセットに関する広範な実験およびアブレーション研究を行う。本モデルでは,nDCGのベースラインとSOTAを超越し,そのバイアスを緩和する意味関連性に着目した評価指標である。

関連論文リスト

ALBAR: Adversarial Learning approach to mitigate Biases in Action Recognition [52.537021302246664]
行動認識モデルは、しばしば背景バイアス(背景の手がかりに基づく行動の推測)と前景バイアス(主題の外観に依存する)に悩まされる。本稿では,前景や背景のバイアスを,バイアス特性の専門知識を必要とせずに軽減する,新たな対人訓練手法であるALBARを提案する。我々は,提案手法を確立された背景と前景のバイアスプロトコル上で評価し,新しい最先端のバイアスプロトコルを設定し,HMDB51では12%以上のデバイアス性能を向上した。
論文参考訳（メタデータ） (2025-01-31T20:47:06Z)
Mitigating Representation Bias in Action Recognition: Algorithms and Benchmarks [76.35271072704384]
ディープラーニングモデルは、稀なシーンやオブジェクトを持つビデオに適用すると、パフォーマンスが悪くなります。この問題にはアルゴリズムとデータセットの2つの異なる角度から対処する。偏りのある表現は、他のデータセットやタスクに転送するとより一般化できることを示す。
論文参考訳（メタデータ） (2022-09-20T00:30:35Z)
Multi-Contextual Predictions with Vision Transformer for Video Anomaly Detection [22.098399083491937]
ビデオの時間的文脈を理解することは、異常検出において重要な役割を果たす。我々は3つの異なる文脈予測ストリームを持つトランスモデルを設計する。連続する正常フレームの欠落フレームの予測を学習することにより、ビデオ内の様々な正常パターンを効果的に学習することができる。
論文参考訳（メタデータ） (2022-06-17T05:54:31Z)
A Closer Look at Debiased Temporal Sentence Grounding in Videos: Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文参考訳（メタデータ） (2022-03-10T08:58:18Z)
Learning Sample Importance for Cross-Scenario Video Temporal Grounding [30.82619216537177]
本稿では,時間的接地作業に特有の表面バイアスについて検討する。そこで本研究では,Debiased Temporal Language Localizer (DebiasTLL) と呼ばれる新しい手法を提案する。我々は、列車/テストデータが均一にソースされるクロスセサリオ時間的グラウンドリングにおいて、提案モデルを評価する。
論文参考訳（メタデータ） (2022-01-08T15:41:38Z)
Towards Debiasing Temporal Sentence Grounding in Video [59.42702544312366]
ビデオ(TSGV)タスクの時間文グラウンドングは、未編集のビデオから時間モーメントを見つけ、言語クエリにマッチさせることである。モーメントアノテーションのバイアスを考慮せずに、多くのモデルはモーメントアノテーションの統計的規則性を捉える傾向がある。本稿では,データデバイアスとモデルデバイアスという2つのデバイアス戦略を提案する。
論文参考訳（メタデータ） (2021-11-08T08:18:25Z)
Interventional Video Grounding with Dual Contrastive Learning [16.0734337895897]
ビデオグラウンドティングは、与えられたテキストクエリのために、未編集のビデオから瞬間をローカライズすることを目的としている。本稿では、因果推論の観点から新しいパラダイムを提案し、モデルとデータの背後にある因果関係を明らかにする。また、テキストとビデオの整合性を改善するために、二重のコントラスト学習アプローチを導入しています。
論文参考訳（メタデータ） (2021-06-21T12:11:28Z)
Deconfounded Video Moment Retrieval with Causal Intervention [80.90604360072831]
本研究は,ビデオ中の特定のモーメントをテキストクエリに従ってローカライズすることを目的とした,ビデオモーメント検索(VMR)の課題に取り組む。既存の手法は主に複雑な相互モーダル相互作用によるクエリとモーメントのマッチング関係をモデル化する。本稿では,クエリとビデオコンテンツが予測に与える影響を捉えるために,構造因果モデルを構築する因果性に着想を得たVMRフレームワークを提案する。
論文参考訳（メタデータ） (2021-06-03T01:33:26Z)
Dense Regression Network for Video Grounding [97.57178850020327]
地上の真理の中のフレームと開始(終了)フレームの間の距離を高密度の監督として利用し、映像のグラウンド化精度を向上させる。具体的には、各フレームからビデオセグメントの開始(終了)フレームまでの距離を抑えるために、新しい高密度回帰ネットワーク(DRN)を設計する。また,グラウンドリング結果の局所化品質を明示的に考慮するために,単純だが効果的なIoU回帰ヘッドモジュールを提案する。
論文参考訳（メタデータ） (2020-04-07T17:15:37Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。