Fugu-MT 論文翻訳(概要): Leveraging Temporal Contextualization for Video Action Recognition

論文の概要: Leveraging Temporal Contextualization for Video Action Recognition

arxiv url: http://arxiv.org/abs/2404.09490v2
Date: Wed, 24 Jul 2024 05:08:08 GMT
ステータス: 翻訳完了
システム内更新日: 2024-07-25 19:01:10.242927
Title: Leveraging Temporal Contextualization for Video Action Recognition
Title（参考訳）: 映像行動認識のための時間的文脈化の活用
Authors: Minji Kim, Dongyoon Han, Taekyung Kim, Bohyung Han,
Abstract要約: 本稿では,TC-CLIP (Temporally Contextualized CLIP) と呼ばれる映像理解のためのフレームワークを提案する。ビデオの時間的情報注入機構である時間的コンテキスト化(TC)を導入する。 Video-Prompting (VP)モジュールはコンテキストトークンを処理し、テキストのモダリティで情報的なプロンプトを生成する。
参考スコア（独自算出の注目度）: 47.8361303269338
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: We propose a novel framework for video understanding, called Temporally Contextualized CLIP (TC-CLIP), which leverages essential temporal information through global interactions in a spatio-temporal domain within a video. To be specific, we introduce Temporal Contextualization (TC), a layer-wise temporal information infusion mechanism for videos, which 1) extracts core information from each frame, 2) connects relevant information across frames for the summarization into context tokens, and 3) leverages the context tokens for feature encoding. Furthermore, the Video-conditional Prompting (VP) module processes context tokens to generate informative prompts in the text modality. Extensive experiments in zero-shot, few-shot, base-to-novel, and fully-supervised action recognition validate the effectiveness of our model. Ablation studies for TC and VP support our design choices. Our project page with the source code is available at https://github.com/naver-ai/tc-clip
Abstract（参考訳）: 本稿では,ビデオ内の時空間領域における大域的相互作用を通じて重要な時空間情報を活用する,時間的文脈化CLIP (TC-CLIP) と呼ばれるビデオ理解のための新しいフレームワークを提案する。具体的には,ビデオの階層的時間情報注入機構である時間文脈化(TC)を導入する。 1) 各フレームからコア情報を抽出する。 2)要約のためのフレーム間の関連情報をコンテキストトークンに接続する。 3) 機能のエンコーディングにコンテキストトークンを利用する。さらに、ビデオ条件プロンプト(VP)モジュールはコンテキストトークンを処理し、テキストモダリティのインフォメーションプロンプトを生成する。ゼロショット, 少数ショット, ベース・ツー・ノーベル, 完全教師付きアクション認識における広範囲な実験により, モデルの有効性が検証された。 TCとVPのアブレーション研究は、私たちの設計選択を支持します。ソースコードのプロジェクトページはhttps://github.com/naver-ai/tc-clip.comで公開されている。

関連論文リスト

Multimodal Long Video Modeling Based on Temporal Dynamic Context [13.979661295432964]
時間的動的コンテキスト(TDC)と呼ばれるフレーム間の時間的関係を利用した動的長ビデオ符号化手法を提案する。ビデオはフレーム間の類似性に基づいて意味的に一貫したシーンに分割し、各フレームを視覚音響エンコーダを使用してトークンにエンコードする。極端に長いビデオを扱うために,複数のビデオセグメントから回答を段階的に抽出する学習自由連鎖戦略を提案する。
論文参考訳（メタデータ） (2025-04-14T17:34:06Z)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting [60.58915701973593]
CAT-V(Caption AnyThing in Video)は、オブジェクト中心のビデオキャプションを微粒化するためのトレーニング不要のフレームワークである。 Cat-Vは3つの重要なコンポーネントを統合している: SAMIに基づくフレーム間の正確なオブジェクトセグメンテーションのためのセグメンタ、TRACE-UniVLを動力とするテンポラルアナライザ、Intern-2.5を使用するキャピタ。我々のフレームワークは、追加のトレーニングデータを必要とすることなく、オブジェクトの属性、アクション、ステータス、インタラクション、環境コンテキストの詳細な時間的記述を生成します。
論文参考訳（メタデータ） (2025-04-07T22:35:36Z)
FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance [47.88160253507823]
我々は、既存のテキスト制御機構を改善する革新的なビデオジェネレータであるFancyVideoを紹介した。 CTGMは、TII(Temporal Information)、TAR(Temporal Affinity Refiner)、TFB(Temporal Feature Booster)をクロスアテンションの開始、中、末に組み込んでいる。
論文参考訳（メタデータ） (2024-08-15T14:47:44Z)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval [53.417646562344906]
Video Moment Retrieval (VMR) は、自然言語クエリが与えられた未トリミング長ビデオ内の特定の時間セグメントをローカライズすることを目的としている。既存の方法は、しばしば不十分なトレーニングアノテーションに悩まされる。つまり、文は通常、単語の多様性が制限された前景の顕著なビデオ内容のごく一部と一致する。この本質的なモダリティの不均衡は、視覚情報のかなりの部分がテキストと一致しないまま残されている。本研究では,MLLMをビデオナレーターとして用いて,ビデオのテキスト記述を多用し,モダリティの不均衡を緩和し,時間的局所化を促進させる。
論文参考訳（メタデータ） (2024-06-25T18:39:43Z)
Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding [22.59291334338824]
相関ガイドによる検出TRansformerは、クエリ関連ビデオクリップのヒントを提供する。 CG-DETRは時間的接地のための様々なベンチマークで最先端の結果を得る。
論文参考訳（メタデータ） (2023-11-15T10:22:35Z)
Towards Generalisable Video Moment Retrieval: Visual-Dynamic Injection to Image-Text Pre-Training [70.83385449872495]
映像モーメント検索(VMR)における視覚とテキストの相関既存の方法は、視覚的およびテキスト的理解のために、個別の事前学習機能抽出器に依存している。本稿では,映像モーメントの理解を促進するために,ビジュアルダイナミックインジェクション(Visual-Dynamic Injection, VDI)と呼ばれる汎用手法を提案する。
論文参考訳（メタデータ） (2023-02-28T19:29:05Z)
Learning Commonsense-aware Moment-Text Alignment for Fast Video Temporal Grounding [78.71529237748018]
自然言語クエリで記述された時間的ビデオセグメントを効果的かつ効率的にグラウンド化することは、視覚・言語分野において必須の能力である。既存のほとんどのアプローチでは、接地性能を改善するために、厳密に設計されたクロスモーダルな相互作用モジュールを採用しています。本稿では,コモンセンスの視覚とテキストの表現を補完的なコモンスペースに組み込んだ,コモンセンス対応のクロスモーダルアライメントフレームワークを提案する。
論文参考訳（メタデータ） (2022-04-04T13:07:05Z)
Discriminative Latent Semantic Graph for Video Captioning [24.15455227330031]
ビデオキャプションは、あるビデオの視覚的内容を記述する自然言語文を自動的に生成することを目的としている。我々の主な貢献は、将来のビデオ要約タスクのための統合フレームワークにおける3つの重要な問題を特定することである。
論文参考訳（メタデータ） (2021-08-08T15:11:20Z)
Context-aware Biaffine Localizing Network for Temporal Sentence Grounding [61.18824806906945]
本論文では時間文接地(TSG)の問題について述べる。 TSGは、文章クエリによって、未トリムのビデオから特定のセグメントの時間境界を特定することを目指しています。ビデオ内の開始と終了の全てのインデックスをバイアフィン機構で同時にスコア付けする,新しいローカリゼーションフレームワークを提案する。
論文参考訳（メタデータ） (2021-03-22T03:13:05Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。