論文の概要: EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization
- arxiv url: http://arxiv.org/abs/2607.04872v1
- Date: Mon, 06 Jul 2026 09:47:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.106113
- Title: EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization
- Title(参考訳): EventCoT: 時間的ローカライゼーションを推論するイベント中心のビデオチェーン
- Abstract要約: Reasoning temporal Localization (RTL) は、それをサポートする時間間隔を含む答えを生成するモデルを必要とする。
イベント中心のビデオチェーン・オブ・思想フレームワークであるEventCoTを提案する。
EventCoTは、入力ビデオのイベント中心のトークン化を実行し、それをコンパクトなイベントトークンに変換する。
その後、識別されたイベント内で応答を生成し、埋め込みマッチングを通じて時間間隔をグラウンド化する。
- 参考スコア(独自算出の注目度): 39.30013113761109
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reasoning temporal localization (RTL) requires a model to generate an answer that itself contains the time interval supporting it, so high-level reasoning and precise temporal grounding must be produced jointly in a single response. To tackle this challenging task, we propose the first event-centric video chain-of-thought framework, dubbed EventCoT. EventCoT first performs event-centric tokenization of the input video to convert it into compact event tokens, enabling efficient identification of question-relevant events. It then reasons within the identified events to generate the answer, grounding the time interval via embedding matching that aligns placeholder tokens with visual embeddings. EventCoT achieves state-of-the-art results on ActivityNet-RTL for reasoning temporal localization while using substantially fewer visual tokens than previous work. To verify its general performance, we further evaluate EventCoT on the grounded video question answering benchmark ReXTime, where it attains strong zero-shot results.
- Abstract(参考訳): Reasoning temporal Localization (RTL) は、それをサポートする時間間隔を含む答えを生成するモデルを必要とするため、単一の応答で高レベルな推論と正確な時間的接地を共同で生成する必要がある。
この課題に対処するために、EventCoTと呼ばれる最初のイベント中心のビデオチェーンフレームワークを提案する。
EventCoTは、入力ビデオのイベント中心のトークン化を実行して、それをコンパクトなイベントトークンに変換することで、質問関連イベントの効率的な識別を可能にする。
次に、特定されたイベント内で応答を生成し、プレースホルダートークンと視覚的な埋め込みを整合した埋め込みマッチングを通じて、時間間隔をグラウンド化する。
EventCoTは、時間的ローカライゼーションを推論するActivityNet-RTLの最先端結果を達成すると同時に、以前の作業よりもはるかに少ない視覚トークンを使用する。
一般的な性能を検証するため,グラウンドドビデオ質問応答ベンチマークReXTimeでEventCoTを評価する。
関連論文リスト
- E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching [87.38371267983263]
時間的ビデオグラウンディングは、クエリイベントに対応する時間セグメントを正確にローカライズすることを目的としている。
E.M.GroundはTVGのための新しいVid-LLMで、総合的で一貫性のあるイベント知覚に焦点を当てている。
E.M.Ground は最先端の Vid-LLM を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-05T02:16:00Z) - EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models [56.16721798968254]
本研究では,EventSTUという,効率的な理解のためのイベント誘導学習自由フレームワークを提案する。
時間領域において、不要な大フレームを除去するために、イベントカメラのトリガー特性を変化させる粗大なサンプリングアルゴリズムを設計する。
空間領域では,イベントの正当性をゼロコストとして活用し,空間的縮小を誘導する適応的トークンプルーニングアルゴリズムを実現する。
論文 参考訳(メタデータ) (2025-11-24T09:30:02Z) - PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning [23.4119982709261]
本稿では,検出トランスに先立って位置と関係を注入する,PR-DETRという新しい高密度ビデオキャプションフレームワークを提案する。
一方,我々はまず位置対応クエリを生成し,シーン固有の位置と潜在的な事象のセマンティック情報を提供する。
一方、イベント間相互作用を導く前に、イベント境界間の関係を明示的に計算し、キャプションのセマンティックコヒーレンスを改善するイベント関係エンコーダを設計する。
論文 参考訳(メタデータ) (2025-06-19T07:07:42Z) - Uneven Event Modeling for Partially Relevant Video Retrieval [17.05658098065075]
部分関連ビデオ検索(PRVR)のための不均一事象モデリング(UEM)フレームワークを提案する。
まず、連続フレーム間の時間的依存関係と意味的類似性の両方を考慮してイベントを反復的に定式化するPGVS(Progressive-Grouped Video)モジュールを紹介する。
また、コンテキスト認識イベントリファインメント(CAER)モジュールを提案し、テキストのクロスアテンションを条件としたイベント表現を洗練させる。
論文 参考訳(メタデータ) (2025-06-01T08:21:45Z) - EventCrab: Harnessing Frame and Point Synergy for Event-based Action Recognition and Beyond [61.10181853363728]
イベントベースの行動認識(EAR)は、従来の行動認識と比較して、時間的・プライバシー的保護の利点がある。
EventCrabは、密集イベントフレームのための"より軽い"フレーム特化ネットワークと、スパースイベントポイントのための"より重い"ポイント特化ネットワークとを包括的に統合するフレームワークである。
4つのデータセットの実験は、提案したEventCrabの大幅なパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-11-27T13:28:57Z) - Unifying Event Detection and Captioning as Sequence Generation via
Pre-Training [53.613265415703815]
本稿では,イベント検出とキャプションのタスク間関連性を高めるための,事前学習と微調整の統合フレームワークを提案する。
我々のモデルは最先端の手法よりも優れており、大規模ビデオテキストデータによる事前学習ではさらに向上できる。
論文 参考訳(メタデータ) (2022-07-18T14:18:13Z) - Event Transformer [43.193463048148374]
イベントカメラの消費電力が低く、マイクロ秒の明るさを捉える能力は、様々なコンピュータビジョンタスクにとって魅力的である。
既存のイベント表現方法は通常、イベントをフレーム、ボクセルグリッド、ディープニューラルネットワーク(DNN)のスパイクに変換する。
この研究はトークンベースの新しいイベント表現を導入し、各イベントはイベントトークンと呼ばれる基本的な処理ユニットと見なされる。
論文 参考訳(メタデータ) (2022-04-11T15:05:06Z) - Team RUC_AIM3 Technical Report at Activitynet 2020 Task 2: Exploring
Sequential Events Detection for Dense Video Captioning [63.91369308085091]
本稿では、イベントシーケンス生成のための新規でシンプルなモデルを提案し、ビデオ中のイベントシーケンスの時間的関係を探索する。
提案モデルでは,非効率な2段階提案生成を省略し,双方向時間依存性を条件としたイベント境界を直接生成する。
総合システムは、チャレンジテストセットの9.894 METEORスコアで、ビデオタスクにおける密封イベントの最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2020-06-14T13:21:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。