論文の概要: LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension
- arxiv url: http://arxiv.org/abs/2607.02096v1
- Date: Thu, 02 Jul 2026 12:32:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.828465
- Title: LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension
- Title(参考訳): LongEgoRefer: 長めのEgocentric Video Referring Expression Comprehensionのベンチマーク
- Abstract要約: LongEgoReferは、Ego4Dデータセットのロングフォームビデオから構築された新しいベンチマークである。
詳細な言語記述と、長い、ダイナミックなエゴセントリックな物語に埋め込まれた複雑な人間とオブジェクトの相互作用を示す。
それは、イベントが発生したときと、参照対象が拡張されたビデオシーケンス内に現れる場所の両方をモデルが識別する必要がある、要求のある時間的接地問題を定義する。
- 参考スコア(独自算出の注目度): 41.229006294351315
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Egocentric videos capture rich and diverse human-object interactions and have emerged as a fundamental resource for understanding human activities related to objects. In this context, Video Referring Expression Comprehension (Video REC), the task of localizing the temporal and spatial extent of a referred object in video frames given a natural language query, plays a key role in linking textual descriptions to observed objects in untrimmed egocentric recordings. However, existing egocentric Video REC benchmarks primarily focus on short video clips, where some target object appears densely within frames. Such settings do not reflect real-world egocentric recordings, which are long-form, untrimmed, and characterized by sparse object occurrences and complex activity transitions. To address this limitation, we introduce LongEgoRefer, a novel and challenging benchmark constructed from long-form videos in the Ego4D dataset. LongEgoRefer contains 1,498 referring expressions with an average video duration of 45 minutes. The benchmark exhibits extreme target sparsity, detailed linguistic descriptions, and complex human-object interactions embedded in long, dynamic egocentric narratives. Consequently, it defines a demanding spatio-temporal grounding problem that requires models to identify both when an event occurs and where the referred object appears within extended video sequences. We evaluate existing Video REC approaches, including training-free baselines based on vision-language models combined with Grounded SAM2. Extensive experiments show that even advanced baselines and current state-of-the-art models struggle significantly on LongEgoRefer. These results highlight the intrinsic difficulty of long-form egocentric spatio-temporal grounding and emphasize the need for more robust video understanding models.
- Abstract(参考訳): エゴセントリックなビデオは、リッチで多様な人間とオブジェクトの相互作用を捉え、オブジェクトに関連する人間の活動を理解するための基本的なリソースとして登場した。
この文脈では、ビデオ参照表現理解(Video Referring Expression Comprehension, Video REC)は、自然言語クエリが与えられたビデオフレームにおいて、参照対象の時間的および空間的範囲をローカライズするタスクであり、非トリミングエゴセントリックな記録における観察対象へのテキスト記述のリンクにおいて重要な役割を果たす。
しかし、既存のegocentric Video RECベンチマークは主にショートビデオクリップに焦点を当てており、いくつかのターゲットオブジェクトはフレーム内に密に表示される。
このような設定は、長い形式の、トリミングされていない、スパースオブジェクトの発生と複雑な活動遷移を特徴とする実世界の自我中心的な記録を反映しない。
この制限に対処するために、Ego4Dデータセットの長文ビデオから構築された、新しくて挑戦的なベンチマークであるLongEgoReferを紹介します。
LongEgoReferには1,498の参照式があり、平均ビデオ時間は45分である。
このベンチマークは、極端に標的の空間性、詳細な言語記述、そして長い、ダイナミックなエゴセントリックな物語に埋め込まれた複雑な人間とオブジェクトの相互作用を示す。
その結果、イベントの発生時期と、参照対象が拡張されたビデオシーケンス内に現れる場所の両方をモデルが識別する必要がある、需要のある時空間グラウンド化問題を定義する。
映像言語モデルとGrounded SAM2を併用したトレーニング不要のベースラインを含む既存のビデオREC手法の評価を行った。
大規模な実験では、先進的なベースラインや現在の最先端モデルでさえ、LongEgoReferでかなり苦労している。
これらの結果は,長期的自我中心の時空間接地における本質的な難しさを強調し,より堅牢な映像理解モデルの必要性を強調した。
関連論文リスト
- Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs [12.707862116540914]
Egocentric Scene Graphs (EgoSGs) を通じてこれらの入力制約を克服するEgocentric Video Question answering (VQA) フレームワークを提案する。
動画をコンパクトでテキストベースのシーングラフとして表現することにより,オリジナル映像の視覚的・時間的情報をシンボル形式で保存する。
提案手法は,HD-EPIC VQAにおいて,複数のモデルに対する高画質映像ベースラインよりも高い性能を実現している。
論文 参考訳(メタデータ) (2026-06-24T13:55:45Z) - EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding [11.51428438970598]
EgoGraphはトレーニング不要でダイナミックな知識グラフ構築フレームワークで、エゴセントリックなビデオストリームにおける長期的、横断的な依存関係を明示的にエンコードする。
本研究では,エンティティ間の時間的依存を捕捉し,複数日間にわたって安定した長期記憶を蓄積し,複雑な時間的推論を可能にする時間的関係モデリング戦略を開発する。
論文 参考訳(メタデータ) (2026-02-27T06:20:58Z) - Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data [100.5266292850922]
Streferはビデオ大モデルに参照と推論機能を持たせるために設計された合成データ生成フレームワークである。
Streferは、時間的に密度が高くきめ細かなビデオメタデータを擬似アノテーションするデータエンジンを使用して、多様な命令生成データを生成する。
我々のアプローチは、ビデオLLMが空間的および時間的参照を解釈する能力を高め、現実のAIコンパニオンに不可欠な、より汎用的で時空間対応の推論を育む。
論文 参考訳(メタデータ) (2025-09-03T17:33:20Z) - Fine-grained Spatiotemporal Grounding on Egocentric Videos [13.319346673043286]
EgoMaskは、エゴセントリックビデオの微細時間グラウンド化のための最初のピクセルレベルのベンチマークである。
EgoMaskは、式やオブジェクトマスクを参照するアノテーションパイプラインによって構築されている。
また、モデル開発を容易にする大規模なトレーニングデータセットであるEgoMask-Trainも作成しています。
論文 参考訳(メタデータ) (2025-08-01T10:53:27Z) - Infinite Video Understanding [50.78256932424239]
Infinite Video Understandingをブルースキー研究の目的とするフレーミングは、マルチメディアにとって重要な北の星となると我々は主張する。
我々は、この変革能力を達成するための主要な課題と研究の方向性を概説する。
論文 参考訳(メタデータ) (2025-07-11T23:07:04Z) - Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation [51.2732688481343]
本稿では,長期参照オブジェクトセグメンテーションのための大規模ベンチマークであるLongtextbf-RVOSを紹介する。
Long-RVOSには、平均時間60秒を超える2,000以上のビデオが含まれており、さまざまなオブジェクトをカバーしている。
フレーム単位の空間評価にのみ依存する従来のベンチマークとは異なり、時間的・時間的整合性を評価するために2つの指標を導入する。
論文 参考訳(メタデータ) (2025-05-19T04:52:31Z) - X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding [25.85614872348223]
ロングフォームなエゴセントリックなビデオ理解は、コンテキスト情報と長期的な人間の行動に関する洞察を提供する。
既存のベンチマークデータセットは、主に、単一、短調のビデオ、あるいは適度に長いビデオに焦点を当てている。
X-LeBenchは、極端に長いエゴセントリックなビデオ録画のタスクを評価するために特別に作られた、新しいベンチマークデータセットである。
論文 参考訳(メタデータ) (2025-01-12T15:07:03Z) - VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM [81.15525024145697]
ビデオ大言語モデル (Video Large Language Models, ビデオLLM) は近年, 一般的なビデオ理解において顕著な能力を示した。
しかし、それらは主に全体論的理解に焦点を当て、きめ細かい空間的・時間的詳細を捉えるのに苦労している。
我々は,高精細度空間時間映像理解のためのビデオLLMを実現するために,VideoRefer Suiteを導入した。
論文 参考訳(メタデータ) (2024-12-31T18:56:46Z) - SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis [52.050036778325094]
本稿では,SALOVA: Segment-Augmented Video Assistantを紹介する。
87.8Kビデオの高品質なコレクションをセグメントレベルで高密度にキャプションし、シーンの連続性を捕捉し、リッチなコンテキストを維持する。
本フレームワークは,クエリに応答して,関連ビデオセグメントの正確な識別と検索を可能にすることで,現在のビデオLMMの限界を緩和する。
論文 参考訳(メタデータ) (2024-11-25T08:04:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。