論文の概要: Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs
- arxiv url: http://arxiv.org/abs/2606.25842v2
- Date: Thu, 02 Jul 2026 12:05:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 22:14:13.467194
- Title: Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs
- Title(参考訳): グラフを最初に! ロングフォームなエゴセントリックな動画をScene Graphsで再現する
- Abstract要約: Egocentric Scene Graphs (EgoSGs) を通じてこれらの入力制約を克服するEgocentric Video Question answering (VQA) フレームワークを提案する。
動画をコンパクトでテキストベースのシーングラフとして表現することにより,オリジナル映像の視覚的・時間的情報をシンボル形式で保存する。
提案手法は,HD-EPIC VQAにおいて,複数のモデルに対する高画質映像ベースラインよりも高い性能を実現している。
- 参考スコア(独自算出の注目度): 12.707862116540914
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing multi-modal large language models (MLLMs) face significant challenges in processing long video sequences due to strict input token limitations. As a result, current video understanding approaches, especially in egocentric settings characterized by complex dynamics, frequent state changes, and moving cameras, are forced to massively subsample frames. This leads to severe loss of temporal and contextual information, constraining their ability to perform fine-grained video reasoning. In this work, we introduce a framework for egocentric video question answering (VQA) that overcomes these input constraints through Egocentric Scene Graphs (EgoSGs), i.e., temporally grounded, structured representations that capture objects, attributes, spatial relations, and interactions over time. By representing videos as compact, text-based scene graphs, our method preserves the essential visual and temporal information of the original video in a symbolic form that drastically reduces input length while maintaining semantic richness. Crucially, this enables MLLMs to reason efficiently over entire video sequences within their token budget. On HD-EPIC VQA, our method achieves state-of-the-art results, outperforming strong video-based baselines on multiple models and suggesting that structured, temporally grounded representations like EgoSGs can bridge long-form egocentric video understanding and the context limitations of today's MLLMs.
- Abstract(参考訳): 既存のマルチモーダル大言語モデル(MLLM)は、厳密な入力トークン制限のため、長いビデオシーケンスを処理する上で大きな課題に直面している。
その結果、現在のビデオ理解アプローチ、特に複雑なダイナミックス、頻繁な状態変化、移動カメラを特徴とするエゴセントリックな設定では、フレームを大々的にサブサンプル化せざるを得なくなった。
これにより、時間的・文脈的な情報が著しく失われ、きめ細かいビデオ推論を行う能力が制限される。
本研究では,これらの制約をEgocentric Scene Graphs (EgoSGs) を通じて克服する,Egocentric Video question answering (VQA) のためのフレームワークを提案する。
動画をコンパクトでテキストベースのシーングラフとして表現することにより,意味豊かさを維持しつつ,入力長を大幅に削減する象徴的な形態で,オリジナル映像の視覚的・時間的情報を保存する。
重要なことに、MLLMはトークンの予算内で、ビデオシーケンス全体を効率的に推論することができる。
提案手法は,HD-EPIC VQAにおいて,複数のモデル上で強力な映像ベースラインを達成し,EgoSGsのような構造的,時間的基盤を持つ表現が,長めのエゴセントリックな映像理解と,今日のMLLMのコンテキスト制限を橋渡しできることを示す。
関連論文リスト
- EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding [11.51428438970598]
EgoGraphはトレーニング不要でダイナミックな知識グラフ構築フレームワークで、エゴセントリックなビデオストリームにおける長期的、横断的な依存関係を明示的にエンコードする。
本研究では,エンティティ間の時間的依存を捕捉し,複数日間にわたって安定した長期記憶を蓄積し,複雑な時間的推論を可能にする時間的関係モデリング戦略を開発する。
論文 参考訳(メタデータ) (2026-02-27T06:20:58Z) - Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding [56.45689495743107]
Vgentは、長いビデオ理解のためにLVLMを強化するグラフベースの検索推論拡張生成フレームワークである。
我々は,3つの長ビデオ理解ベンチマークを用いて,様々なオープンソースLVLMを用いてフレームワークの評価を行った。
論文 参考訳(メタデータ) (2025-10-15T19:14:58Z) - Time-Scaling State-Space Models for Dense Video Captioning [29.405515743544687]
転送状態を持つ状態空間モデル(State-Space Models with Transfer State)は、高密度ビデオキャプションのための時間スケーリングモデルである。
フルビデオが処理されるのを待つことなく、オンラインまたはストリーミングでキャプションをオンザフライで生成するのに適している。
ビデオキャプションの高密度化に際し,本手法はビデオ長とともに拡張可能であり,FLOPは7倍少ない。
論文 参考訳(メタデータ) (2025-09-03T15:56:20Z) - When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding [12.410012029024342]
我々は,3つの重要なイノベーションを導入することで,制限を克服するビデオLLMであるGrounded VideoDiTを紹介する。
第一に、拡散時間遅延(DTL)エンコーダは境界感度を高め、時間的一貫性を維持する。
第二に、オブジェクト基底表現は、クエリエンティティを局所化された視覚的エビデンスに明示的に結合し、アライメントを強化する。
第三に、離散時間的タイムスタンプトークンを持つ混合トークンスキームは明示的なモデリングを提供し、きめ細かい時間的推論を可能にする。
論文 参考訳(メタデータ) (2025-08-21T15:12:14Z) - Episodic Memory Representation for Long-form Video Understanding [52.33907540905242]
大きなビデオ言語モデルは、一般的なビデオ理解において優れているが、長い形式のコンテキストウィンドウの制限に苦労する。
人間の記憶の原理にインスパイアされたトレーニングフリーのフレームワークであるVideo-EMを紹介する。
Video-EMでは、各ベースラインに対して4-9%のパフォーマンス向上を実現し、フレームの削減を実現している。
論文 参考訳(メタデータ) (2025-08-13T04:33:07Z) - RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph [3.1671311914949545]
RAVUは、時間グラフ上の推論による検索によるビデオ強化理解のためのフレームワークである。
我々は,エンティティ間の空間的および時間的関係の両方をキャプチャーするグラフ表現を構築した。
複雑なクエリに答えるために、クエリを推論ステップのシーケンスに分解し、グラフ上でこれらのステップを実行する。
提案手法により,長いビデオのより正確な理解が可能となり,特にフレーム間のマルチホップ推論やオブジェクトの追跡を必要とするクエリに対して有効である。
論文 参考訳(メタデータ) (2025-05-06T04:38:09Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding [65.46303012350207]
LongVUは、長いビデオの視覚的詳細を保存しながら、ビデオトークンの数を減らす適応圧縮機構である。
DINOv2の機能を利用して、高い類似性を示す冗長なフレームを削除します。
時間的依存関係に基づいて,フレーム間の空間トークン削減を行う。
論文 参考訳(メタデータ) (2024-10-22T21:21:37Z) - Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models [53.235170710385006]
我々は,特定の映像モーメントをきめ細かな方法で知覚・推論できる新しいビデオLLMであるGrounded-VideoLLMを紹介した。
我々は,(1)フレーム間の関係を符号化する追加の時間的ストリームと(2)特定の時間的知識に富んだ離散的な時間的トークンを組み込むことで,モデルを洗練する。
実験では, 時間文の接地, ビデオキャプションの密接化, ビデオQAの接地といった, きめ細かい接地作業に優れていた。
論文 参考訳(メタデータ) (2024-10-04T10:04:37Z) - Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization [52.63845811751936]
ダイナミックスビデオのモデリングのため、ビデオ事前トレーニングは難しい。
本稿では,ビデオ事前学習におけるこのような制限を,効率的なビデオ分解によって解決する。
筆者らのフレームワークは,13のマルチモーダルベンチマークにおいて,画像と映像のコンテントの理解と生成が可能であることを実証した。
論文 参考訳(メタデータ) (2024-02-05T16:30:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。