論文の概要: Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs
- arxiv url: http://arxiv.org/abs/2607.02425v1
- Date: Thu, 02 Jul 2026 16:53:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.935328
- Title: Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs
- Title(参考訳): シーンを進化させるための学習:シーングラフを用いた人間活動の推論
- Abstract要約: 我々は、明示的で構成的で編集可能な相互作用が、リッチな活動理解にとって重要な役割を担っていると論じる。
アノテーション付きシーングラフでEgo4Dを拡張する大規模なアノテーションセットであるEgoEgoを紹介する。
また,アクティビティ駆動型グラフ編集予測(A-GEF)問題についても定式化する。
- 参考スコア(独自算出の注目度): 10.367002095946843
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding human behavior while interacting with the surrounding world is crucial for many applications of embodied AI. First-person videos are particularly informative for this problem, as they well capture how activities reshape the scene over time. However, existing approaches often rely on implicit visual or language-aligned representations, disregarding structured reasoning over the scene dynamic. We argue that explicit, compositional and editable representations of human-environment interactions can play a crucial role for rich grounded activity understanding. To this end, we introduce SG-Ego, a large scale annotation set extending Ego4D with spatio-temporal scene graphs, where relations triplets are consolidated over time into explicit time-evolving descriptions of the scene state. To reason over this representation, we propose GLEN, a graph-based model that operates over scene graph sequences to both align them with textual actions and model their temporal evolution. In addition, we formulate the activity-driven graph-edit forecasting (A-GEF) problem, a novel task that casts scene dynamics as a sequence of structured transformations conditioned on ongoing actions, enabling explicit reasoning about how scenes change over time. We validate our approach across multiple downstream tasks, spanning retrieval benchmarks as EgoMCQ and EgoCVR, as well as long-horizon reasoning benchmarks as EXPLORE-Bench and the newly introduced A-GEF. GLEN achieves strong results compared to raw video baselines and it excels in reasoning settings, typically addressed only with MLLMs, while enabling controllable and structured predictions of scene dynamics driven by human activities. We believe our results establish spatio-temporal scene graphs, together with models that reason over them, as strong compositional and interpretable representations for video understanding and potentially beyond.
- Abstract(参考訳): 周囲の世界と対話しながら人間の行動を理解することは、具体化されたAIの多くの応用にとって不可欠である。
ファースト・パーソナライズド・ビデオは特にこの問題に対して有益であり、アクティビティが時間とともにどのようにシーンを再構築するかをうまく捉えている。
しかし、既存のアプローチは、しばしば暗黙の視覚的あるいは言語に沿った表現に依存し、シーンのダイナミックさに対する構造化推論を無視している。
我々は、人間-環境相互作用の明示的で構成的で編集可能な表現が、豊かな活動理解にとって重要な役割を担っていると論じる。
この目的のために,SG-Egoという大規模アノテーションセットを導入し,時間とともに関係トリガが統合されてシーン状態の明示的な時間進化記述を行う。
この表現を推論するために,シーングラフのシーケンス上で動作し,それらとテキストの動きを一致させ,その時間的進化をモデル化するグラフベースモデルGLENを提案する。
さらに,アクティビティ駆動型グラフ編集予測(A-GEF)問題を定式化し,現在進行中の動作に条件付けられた構造化変換のシーケンスとしてシーンダイナミクスをキャストし,時間とともにどのように変化するかを明確に推論する。
EgoMCQ や EgoCVR などの検索ベンチマークや EXPLORE-Bench や新たに導入された A-GEF などの長距離推論ベンチマークなど,複数のダウンストリームタスクにまたがるアプローチを検証する。
GLENは生のビデオベースラインと比較して強い結果を出し、MLLMでのみ対処される推論設定に優れ、人間の活動によって駆動されるシーンダイナミクスの制御可能で構造化された予測を可能にする。
我々は,映像理解のための強い構成的,解釈可能な表現として,時空間のシーングラフとそれらに対する推論モデルを構築した。
関連論文リスト
- From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models [67.00247936789127]
エゴセントリックビデオにおけるアクション推論は、手-対象相互作用のきめ細かい遷移を捉える必要がある。
本稿では,映像をテンポラルアクショングラフに変換することによって,視覚知覚を象徴的推論から切り離すことを提案する。
論文 参考訳(メタデータ) (2026-06-13T18:00:42Z) - OR-Action: Multi-Role Video Understanding with Fine-Grained Actions [37.96856087875045]
操作室(OR)の活動のきめ細かい理解はワークフロー認識の支援を可能にする。
現在のシーングラフ予測手法は時間構造をモデル化するのに苦労している。
本稿では,グラフベースの手法より優れた視覚のみの時間モデルを提案する。
論文 参考訳(メタデータ) (2026-06-11T13:24:40Z) - InstrAct: Towards Action-Centric Understanding in Instructional Videos [12.356484522873577]
InstrActionは、インストラクショナルビデオのアクション中心表現のための事前トレーニングフレームワークである。
まず、ノイズの多いキャプションをフィルタリングし、アクション中心のハードネガティブを生成する、データ駆動型戦略を導入する。
視覚的特徴レベルでは、Action Perceiverは、冗長なビデオエンコーディングからモーション関連トークンを抽出する。
論文 参考訳(メタデータ) (2026-04-09T20:51:13Z) - Local-Global Information Interaction Debiasing for Dynamic Scene Graph
Generation [51.92419880088668]
マルチタスク学習に基づく新しいDynSGGモデルDynSGG-MTLを提案する。
長期的人間の行動は、大域的な制約に適合する複数のシーングラフを生成するためにモデルを監督し、尾の述語を学べないモデルを避ける。
論文 参考訳(メタデータ) (2023-08-10T01:24:25Z) - Cross-Modality Time-Variant Relation Learning for Generating Dynamic
Scene Graphs [16.760066844287046]
動的シーングラフにおける関係の時間的変化をモデル化するために,時間変動型関係対応TRansformer (TR$2$)を提案する。
TR$2$は2つの異なる設定下で従来の最先端メソッドよりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2023-05-15T10:30:38Z) - Learning Action-Effect Dynamics from Pairs of Scene-graphs [50.72283841720014]
本稿では,画像のシーングラフ表現を利用して,自然言語で記述された行動の効果を推論する手法を提案する。
提案手法は,既存のモデルと比較して,性能,データ効率,一般化能力の点で有効である。
論文 参考訳(メタデータ) (2022-12-07T03:36:37Z) - Scene Graph Modification as Incremental Structure Expanding [61.84291817776118]
本研究では,既存のシーングラフを自然言語クエリに基づいて更新する方法を学習するために,シーングラフ修正(SGM)に注目した。
インクリメンタル構造拡張(ISE)の導入によるグラフ拡張タスクとしてのSGM
既存のデータセットよりも複雑なクエリと大きなシーングラフを含む、挑戦的なデータセットを構築します。
論文 参考訳(メタデータ) (2022-09-15T16:26:14Z) - Trajectory Forecasting on Temporal Graphs [0.0]
現場におけるエージェントの将来の位置を予測することは、自動運転車にとって重要な問題である。
本稿では,交通シーンのダイナミックスをよりよく捉えるための時間グラフ表現を提案する。
我々はArgoverseベンチマークで最先端のパフォーマンスに到達できるより良い結果を示す。
論文 参考訳(メタデータ) (2022-07-01T08:11:22Z) - SGEITL: Scene Graph Enhanced Image-Text Learning for Visual Commonsense
Reasoning [61.57887011165744]
マルチモーダルトランスフォーマーはVisual Commonsense Reasoningのタスクにおいて大きな進歩を遂げた。
視覚的なシーングラフを常識的推論に組み込むためのScene Graph Enhanced Image-Text Learningフレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-16T03:16:30Z) - Unified Graph Structured Models for Video Understanding [93.72081456202672]
リレーショナル・テンポラル関係を明示的にモデル化するメッセージパッシンググラフニューラルネットワークを提案する。
本手法は,シーン内の関連エンティティ間の関係をより効果的にモデル化できることを示す。
論文 参考訳(メタデータ) (2021-03-29T14:37:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。