論文の概要: G3Ego: Gaze-Guided Graphs for Egocentric Action Understanding
- arxiv url: http://arxiv.org/abs/2608.20157v1
- Date: Thu, 20 Aug 2026 15:15:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.623104
- Title: G3Ego: Gaze-Guided Graphs for Egocentric Action Understanding
- Title(参考訳): G3Ego:エゴセントリックなアクション理解のためのガゼガイド付きグラフ
- Abstract要約: G3Egoは、エゴセントリックなアクション理解のためのグラフベースのフレームワークである。
カメラ装着者の視線を使って無関係な物体をプルークする。
行動関連相互作用に焦点を当てた効率的かつ解釈可能な表現を生成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Egocentric action understanding is often addressed using large video models pretrained on extensive exocentric datasets. However, many first-person actions depend on a small number of hand-object interactions involving only a few relevant entities. We propose G3Ego, a graph-based framework for egocentric action understanding that uses gaze as a structural cue to identify action-relevant entities in the scene. From sparsely sampled frames, G3Ego constructs action scene graphs from vision-language descriptions, grounded objects, and hand cues, and then prunes irrelevant entities using the camera wearer's gaze. The resulting graph embeddings are temporally aggregated for action recognition and anticipation. Unlike prior work that uses gaze primarily as an auxiliary modality or attention signal, G3Ego incorporates gaze directly into graph construction, producing efficient and interpretable representations focused on action-relevant interactions. Experiments on EGTEA Gaze+ and MECCANO show that G3Ego achieves competitive performance compared with video-based approaches and consistently improves Macro-F1 under class-imbalanced evaluation, while avoiding reliance on computationally expensive video pretraining. These results demonstrate the effectiveness of gaze-guided graph representations for egocentric action understanding.
- Abstract(参考訳): エゴセントリックなアクション理解は、広範囲なエゴセントリックなデータセットで事前訓練された大きなビデオモデルを使用して対処されることが多い。
しかし、多くのファースト・パーソン・アクションは、少数の関連エンティティのみを含む少数のハンド・オブジェクト・インタラクションに依存している。
G3Egoは,視覚を構造的キューとして利用してシーン内のアクション関連エンティティを識別する,エゴセントリックな行動理解のためのグラフベースのフレームワークである。
わずかにサンプリングされたフレームから、G3Egoは視覚言語の記述、接地されたオブジェクト、手動のキューからアクションシーングラフを構築し、カメラ装着者の視線を使って無関係なエンティティをプーンする。
結果として得られるグラフ埋め込みは、行動認識と予測のために時間的に集約される。
G3Egoは、視線を主に補助モダリティや注意信号として使用する以前の研究とは異なり、視線を直接グラフ構築に組み込んで、行動関連相互作用に焦点をあてた効率的かつ解釈可能な表現を生成する。
EGTEA Gaze+ と MECCANO の実験では、G3Ego はビデオベースアプローチと比較して競争性能が向上し、計算コストのかかるビデオ事前学習への依存を回避しつつ、クラス不均衡な評価下でのマクロF1 を一貫して改善している。
これらの結果は、自我中心的な行動理解のための視線誘導グラフ表現の有効性を示す。
関連論文リスト
- Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs [10.367002095946843]
我々は、明示的で構成的で編集可能な相互作用が、リッチな活動理解にとって重要な役割を担っていると論じる。
アノテーション付きシーングラフでEgo4Dを拡張する大規模なアノテーションセットであるEgoEgoを紹介する。
また,アクティビティ駆動型グラフ編集予測(A-GEF)問題についても定式化する。
論文 参考訳(メタデータ) (2026-07-02T16:53:42Z) - From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models [67.00247936789127]
エゴセントリックビデオにおけるアクション推論は、手-対象相互作用のきめ細かい遷移を捉える必要がある。
本稿では,映像をテンポラルアクショングラフに変換することによって,視覚知覚を象徴的推論から切り離すことを提案する。
論文 参考訳(メタデータ) (2026-06-13T18:00:42Z) - OR-Action: Multi-Role Video Understanding with Fine-Grained Actions [37.96856087875045]
操作室(OR)の活動のきめ細かい理解はワークフロー認識の支援を可能にする。
現在のシーングラフ予測手法は時間構造をモデル化するのに苦労している。
本稿では,グラフベースの手法より優れた視覚のみの時間モデルを提案する。
論文 参考訳(メタデータ) (2026-06-11T13:24:40Z) - MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism [70.69809410471993]
現在のVision-Language Modelsは、フル長のビジュアルシーケンスを処理することによって、禁止されたトークンの爆発と注意の希釈を引き起こすため、数時間のビデオに苦労している。
我々はMemDreamerを導入し、知覚と推論を分離し、長いビデオ理解をエージェント探索プロセスに移行する。
MemDreamerは4つの主要なベンチマークでSOTAの結果を達成し、人間の専門家とのギャップをわずか3.7ポイントに縮める。
論文 参考訳(メタデータ) (2026-06-05T17:59:21Z) - ArtiSG: Functional 3D Scene Graph Construction via Human-demonstrated Articulated Objects Manipulation [51.54082859171464]
ArtiSGは、人間のデモを構造化されたロボットメモリにエンコードすることで、機能的な3Dシーングラフを構築するフレームワークである。
本研究では,ArtiSGが機能的要素リコールおよび調音推定精度において,ベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2025-12-31T13:10:40Z) - Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention [58.05340906967343]
Egocentric Referring Video Object (Ego-RVOS)は、言語クエリで説明されているように、人間のアクションに積極的に関与する特定のオブジェクトを、一人称ビデオに分割することを目的としている。
既存の手法はしばしば苦労し、データセット内の歪んだオブジェクト-アクションのペアリングから急激な相関を学習する。
本稿では,強力なトレーニング済みRVOSをエゴセントリックドメインに適応させるプラグイン因果フレームワークであるCausal-Referring(CERES)を紹介する。
論文 参考訳(メタデータ) (2025-12-30T16:22:14Z) - OOTSM: A Decoupled Linguistic Framework for Effective Scene Graph Anticipation [14.938566273427098]
SGA(Scene Graph Precipation)は、ビデオクリップから将来のシーングラフを予測する。
既存のSGAアプローチは視覚的手がかりを活用し、しばしば貴重なコモンセンス知識を統合するのに苦労する。
シーングラフにおけるオブジェクト,概念,関係をよりよく理解するための新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-09-06T09:35:15Z) - Action Scene Graphs for Long-Form Understanding of Egocentric Videos [23.058999979457546]
Egocentric Action Scene Graphs (EASGs) は、Egocentric Videoの長期的理解のための新しい表現である。
EASGは、カメラ装着者が行うアクションの時間的に進化したグラフベースの記述を提供する。
実験とアノテーションを複製するデータセットとコードを公開します。
論文 参考訳(メタデータ) (2023-12-06T10:01:43Z) - Iterative Graph Self-Distillation [161.04351580382078]
我々は、IGSD(Iterative Graph Self-Distillation)と呼ばれる新しい教師なしグラフ学習パラダイムを提案する。
IGSDは、グラフ拡張による教師/学生の蒸留を反復的に行う。
我々は,教師なしと半教師なしの両方の設定において,さまざまなグラフデータセットに対して,有意かつ一貫したパフォーマンス向上を実現していることを示す。
論文 参考訳(メタデータ) (2020-10-23T18:37:06Z) - Egocentric Object Manipulation Graphs [8.759425622561334]
Ego-OMGは、近い将来の行動の行動とモデリングの新たな表現である。
意味的時間構造、短期力学、外見の表現を統合している。
コードはEgo-OMGの承認を得てリリースされる。
論文 参考訳(メタデータ) (2020-06-05T02:03:25Z) - GoGNN: Graph of Graphs Neural Network for Predicting Structured Entity
Interactions [70.9481395807354]
本稿では,構造化エンティティグラフとエンティティ相互作用グラフの両方の特徴を階層的に抽出するグラフ・オブ・グラフニューラルネットワーク(GoGNN)を提案する。
GoGNNは、2つの代表的な構造化エンティティ相互作用予測タスクにおいて最先端の手法より優れている。
論文 参考訳(メタデータ) (2020-05-12T03:46:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。