論文の概要: EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes
- arxiv url: http://arxiv.org/abs/2607.00547v1
- Date: Wed, 01 Jul 2026 07:39:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.780774
- Title: EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes
- Title(参考訳): EgoGapBench: マルチエージェントシーンにおけるエゴセントリックアクション選択のベンチマーク
- Authors: Jihyeok Jung, Jeewu Lee, Sanghyeop Kim, Chanhee Han, Seong Joon Oh,
- Abstract要約: EgoGapBenchは、マルチエージェントのエゴセントリックシーンにおけるアクション選択を測定するための診断ベンチマークである。
EgoGapBenchでは、人間が確実に答える一方、オープンソースのMLLMとプロプライエタリなMLLMはどちらも、かなり悪いパフォーマンスをしている。
既存のエゴセントリックなデータの微調整は、このギャップを埋めることに失敗し、有害である可能性さえある。
- 参考スコア(独自算出の注目度): 17.70562456225446
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing egocentric benchmarks have primarily constructed the egocentric setting from first-person-view data, which makes it difficult to evaluate egocentric perspective itself in isolation. However, understanding first-person-view input and taking an egocentric perspective are separable abilities, especially when first-person body cues are absent or when other agents are present. To isolate egocentric perspective understanding, we introduce EgoGapBench, a diagnostic benchmark for measuring action selection in multi-agent egocentric scenes. We define the ability measured by this benchmark as Egocentric Action Selection (EAS): selecting an appropriate action from the agent's perspective in the presence of other agents. On EgoGapBench, humans answer reliably, whereas both open-source and proprietary MLLMs perform substantially worse and systematically select actions performed by other visible agents. Fine-tuning on existing egocentric data fails to close this gap and can even be detrimental. In contrast, fine-tuning on EgoGapBench training data improves accuracy but does not reach human performance. These results show that EAS is difficult to acquire from first-person-view data alone, and that MLLMs should be evaluated and trained not only for scene understanding but also for egocentric action selection.
- Abstract(参考訳): 既存のエゴセントリックなベンチマークは、主に1対1のデータからエゴセントリックな設定を構築しており、エゴセントリックな視点自体を独立に評価することは困難である。
しかし、一対一の視点を理解し、自我中心の視点を取ることは、特に一対一の身体的手がかりが欠如している場合や、他のエージェントが存在する場合、分離可能な能力である。
エゴセントリックな視点理解を分離するために,マルチエージェントのエゴセントリックなシーンにおける行動選択を測定するための診断ベンチマークであるEgoGapBenchを紹介する。
我々は、このベンチマークによって測定された能力を、エージェントが他のエージェントの存在下で適切なアクションを選択するEgocentric Action Selection (EAS)として定義する。
EgoGapBenchでは、人間が確実に答える一方、オープンソースのMLLMとプロプライエタリなMLLMは、他の可視エージェントによって実行される行動を大幅に悪化させ、体系的に選択する。
既存のエゴセントリックなデータの微調整は、このギャップを埋めることに失敗し、有害である可能性さえある。
対照的に、EgoGapBenchトレーニングデータの微調整は精度を向上するが、人間のパフォーマンスには達しない。
これらの結果から,一対一の視点データのみからEASを取得することは困難であり,シーン理解だけでなく,自我中心の行動選択にもMLLMを評価・訓練すべきであることが示唆された。
関連論文リスト
- EgoExo-WM: Unlocking Exo Video for Ego World Models [59.337519140691775]
エゴセントリックな世界モデルはエージェントの予測と計画を可能にする有望な方向性を示す。
外心ビデオは豊富で、身体のポーズは良好だが、エージェントのアクション空間と直接的に一致していない。
本稿では,このギャップを埋めるために,アクションの表現として,外心ビデオから構造体ポーズを抽出する手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T23:35:54Z) - Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention [58.05340906967343]
Egocentric Referring Video Object (Ego-RVOS)は、言語クエリで説明されているように、人間のアクションに積極的に関与する特定のオブジェクトを、一人称ビデオに分割することを目的としている。
既存の手法はしばしば苦労し、データセット内の歪んだオブジェクト-アクションのペアリングから急激な相関を学習する。
本稿では,強力なトレーニング済みRVOSをエゴセントリックドメインに適応させるプラグイン因果フレームワークであるCausal-Referring(CERES)を紹介する。
論文 参考訳(メタデータ) (2025-12-30T16:22:14Z) - EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT [56.24624833924252]
EgoThinkerは、時間的連鎖管理と2段階の学習カリキュラムを通じて、堅牢なエゴセントリック推論能力を備えたMLを支援するフレームワークである。
EgoThinkerは、複数のエゴセントリックなベンチマークで既存のメソッドよりも優れており、微粒な時間的ローカライゼーションタスクで大幅に改善されている。
論文 参考訳(メタデータ) (2025-10-27T17:38:17Z) - Egocentric Human-Object Interaction Detection: A New Benchmark and Method [15.271558280695631]
エゴセントリック・ヒューマン・オブジェクト・インタラクション(Egocentric Human-ject Interaction, Ego-HOI)の検出は、知的エージェントが人間の活動を理解し、支援する上で重要である。
実世界のEgo-HOI検出タスクとEgo-HOIBenchを紹介した。
ハンドポーズと幾何学的手がかりを利用して対話表現を強化する軽量なプラグアンドプレイ方式であるハンドジオメトリとインターアクティブリファインメント(HGIR)を提案する。
論文 参考訳(メタデータ) (2025-06-17T05:03:42Z) - Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding [69.96199605596138]
現在のMLLMは、主に第三者(外見中心)のビジョンに焦点を当てており、一対一(自我中心)の動画のユニークな側面を見下ろしている。
本研究では,エゴ中心領域とエゴ中心領域のマッピングを学習し,エゴ中心領域の理解を高めることを提案する。
Ego-ExoClipは1.1M同期のEgo-Exoクリップテキストペアからなる事前学習データセットである。
論文 参考訳(メタデータ) (2025-03-12T08:10:33Z) - EgoMe: A New Dataset and Challenge for Following Me via Egocentric View in Real World [12.699670048897085]
人間の模倣学習において、模倣者は、通常、自我中心の視点を基準として、自我中心の視点から自我中心の視点に観察された振る舞いを自然に伝達する。
実世界における模倣者の自我中心的な視点を通じて、人間の模倣学習のプロセスに従うためのEgoMeを紹介する。
我々のデータセットには7902対のエゴビデオが含まれており、様々な現実のシナリオにおいて多様な日々の行動にまたがっている。
論文 参考訳(メタデータ) (2025-01-31T11:48:22Z) - EgoPet: Egomotion and Interaction Data from an Animal's Perspective [82.7192364237065]
本稿では,同時行動とマルチエージェントインタラクションの多様な例を含む,ペットの情緒的イメージのデータセットを紹介する。
EgoPetは、既存の人間や車両のエゴセントリックなデータセットとは根本的に異なる視点を提供する。
動物行動を把握する2つのドメイン内ベンチマークタスクと、ロボット四足歩行のための事前学習リソースとしてEgoPetの有用性を評価するための第3のベンチマークを定義する。
論文 参考訳(メタデータ) (2024-04-15T17:59:47Z) - Ego-Only: Egocentric Action Detection without Exocentric Transferring [37.89647493482049]
Ego-Onlyは,エゴセントリックな(ファーストパーソナリティー)ビデオに対して,最先端のアクション検出を可能にする最初のアプローチである。
論文 参考訳(メタデータ) (2023-01-03T22:22:34Z) - Ego-Exo: Transferring Visual Representations from Third-person to
First-person Videos [92.38049744463149]
大規模第3者映像データセットを用いた自己中心型映像モデルの事前訓練手法について紹介する。
私たちのアイデアは、重要なエゴセントリック特性を予測する第三者ビデオから潜在信号を見つけることです。
実験の結果,Ego-Exoフレームワークは標準ビデオモデルにシームレスに統合可能であることがわかった。
論文 参考訳(メタデータ) (2021-04-16T06:10:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。