論文の概要: EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation
- arxiv url: http://arxiv.org/abs/2608.04533v1
- Date: Wed, 05 Aug 2026 07:08:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.76948
- Title: EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation
- Title(参考訳): EgoAfford: Egocentric Referring Segmentationによるタスク指向の生産性グラウンド
- Authors: Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang,
- Abstract要約: 要素的作用に関連する機能的対象領域の局在化が進んだ。
この3つの側面を結びつけるために設計されたベンチマークであるEgoAffordを紹介します。
EgoAffordは2000の生成されたマルチステップシーンから約15.5kの人間による検証画像で構成されている。
- 参考スコア(独自算出の注目度): 40.427872905033745
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Part-level affordance grounding has advanced the localization of functional object regions associated with elemental actions. Extending this capability to complex tasks calls for connecting the semantic roles of participating objects with task-state-aligned visual observations and multi-step planning. We introduce EgoAfford, a benchmark designed to connect these three aspects. Given an egocentric observation and a high-level tabletop task, a model must generate the remaining plan and segment the functional regions of up to three components of the next action: the direct object, instrument, and destination. EgoAfford comprises approximately 15.5k human-verified images from 2,000 generated multi-step scenes, organized as semantically aligned, task-complete image series, together with EgoAfford-Real, 102 manually captured images spanning 26 tasks. We further present EgoLens, a 3B multimodal large language model with role-specific mask decoders, as an in-domain reference model for this joint task. Evaluations of recent referring-segmentation MLLMs, commercial-VLM--SAM2 pipelines, and EgoLens highlight the complementary challenges of next-step inference and action-role-conditioned part grounding. EgoLens establishes strong reference performance on both generated and manually captured observations. Together, EgoAfford and EgoLens provide a foundation for jointly studying perception and planning in multi-step tabletop tasks. Our project page is available at: https://egoafford.github.io
- Abstract(参考訳): 要素的作用に関連する機能的対象領域の局在化が進んだ。
この機能を複雑なタスクに拡張することで、参加するオブジェクトのセマンティックな役割をタスク状態に整合した視覚的観察と多段階計画に結びつけることができる。
この3つの側面を結びつけるために設計されたベンチマークであるEgoAffordを紹介します。
エゴセントリックな観察と高レベルなテーブルトップタスクが与えられた場合、モデルは残りの計画を生成し、次のアクションの最大3つのコンポーネント、すなわちダイレクトオブジェクト、インスツルメンテーション、デスティネーションの領域を分割する必要がある。
EgoAffordは、セマンティックに整列したタスク完備なイメージシリーズとして組織された2000の生成されたマルチステップシーンから、約15.5kの人間による検証画像で構成され、EgoAfford-Realは、26のタスクにまたがる102の手動でキャプチャされた画像で構成されている。
さらに、この共同作業のためのドメイン内参照モデルとして、ロール固有のマスクデコーダを備えた3Bマルチモーダルな大規模言語モデルであるEgoLensを提示する。
最近の参照セグメンテーションMLLM、商用VLM-SAM2パイプライン、EgoLensの評価は、次のステップ推論とアクションロール条件付き部分グラウンドディングの相補的な課題を強調している。
EgoLensは、生成された観測と手動による観測の両方に対して、強力な参照パフォーマンスを確立する。
EgoAffordとEgoLensは共に、マルチステップテーブルトップタスクにおける知覚と計画を共同で研究するための基盤を提供する。
私たちのプロジェクトページは、https://egoafford.github.ioで公開されています。
関連論文リスト
- Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation [18.782084217347187]
Affordance2Action (A2A) は、シーンレベル、タスク条件付き部分割当基盤のためのベンチマーク中心の学習フレームワークである。
A2A-ベンチ(A2A-Bench)は、日常の場面における単一領域と複数領域の命令対応をカバーする操作指向のベンチマークである。
A2Aは、ジェネリックセグメンテーション、VLMベースの接地、および余剰蒸留ベースラインにおいてかなりのギャップを露呈する。
論文 参考訳(メタデータ) (2026-06-02T19:36:13Z) - ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos [44.050522958181496]
ToG-Benchは、Egoビデオのためのタスク指向固有の時間的ビデオグラウンドティングベンチマークである。
ToG-Benchは、ScanNetからソースされたビデオに基づいて、100の注釈付きクリップと2,704のタスク指向の接地命令で構成されている。
広範囲な実験により、タスク指向STVGの課題と、明示的かつ多目的的なグラウンドリングにおけるパフォーマンスギャップが明らかになる。
論文 参考訳(メタデータ) (2025-12-03T10:54:44Z) - Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025 [93.36604217487526]
ある視点からオブジェクトクエリーが与えられた場合、ゴールは別の視点で対応するオブジェクトマスクを予測することである。
この課題に対処するために,オブジェクトのローカライゼーションを強化するマルチモーダル条件融合モジュールを提案する。
提案手法は,大規模Ego-Exo4Dオブジェクト対応ベンチマークにおいて,第2位にランクインした。
論文 参考訳(メタデータ) (2025-06-06T08:23:39Z) - InstructPart: Task-Oriented Part Segmentation with Instruction Reasoning [48.455643602907934]
実世界の新しいベンチマークであるInstructPartを導入し、現在のモデルの性能を評価し、部分レベルのタスクの理解と実行を行う。
現状のビジョン・ランゲージモデルにおいても,タスク指向の部分分割は依然として困難な問題であることを示す。
論文 参考訳(メタデータ) (2025-05-23T18:36:13Z) - ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives [109.11714588441511]
Ego-Exoオブジェクト対応タスクは,セグメンテーションを通じて,ego-Exoパースペクティブ間のオブジェクト関係を理解することを目的としている。
最近提案されたセグメンテーション手法であるPSALMは、このタスクでデモされたゼロショット能力を例外として挙げている。
我々は、マルチモーダルコンディションフュージョンとSSLベースのクロスビューオブジェクトアライメントという、2つの重要なモジュールを特徴とする新しいアプローチであるObjectRelatorを提案する。
論文 参考訳(メタデータ) (2024-11-28T12:01:03Z) - Multi-interactive Feature Learning and a Full-time Multi-modality
Benchmark for Image Fusion and Segmentation [66.15246197473897]
多モード画像融合とセグメンテーションは、自律走行とロボット操作において重要な役割を果たす。
画像融合とtextbfSegmentation のための textbfMulti-textbfinteractive textbfFeature Learning アーキテクチャを提案する。
論文 参考訳(メタデータ) (2023-08-04T01:03:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。