論文の概要: Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation
- arxiv url: http://arxiv.org/abs/2606.04172v1
- Date: Tue, 02 Jun 2026 19:36:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-04 20:44:18.35602
- Title: Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation
- Title(参考訳): Affordance2Action:リアルタイム操作のためのタスク記述型シーンレベルのAffordance Grounding
- Authors: Litao Liu, Yifan Han, Pengfei Yi, Wenbo Yu, Hanqing Wang, Haoran Du, Enze Yuan, Zilin Yuan, Ruiding Feng, Michael Liu, Qi Zhang, Jingjin Yu,
- Abstract要約: Affordance2Action (A2A) は、シーンレベル、タスク条件付き部分割当基盤のためのベンチマーク中心の学習フレームワークである。
A2A-ベンチ(A2A-Bench)は、日常の場面における単一領域と複数領域の命令対応をカバーする操作指向のベンチマークである。
A2Aは、ジェネリックセグメンテーション、VLMベースの接地、および余剰蒸留ベースラインにおいてかなりのギャップを露呈する。
- 参考スコア(独自算出の注目度): 18.782084217347187
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Task-conditioned manipulation requires grounding instructions to task-relevant functional parts rather than object categories. This setting is scene-dependent and often one-to-many in cluttered scenes: the same object may afford different interactions across tasks, while a single task may correspond to either one functional region or multiple valid functional regions, depending on the scene layout. Existing affordance datasets and benchmarks remain misaligned with this setting, as they typically focus on grasping or object-level affordances, rely on synthetic scenes, or assume a single instruction-region correspondence. We present Affordance2Action (A2A), a benchmark-centered learning framework for scene-level, task-conditioned part affordance grounding. At its core is A2A-Bench, a manipulation-oriented benchmark that covers both single-region and multi-region instruction correspondences in everyday scenes, with the latter highlighting the ambiguity and diversity of affordance grounding in realistic multi-object environments. To construct it at scale, we build A2A-AffordGen, an agent-assisted annotation pipeline that combines language-model filtering, interactive part segmentation, instance-level mask-out refinement, task-reasoning instruction generation, and human verification. A2A-Bench's supervision further supports diverse downstream applications, with real-time affordance grounding and affordance-conditioned manipulation policies as two representative examples. Experiments show that A2A exposes substantial gaps in generic segmentation, VLM-based grounding, and affordance distillation baselines, while improving task-level localization and providing useful spatial priors for downstream manipulation. All datasets and code will be publicly released to promote open research.
- Abstract(参考訳): タスク条件の操作は、オブジェクトのカテゴリではなく、タスク関連の機能部分への接地命令を必要とする。
この設定はシーンに依存しており、多くの場合、散らかったシーンでは1対1である:同じオブジェクトはタスク間で異なるインタラクションをすることができるが、一方、ひとつのタスクはシーンレイアウトによって、1つの機能領域または複数の有効な機能領域に対応できる。
既存の割当データセットとベンチマークは、通常、把握やオブジェクトレベルの割当に焦点を当てたり、合成シーンに依存したり、単一の命令領域対応を前提にしているため、この設定と相容れないままである。
本稿では,Affordance2Action(A2A)について述べる。
中心となるA2A-Benchは、操作指向のベンチマークで、日常のシーンにおける単一リージョンと複数リージョンの命令対応の両方をカバーする。
A2A-AffordGenは,言語モデルフィルタリング,対話的部分分割,インスタンスレベルのマスクアウト改善,タスク推論命令生成,人間検証を組み合わせた,エージェント支援型アノテーションパイプラインである。
A2A-Benchの監督は、様々な下流のアプリケーションをさらにサポートし、リアルタイムの空き基盤と空き条件による操作ポリシーを2つの代表的な例として挙げている。
実験により、A2Aは、一般的なセグメンテーション、VLMベースの接地、余剰蒸留のベースラインにかなりのギャップを露呈し、タスクレベルのローカライゼーションを改善し、下流操作に有用な空間的事前を提供することが示された。
すべてのデータセットとコードは公開され、オープンな研究を促進する。
関連論文リスト
- Scene-agnostic Hierarchical Bimanual Task Planning via Visual Affordance Reasoning [5.296623863894165]
オープン環境で動作しているエージェントは、ハイレベルな命令を基底的で実行可能な動作に変換する必要がある。
本稿では,高次推論を3次元2次元実行でブリッジする,シーン非依存の双方向タスク計画のための統一的なフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-10T04:37:07Z) - ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos [44.050522958181496]
ToG-Benchは、Egoビデオのためのタスク指向固有の時間的ビデオグラウンドティングベンチマークである。
ToG-Benchは、ScanNetからソースされたビデオに基づいて、100の注釈付きクリップと2,704のタスク指向の接地命令で構成されている。
広範囲な実験により、タスク指向STVGの課題と、明示的かつ多目的的なグラウンドリングにおけるパフォーマンスギャップが明らかになる。
論文 参考訳(メタデータ) (2025-12-03T10:54:44Z) - 2HandedAfforder: Learning Precise Actionable Bimanual Affordances from Human Videos [6.562256987706128]
本研究では,人間の活動ビデオデータセットから手頃なデータを抽出するフレームワークを提案する。
本稿では,VLMに基づく価格予測モデルである2HandedAfforderを提案する。
論文 参考訳(メタデータ) (2025-03-12T12:12:07Z) - Pilot: Building the Federated Multimodal Instruction Tuning Framework [79.56362403673354]
本フレームワークは、視覚エンコーダとLCMのコネクタに「アダプタのアダプタ」の2つの段階を統合する。
ステージ1では視覚情報からタスク固有の特徴とクライアント固有の特徴を抽出する。
ステージ2では、クロスタスクインタラクションを実行するために、クロスタスクMixture-of-Adapters(CT-MoA)モジュールを構築します。
論文 参考訳(メタデータ) (2025-01-23T07:49:24Z) - Multi-Modal Domain Adaptation Across Video Scenes for Temporal Video
Grounding [59.599378814835205]
時間的ビデオグラウンドリング(TVG)は、与えられた言語クエリに基づいて、特定のセグメントの時間的境界を未トリミングビデオにローカライズすることを目的としている。
そこで本研究では,対象データからの洞察を取り入れた新たなAMDA手法を提案する。
論文 参考訳(メタデータ) (2023-12-21T07:49:27Z) - Exploring Relational Context for Multi-Task Dense Prediction [76.86090370115]
我々は,共通バックボーンと独立タスク固有のヘッドで表される,密集予測タスクのためのマルチタスク環境を考える。
マルチタスク設定では,グローバルやローカルなど,さまざまな注意に基づくコンテキストを探索する。
タスクペアごとに利用可能なすべてのコンテキストのプールをサンプリングするAdaptive Task-Relational Contextモジュールを提案する。
論文 参考訳(メタデータ) (2021-04-28T16:45:56Z) - Weakly Supervised Temporal Action Localization Through Learning Explicit
Subspaces for Action and Context [151.23835595907596]
ビデオレベルの監視のみの下で、アクションインスタンスの時間的開始と終了をローカライズする方法を学ぶ。
アクションとコンテキストそれぞれについて,2つの機能サブスペースを学習するフレームワークを提案する。
提案手法は3つのベンチマークで最先端のWS-TAL法より優れている。
論文 参考訳(メタデータ) (2021-03-30T08:26:53Z) - ACSNet: Action-Context Separation Network for Weakly Supervised Temporal
Action Localization [148.55210919689986]
アクションの正確なローカリゼーションのためにコンテキストを考慮したアクションコンテキスト分離ネットワーク(ACSNet)を紹介します。
ACSNetは、既存の最先端のWS-TALメソッドを大きなマージンで上回っています。
論文 参考訳(メタデータ) (2021-03-28T09:20:54Z) - iFAN: Image-Instance Full Alignment Networks for Adaptive Object
Detection [48.83883375118966]
iFANは、イメージレベルとインスタンスレベルの両方で、機能の分散を正確に調整することを目的としている。
ソースのみのベースライン上で10%以上のAPで、最先端のメソッドよりも優れています。
論文 参考訳(メタデータ) (2020-03-09T13:27:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。