論文の概要: Scene-agnostic Hierarchical Bimanual Task Planning via Visual Affordance Reasoning
- arxiv url: http://arxiv.org/abs/2512.09310v1
- Date: Wed, 10 Dec 2025 04:37:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:40.249445
- Title: Scene-agnostic Hierarchical Bimanual Task Planning via Visual Affordance Reasoning
- Title(参考訳): 視覚的アフォーマンス推論によるシーン非依存的階層的二元的タスク計画
- Authors: Kwang Bin Lee, Jiho Kang, Sung-Hee Lee,
- Abstract要約: オープン環境で動作しているエージェントは、ハイレベルな命令を基底的で実行可能な動作に変換する必要がある。
本稿では,高次推論を3次元2次元実行でブリッジする,シーン非依存の双方向タスク計画のための統一的なフレームワークを提案する。
- 参考スコア(独自算出の注目度): 5.296623863894165
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied agents operating in open environments must translate high-level instructions into grounded, executable behaviors, often requiring coordinated use of both hands. While recent foundation models offer strong semantic reasoning, existing robotic task planners remain predominantly unimanual and fail to address the spatial, geometric, and coordination challenges inherent to bimanual manipulation in scene-agnostic settings. We present a unified framework for scene-agnostic bimanual task planning that bridges high-level reasoning with 3D-grounded two-handed execution. Our approach integrates three key modules. Visual Point Grounding (VPG) analyzes a single scene image to detect relevant objects and generate world-aligned interaction points. Bimanual Subgoal Planner (BSP) reasons over spatial adjacency and cross-object accessibility to produce compact, motion-neutralized subgoals that exploit opportunities for coordinated two-handed actions. Interaction-Point-Driven Bimanual Prompting (IPBP) binds these subgoals to a structured skill library, instantiating synchronized unimanual or bimanual action sequences that satisfy hand-state and affordance constraints. Together, these modules enable agents to plan semantically meaningful, physically feasible, and parallelizable two-handed behaviors in cluttered, previously unseen scenes. Experiments show that it produces coherent, feasible, and compact two-handed plans, and generalizes to cluttered scenes without retraining, demonstrating robust scene-agnostic affordance reasoning for bimanual tasks.
- Abstract(参考訳): オープン環境で動作している身体的エージェントは、高レベルの命令を接地された実行可能行動に変換する必要があり、しばしば両手の協調的な使用を必要とする。
最近の基礎モデルは強力な意味論的推論を提供するが、既存のロボットタスクプランナーは、主に単数的であり、シーンに依存しない環境でのバイマニュアル操作に固有の空間的、幾何学的、調整上の課題に対処できない。
本稿では,高次推論を3次元2次元実行でブリッジする,シーン非依存の双方向タスク計画のための統一的なフレームワークを提案する。
このアプローチは3つの重要なモジュールを統合します。
ビジュアルポイントグラウンド(VPG)は、単一のシーンイメージを分析して、関連するオブジェクトを検出し、ワールドアラインなインタラクションポイントを生成する。
BSP (Bimanual Subgoal Planner) は、二つの手の動きを協調する機会を利用するコンパクトで運動ニュートラル化されたサブゴールを作成するために、空間的隣接性やクロスオブジェクト・アクセシビリティを考慮に入れている。
Interaction-Point-Driven Bimanual Prompting (IPBP) は、これらのサブゴールを構造化されたスキルライブラリに結合し、手持ちと手持ちの制約を満たす同期された一対または二対のアクションシーケンスをインスタンス化する。
これらのモジュールによって、エージェントは、以前は目に見えない散らばったシーンで意味のある、物理的に実現可能で、並列化可能な2手動作を計画できる。
実験の結果,コヒーレントで実現可能でコンパクトな両手計画が作成され,リトレーニングなしで散らばったシーンに一般化され,両手作業のための堅牢なシーン非依存の余裕推論が実証された。
関連論文リスト
- AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis [50.793806818677716]
AffordGraspは、物理的に安定し、セマンティックに忠実な人間の握りを高精度に生成する。
AffordGraspは、手ポーズの空きを意識した潜在表現を二重条件拡散プロセスに統合する。
AffordGraspはHO-3D, OakInk, GRAB, AffordPoseの4つの命令強化ベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-09T06:56:35Z) - Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation [37.76888706583038]
長距離ロボット操作は、現実世界の展開においてますます重要になっている。
既存のエンドツーエンドおよび階層的なビジョン・ランゲージ・アクションポリシーは、しばしばテキストのみの手がかりに依存している。
ロボットの現在のビューに、ポイント、ボックス、矢印、型付き関係を描画する、不可解な視覚中間体であるVisual Sketchを導入する。
本稿では,サイクリックSee-Think-Sketch-Actワークフローで動作するVLAフレームワークであるAction-Sketcherを紹介する。
論文 参考訳(メタデータ) (2026-01-04T17:53:42Z) - ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos [44.050522958181496]
ToG-Benchは、Egoビデオのためのタスク指向固有の時間的ビデオグラウンドティングベンチマークである。
ToG-Benchは、ScanNetからソースされたビデオに基づいて、100の注釈付きクリップと2,704のタスク指向の接地命令で構成されている。
広範囲な実験により、タスク指向STVGの課題と、明示的かつ多目的的なグラウンドリングにおけるパフォーマンスギャップが明らかになる。
論文 参考訳(メタデータ) (2025-12-03T10:54:44Z) - SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks [3.688836621357062]
ロングホライゾン操作タスクは、拡張されたアクションシーケンスと複雑なオブジェクトの相互作用を含む。
長軸操作タスクにおけるSAGE(Scene Graph-Aware Guidance and Execution)の新たなフレームワークを提案する。
SAGE は,(1) VLM と LLM を用いて環境解析を行うシーングラフベースのタスクプランナと,(2) 対象のサブゴールグラフを対応する画像に変換する分離構造画像編集パイプラインから構成される。
論文 参考訳(メタデータ) (2025-09-26T06:14:55Z) - GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation [81.0871900167463]
GeoSAM2は3次元部分分割のためのプロンプト制御可能なフレームワークである。
テクスチャのないオブジェクトが与えられた場合、事前に定義された視点から正規写像とポイントマップを描画する。
部品の選択をガイドするシンプルな2Dプロンプト(クリックやボックス)を受け入れます。
予測されたマスクはオブジェクトにバックプロジェクションされ、ビューに集約される。
論文 参考訳(メタデータ) (2025-08-19T17:58:51Z) - PASG: A Closed-Loop Framework for Automated Geometric Primitive Extraction and Semantic Anchoring in Robotic Manipulation [14.311585896189506]
本稿では,タスク意味論と幾何学的特徴のギャップを埋めるために,Primitive-Aware Semantic Grounding (PASG)を提案する。
手動アノテーションに匹敵する性能を達成し,多様なシナリオにまたがる実用的なロボット操作タスクにおけるPASGの有効性を実証する。
論文 参考訳(メタデータ) (2025-08-08T03:23:33Z) - HOSIG: Full-Body Human-Object-Scene Interaction Generation with Hierarchical Scene Perception [57.37135310143126]
HO SIGは階層的なシーン認識を通じて全体インタラクションを合成するための新しいフレームワークである。
我々のフレームワークは、自己回帰生成による運動長の無制限化をサポートし、手動による介入を最小限に抑える。
この研究は、シーン認識ナビゲーションとデクスタラスオブジェクト操作の間に重要なギャップを埋める。
論文 参考訳(メタデータ) (2025-06-02T12:08:08Z) - Exploring 3D Reasoning-Driven Planning: From Implicit Human Intentions to Route-Aware Activity Planning [103.24305074625106]
本研究では,暗黙的な指示から意図した活動を導き,ステップ間の経路や計画を伴うステップに分解する新しい3Dタスクである3D推論駆動計画を提案する。
まずReasonPlan3Dという,多種多様な3Dシーンを多種多様な暗黙の指示でカバーする大規模ベンチマークを構築した。
第二に、複数のステップにまたがってコンテキスト整合性を持つプログレッシブプラン生成を導入する新しいフレームワークを設計する。
論文 参考訳(メタデータ) (2025-03-17T09:33:58Z) - ManiPose: A Comprehensive Benchmark for Pose-aware Object Manipulation in Robotics [55.85916671269219]
本稿では,ポーズ変動操作タスクの研究を進めるための先駆的ベンチマークであるManiPoseを紹介する。
包括的データセットは、2936の現実世界のスキャンされた剛体オブジェクトと100の明瞭なオブジェクトに対して、幾何学的に一貫性があり、操作指向の6Dポーズラベルを備えている。
本ベンチマークは,ポーズ推定,ポーズ認識操作,実ロボットのスキル伝達における顕著な進歩を示す。
論文 参考訳(メタデータ) (2024-03-20T07:48:32Z) - Enabling Visual Action Planning for Object Manipulation through Latent
Space Roadmap [72.01609575400498]
高次元状態空間を有する複雑な操作タスクの視覚的行動計画のための枠組みを提案する。
低次元潜時空間におけるシステムダイナミクスを世界規模で捉えたグラフベースの構造であるタスク計画のためのLatent Space Roadmap(LSR)を提案する。
実ロボットで実行された2つの模擬ボックス積み重ねタスクと折り畳みタスクについて,本フレームワークの徹底的な検討を行う。
論文 参考訳(メタデータ) (2021-03-03T17:48:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。