論文の概要: Embodied Scene Rearrangement Planning
- arxiv url: http://arxiv.org/abs/2608.27371v1
- Date: Thu, 27 Aug 2026 17:08:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.50152
- Title: Embodied Scene Rearrangement Planning
- Title(参考訳): 身近なシーン再配置計画
- Authors: Canzhi Chen, Zan Wang, Siqi Zhu, Qi Wu, Yixuan Li, Wei Liang,
- Abstract要約: 本稿では,ESRP(Embodied Scene Rearrangement Planning)を紹介する。
ESRPは、エゴセントリックな観察とトップダウンのターゲットレイアウトのみを使用して、ターゲット構成にマッチするために、3Dシーンで家具を並べ替えるエンボディエージェントを必要とする。
ESRP-BenchはOmniGibson上に構築された,5,400のシーンペアと8,200のオブジェクトからなる総合的なベンチマークである。
- 参考スコア(独自算出の注目度): 30.63533710397442
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper introduces Embodied Scene Rearrangement Planning (ESRP), a novel task requiring embodied agents to rearrange furniture in 3D scenes to match a target configuration using only egocentric observations and a top-down target layout. Unlike prior rearrangement tasks, ESRP precludes global state access and introduces mutual object occlusions, reflecting the practical constraints of real-world robotic deployment. These factors make aligning partial egocentric observations with the global target layout particularly challenging for long-horizon planning. To facilitate research, we present ESRP-Bench, a comprehensive benchmark built on OmniGibson featuring over 5,400 scene pairs and 8,200 objects. We define three multi-level metrics to evaluate rearrangement quality and provide four baselines: a hierarchical task-and-motion planning method, a vision-language-model-based method, and two learning-based approaches (IL and RL). Experimental results demonstrate that current methods struggle to complete the task efficiently, highlighting ESRP as a challenging frontier for embodied agents in scene understanding and long-horizon task planning. This work serves as a stepping stone toward deploying intelligent agents in real-world scenarios. Project page: https://pie-lab.cn/ESRP/.
- Abstract(参考訳): 本稿では,エゴセントリックな観察とトップダウンのターゲットレイアウトのみを用いて,3次元シーンにおける家具の並べ替えを行うための新しい作業であるEmbodied Scene Rearrangement Planning(ESRP)を紹介する。
以前の再配置タスクとは異なり、ESRPはグローバルな状態アクセスを妨げ、現実のロボット展開の現実的な制約を反映して、相互のオブジェクト閉塞を導入する。
これらの要因は、特に長期計画において、部分的な自我中心の観測をグローバルなターゲット配置と整合させることを困難にしている。
ESRP-BenchはOmniGibson上に構築され,5,400以上のシーンペアと8,200以上のオブジェクトからなる総合的なベンチマークである。
階層型タスク・アンド・モーション計画法,視覚言語モデルに基づく手法,および2つの学習ベースアプローチ(ILとRL)の3つの基準線を提供する。
実験の結果,現在の手法ではタスクを効率的に完了させることが困難であり,シーン理解や長期タスク計画において,ESRPを具体化エージェントの挑戦的フロンティアとして強調している。
この作業は、現実世界のシナリオでインテリジェントエージェントをデプロイするための足掛かりとして役立ちます。
プロジェクトページ: https://pie-lab.cn/ESRP/。
関連論文リスト
- World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models [54.68021681438324]
視覚言語モデル(VLM)の推論能力を活用したロボット計画システムであるWorld Action Plannerを提案する。
本システムでは,エージェントが初期行動計画を提案し,それらを最適化と探索により反復的に洗練し,想像上の世界モデル展開を推し進める。
提案手法は, 合成タスク, レイアウト, ゼロショットの一般化シナリオにおいて, 優れた性能を実現することを実証する。
論文 参考訳(メタデータ) (2026-07-30T02:41:52Z) - Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation [34.08516675160383]
エンボディエージェントのためのゼロショットセマンティックナビゲーションフレームワークを提案する。
本手法は,オブジェクト,ゾーン,領域を網羅したオンライン階層型3次元シーングラフ(HSG)を漸進的に維持し,グローバルプランニングのためのコンパクトな状態抽象化として機能する。
このメモリ上に構築された階層的信念に基づく計画フレームワークは,HSGの探索証拠とセマンティック先行を融合させ,HSGベースのシミュレータ上で有限水平ロールアウトを行い,候補マクロアクションの長期的リターンを明示的に推定する。
論文 参考訳(メタデータ) (2026-06-30T03:01:44Z) - RePlan-Bot: Multi-Level Replanning for Embodied Instruction Following [39.9780803736704]
EIF(Embodied instruction following)は、対話型3D環境において複雑な自然言語コマンドを理解し実行する必要がある。
RePlan-Botはタスク実行全体を通してマルチレベルかつ連続的な再計画を行う新しいEDFエージェントである。
論文 参考訳(メタデータ) (2026-05-25T13:44:18Z) - MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation [18.84633713315585]
複雑な日々のタスクを管理するように設計されたロボットAIシステムは、ハイレベルなタスクを理解し分解するためのタスクプランナーに依存している。
本稿は、計画されたスキルセットを定義することが同様に重要である、と論じる。
日々の環境の複雑さに対処するためには、スキルセットは高度な一般化能力を持つべきである。
論文 参考訳(メタデータ) (2025-12-22T14:58:52Z) - Hierarchical Object-Oriented POMDP Planning for Object Rearrangement [19.62753215239688]
現在のオブジェクト再構成ソリューションは、主に強化学習または手作業による計画手法に基づいており、様々な課題への適応性に欠けることが多い。
この制限に対処するために,新しい階層的オブジェクト指向部分観測マルコフ決定プロセス(HOO-POMDP)を導入する。
本稿では、部分的に観測可能なマルチルーム環境における多目的再構成問題を解決するためのオンライン・プランニング・フレームワークと新しいベンチマーク・データセットを提案する。
論文 参考訳(メタデータ) (2024-12-02T10:19:36Z) - Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation [64.84996994779443]
本稿では,連続視覚言語ナビゲーション(VLN)タスクのためのAffordances-Oriented Plannerを提案する。
我々のAO-Plannerは、様々な基礎モデルを統合して、アベイランス指向の低レベルな動き計画とハイレベルな意思決定を実現する。
挑戦的なR2R-CEデータセットとRxR-CEデータセットの実験は、AO-Plannerが最先端のゼロショットのパフォーマンスを達成したことを示している。
論文 参考訳(メタデータ) (2024-07-08T12:52:46Z) - Embodied Instruction Following in Unknown Environments [64.57388036567461]
未知環境における複雑なタスクに対するEIF(Embodied instruction following)法を提案する。
我々は,ハイレベルなタスクプランナと低レベルな探索コントローラを含む,階層的な具体化命令に従うフレームワークを構築した。
タスクプランナに対しては、タスク完了プロセスと既知の視覚的手がかりに基づいて、人間の目標達成のための実行可能なステップバイステッププランを生成する。
論文 参考訳(メタデータ) (2024-06-17T17:55:40Z) - Learning adaptive planning representations with natural language
guidance [90.24449752926866]
本稿では,タスク固有の計画表現を自動構築するフレームワークであるAdaについて述べる。
Adaは、プランナー互換の高レベルアクション抽象化と、特定の計画タスク領域に適応した低レベルコントローラのライブラリを対話的に学習する。
論文 参考訳(メタデータ) (2023-12-13T23:35:31Z) - Embodied Task Planning with Large Language Models [86.63533340293361]
本研究では,現場制約を考慮した地上計画のための具体的タスクにおけるTAsk Planing Agent (TaPA)を提案する。
推論の際には,オープンボキャブラリオブジェクト検出器を様々な場所で収集された多視点RGB画像に拡張することにより,シーン内の物体を検出する。
実験の結果,我々のTaPAフレームワークから生成されたプランは,LLaVAやGPT-3.5よりも大きなマージンで高い成功率が得られることがわかった。
論文 参考訳(メタデータ) (2023-07-04T17:58:25Z) - Enabling Visual Action Planning for Object Manipulation through Latent
Space Roadmap [72.01609575400498]
高次元状態空間を有する複雑な操作タスクの視覚的行動計画のための枠組みを提案する。
低次元潜時空間におけるシステムダイナミクスを世界規模で捉えたグラフベースの構造であるタスク計画のためのLatent Space Roadmap(LSR)を提案する。
実ロボットで実行された2つの模擬ボックス積み重ねタスクと折り畳みタスクについて,本フレームワークの徹底的な検討を行う。
論文 参考訳(メタデータ) (2021-03-03T17:48:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。