論文の概要: Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
- arxiv url: http://arxiv.org/abs/2607.13653v1
- Date: Wed, 15 Jul 2026 09:55:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.737708
- Title: Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
- Title(参考訳): 探索的・コミュニケーション的・展開可能な:オープンワールドモバイルマニピュレーションのための視覚駆動型身体エージェント
- Authors: Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang,
- Abstract要約: 既存のフレームワークは、しばしば特権化されたシミュレータの状態に依存するか、あるいは完全な命令を仮定し、現実的なデプロイメント課題を回避します。
本稿では,オープンワールドモバイル操作のためのエージェントフレームワークREALを提案する。
我々は、データ収集、教師付き微調整、オンライン強化学習を駆動するための多様なタスク構成を設計する。
- 参考スコア(独自算出の注目度): 47.58516950734307
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world deployment of embodied agents requires active exploration, visual grounding, and interactive intent disambiguation. However, existing frameworks often rely on privileged simulator states or assume complete instructions, bypassing realistic deployment challenges. To bridge this gap, we present REAL, an agentic framework for open-world mobile manipulation. REAL establishes sim-to-real-consistent environment APIs without oracle perception and integrates a simulated user to enable human-in-the-loop interaction. Within this environment, we design diverse task compositions to drive data collection, supervised fine-tuning, and online reinforcement learning, systematically optimizing agent performance. To comprehensively evaluate this approach, we introduce REAL-Bench, a benchmark spanning 241 tasks across active exploration, visual distraction, articulated manipulation, and interactive disambiguation. Experimental results demonstrate that our trained agent outperforms leading commercial closed-source VLMs on interactive tasks with a 56.9% success rate. Further empirical analysis reveals that our hierarchical training pipeline successfully aligns the model's tool-use capabilities while maintaining robust open-vocabulary reasoning under extended exploration horizons. Finally, we deploy and evaluate our framework on a physical dual-arm mobile robot, where it achieves a 78.3% end-to-end success rate over 60 real-world episodes. These physical trials demonstrate robust zero-shot transferability to unseen household scenarios, validating that our sim-to-real-consistent design successfully bridges the reality gap for long-horizon mobile manipulation. Code is available at https://github.com/InternRobotics/REAL.
- Abstract(参考訳): 実世界のエンボディエージェントの展開には、活発な探索、視覚的な接地、インタラクティブな意図の曖昧さが必要である。
しかし、既存のフレームワークは、しばしば特権化されたシミュレータの状態に依存するか、完全な命令を仮定し、現実的なデプロイ課題を回避します。
このギャップを埋めるために,オープンワールドモバイル操作のためのエージェントフレームワークであるREALを提案する。
REALは、オラクル認識なしでsim-to-real-consistent環境APIを確立し、シミュレートされたユーザを統合して、人間とループ間のインタラクションを可能にする。
この環境下では,データ収集,教師付き微調整,オンライン強化学習,エージェント性能を体系的に最適化する多種多様なタスク構成を設計する。
このアプローチを包括的に評価するために、アクティブな探索、視覚的注意散らし、調音操作、対話的曖昧化を含む241のタスクにまたがるベンチマークであるREAL-Benchを紹介した。
実験の結果,トレーニングエージェントは56.9%の成功率で市販のクローズドソースVLMよりも優れていた。
さらなる経験的分析により、我々の階層的なトレーニングパイプラインは、拡張された探査地平線の下で堅牢なオープン語彙推論を維持しながら、モデルのツール使用能力の整合に成功していることが明らかとなった。
最後に,実世界60回以上のエンド・ツー・エンドの成功率78.3%を達成する物理デュアルアーム・モバイルロボット上で,我々のフレームワークをデプロイし,評価する。
これらの物理的試行は、目に見えない家庭のシナリオに対して、堅牢なゼロショット転送可能性を示し、我々のsim-to-real-consistentデザインが、長距離移動操作の現実的ギャップを橋渡しすることに成功していることを証明している。
コードはhttps://github.com/InternRobotics/REAL.comで入手できる。
関連論文リスト
- SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks [73.92333717662558]
SpaceWorldは、複雑な現実世界のタスクにおけるマルチモーダルエージェントのインタラクティブな空間的理解を評価するためのベンチマークである。
多様なドメイン(例えば、家庭のルーチン、旅行、社会協力など)にまたがる760の人称タスクが特徴である。
信頼性評価のために、各タスクは、人間検証された初期状態、参照軌跡、端末状態検証器を含む。
論文 参考訳(メタデータ) (2026-06-08T15:51:51Z) - ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation [66.02142169323521]
Vision-Language-ActionモデルとWorld Modelは最近、汎用ロボットインテリジェンスのための有望なパラダイムとして登場した。
既存のベンチマークは、主にシミュレータ中心であり、制御性を提供するが、知覚ノイズによって引き起こされる現実のギャップを捉えることができない。
シミュレーションと実世界の実行を橋渡しする標準化された評価フレームワークであるManipArenaを紹介する。
論文 参考訳(メタデータ) (2026-03-30T15:06:41Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - AgenticLab: A Real-World Robot Agent Platform that Can See, Think, and Act [27.922630781100864]
本稿では,モデルに依存しないロボットエージェントプラットフォームであるAgenticLabと,オープンワールド操作のためのベンチマークについて紹介する。
我々は、非構造環境における実ロボットタスクに最先端のVLMベースのエージェントをベンチマークする。
私たちのベンチマークでは、オフラインの視覚言語テストがキャプチャーに失敗するいくつかの障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-02-02T05:30:14Z) - Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation [20.373596661083152]
Affordance RAGはゼロショット階層型マルチモーダル検索フレームワークで、事前探索画像からAffordance-Aware Embodied Memoryを構築する。
提案手法は,大規模屋内環境における移動体操作命令の検索性能において,既存の手法よりも優れていた。
論文 参考訳(メタデータ) (2025-12-22T02:55:25Z) - Reasoning in visual navigation of end-to-end trained agents: a dynamical systems approach [23.52028824411467]
本研究では,物理ロボットを用いた実環境におけるヌンペプソデスのナビゲーションエピソードに関する大規模実験を行った。
エンドツーエンドのトレーニングから生じる推論のタイプを分析します。
本稿では,エージェントが学習した値関数が長期計画に関連があることをポストホック分析で示す。
論文 参考訳(メタデータ) (2025-03-11T11:16:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。