論文の概要: MobiAgent: Dual-Loop Recursive Policy Self-Improvement for Long-Horizon Mobile Manipulation
- arxiv url: http://arxiv.org/abs/2610.03476v1
- Date: Fri, 02 Oct 2026 15:48:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.459808
- Title: MobiAgent: Dual-Loop Recursive Policy Self-Improvement for Long-Horizon Mobile Manipulation
- Title(参考訳): MobiAgent: 長距離移動操作のためのデュアルループ再帰政策自己改善
- Abstract要約: MobiAgentは、ロバストなデプロイメント実行とポリシーの自己改善を橋渡しする。
Outer Loopは、自動セグメント化とデプロイメントのロールアウト検証によって、ライフサイクル学習を自動化する。
BEHAVIOR-1Kで$_0.5$-TAを22.5ポイント上回り、実行障害からの堅牢な回復を可能にする。
- 参考スコア(独自算出の注目度): 40.806829782077166
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon mobile manipulation presents significant challenges due to compounding execution errors and capacity interference between locomotion and arm control. While recent Vision-Language-Action models excel at short-horizon tasks, they lack the hierarchical reasoning required for multi-stage objectives. Furthermore, existing hierarchical agents suffer from rigid sub-task mapping, inflexible replanning, and a lack of continuous learning. To address these limitations, we introduce MobiAgent, a dual-loop agentic framework that bridges robust deployment execution and recursive policy self-improvement. During deployment, the Inner Loop decouples high-level reasoning from low-level control through highly composable atomic skills. It employs Vision-Language models for receding-horizon planning and visual reflection, dynamically composing skills to ensure robust error recovery. These skills are executed by specialized flow-matching experts that share a unified VLM backbone, maximizing reusability while mitigating capacity interference. Concurrently, the Outer Loop drives automated lifelong learning by autonomously segmenting and verifying deployment rollouts, clustering them to discover atomic skills, and continuously fine-tuning the skill library without human annotations. Evaluations on RoboCasa, BEHAVIOR-1K, and real-world tasks demonstrate the effectiveness of MobiAgent. It outperforms $π_{0.5}$-TA by 22.5 percentage points on BEHAVIOR-1K and enables robust recovery from execution failures. Through autonomous data recycling, success improves from 7.50% to 27.50% on RoboCasa and from 32.5% to 57.5% on Astribot S1.
- Abstract(参考訳): ロングホライゾン移動操作は、実行エラーと移動とアーム制御の間のキャパシティ干渉を複雑にすることで大きな課題を呈する。
近年のVision-Language-Actionモデルは短期的なタスクでは優れているが、多段階の目的に対して必要となる階層的推論は欠如している。
さらに、既存の階層的エージェントは、厳密なサブタスクマッピング、柔軟性のないリプランニング、継続的な学習の欠如に悩まされている。
これらの制限に対処するために、ロバストなデプロイメント実行と再帰的なポリシー自己改善を橋渡しするデュアルループエージェントフレームワークであるMobiAgentを紹介します。
配備中、インナーループは高度に構成可能な原子技術を通じて低レベルの制御から高レベルの推論を分離する。
遅延水平計画とビジュアルリフレクションのためにビジョンランゲージモデルを使用し、動的に構成するスキルを使用して、堅牢なエラー回復を保証している。
これらのスキルは、統一されたVLMバックボーンを共有する専門的なフローマッチングの専門家によって実行され、キャパシティ干渉を緩和しながら再利用性を最大化する。
同時に、Outer Loopは、デプロイのロールアウトを自律的にセグメンテーションし、クラスタ化してアトミックスキルを発見し、人間のアノテーションなしで継続的にスキルライブラリを微調整することで、自動生涯学習を駆動する。
RoboCasa, BEHAVIOR-1Kおよび実世界のタスクの評価はMobiAgentの有効性を示す。
π_{0.5}$-TAをBEHAVIOR-1Kで22.5ポイント上回り、実行障害からの堅牢な回復を可能にする。
自律的なデータリサイクルにより、RoboCasaでは7.50%から27.50%に、Astribot S1では32.5%から57.5%に改善されている。
関連論文リスト
- HarnessPAI: An Evolving Harness for Physical AI [64.91964104275483]
本稿では,物理AIのためのモデルおよび具体化に依存しないフレームワークであるHarnessPAIを紹介する。
ロールアウト内では、プログラムレベルでオープンループを実行する。
デスクトップロボットアーム、家庭用ロボット、ロボット掃除機、そして歩行エージェントのHarnessPAIは、純粋なアクションモデルとコード・アズ・ポリティクスのベースラインの両方を改善している。
論文 参考訳(メタデータ) (2026-09-24T07:40:00Z) - AR-WAM: A Visual-Conditioned Agent-Ready World Action Model for Robotic Manipulation [31.9606890046955]
視覚-言語-アクションモデルと世界アクションモデルはまだ操作タスクを指定するために自然言語命令に依存している。
本稿では、言語を2つの相補的な条件で置き換える視覚条件付きエージェント対応世界アクションモデルAR-WAMを提案する。
RoboTwin 2.0、RMBench、および本物のAstribot S1デュアルアームプラットフォームでは、AR-WAMは標準操作における最強のベースラインと一致する。
論文 参考訳(メタデータ) (2026-09-20T11:55:26Z) - MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control [63.85634404397772]
MobileVLA-R1 2.0は、移動ロボットのためのRL拡張ビジョン言語アクションフレームワークである。
教師付きChain-of-Thought(CoT)アライメントと強化学習を通じて、具体的軌道上の多粒性推論を学習する。
VLN-CE, QUARD, およびUnitree Go2およびG1ロボットへの実環境展開を網羅し, 言語誘導ナビゲーション, 四脚制御, ヒューマノイド移動操作の評価を行った。
論文 参考訳(メタデータ) (2026-09-05T20:31:14Z) - SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation [57.131411215593744]
ロングホライゾン操作のための微調整視覚言語アクション(VLA)ポリシーは、依然として行動クローニングに大きく依存している。
本稿では,MMOE(Multi-gate Mixture-of-Experts)値ヘッドとアクションプリミティブベースのステージ推定器を組み合わせたマルチタスクステージ認識報酬モデルRMを紹介する。
RM 上に構築した SPIRAL は,安価で自律的なロールアウトから VLA ポリシーを改善する,政治上の報酬誘導型フレームワークである。
論文 参考訳(メタデータ) (2026-06-09T01:46:23Z) - RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks [28.827331437876452]
データ収集、ポリシー学習、タスク実行を単一のVLM駆動コントローラで統合するエージェントロボットフレームワークであるRoboClawを提案する。
ポリシーレベルでは、RoboClaw氏はEntangled Action Pairs(EAP)を紹介している。
デプロイ中、同じエージェントが高レベルの推論を行い、学習されたポリシープリミティブを動的にオーケストレーションして長期のタスクを遂行する。
論文 参考訳(メタデータ) (2026-03-12T05:22:59Z) - REMAC: Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation [57.628771707989166]
本稿では,ReMACと呼ばれる適応型マルチエージェント計画フレームワークを提案する。
ReMACには2つの重要なモジュールが組み込まれており、ループ内で事前条件と後条件チェックを実行し、進捗と計画の洗練を評価する。
論文 参考訳(メタデータ) (2025-03-28T03:51:40Z) - Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks [85.48034185086169]
Mobile-Agent-Eは、過去の経験を通じて自己進化できる階層的なマルチエージェントフレームワークである。
Mobile-Agent-Eは従来の最先端アプローチよりも22%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2025-01-20T20:35:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。