論文の概要: EmbodiRSI: Recursive Self-Improvement for Data-Efficient Robot Adaptation
- arxiv url: http://arxiv.org/abs/2609.38905v3
- Date: Sat, 03 Oct 2026 02:56:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.446266
- Title: EmbodiRSI: Recursive Self-Improvement for Data-Efficient Robot Adaptation
- Title(参考訳): EmbodiRSI:データ効率の良いロボット適応のための再帰的自己改善
- Abstract要約: EmbodiRSIは、リアルからシミュレート・トゥ・リアル・セッティングにおける反復的な政策改善のためのシステムである。
タスク固有のシミュレーションは、ターゲットのデプロイメントシナリオから構築され、低コストな環境として使用される。
400の適応的なシミュレートされた軌道と、サブタスクごとに10の現実世界の軌道しか持たないため、EmbodiRSIは83.1%のシーンバランスの自律的実世界の成功を達成している。
- 参考スコア(独自算出の注目度): 54.5481724465918
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Adapting robot manipulation policies to new tasks and environments remains highly data-intensive, while the data needed for further improvement depends on the policy's current capabilities and failure modes. We introduce EmbodiRSI, an agentic system for recursive self-improvement (RSI) in a real-to-sim-to-real setting, where task-specific simulations are constructed from target deployment scenarios and used as low-cost environments for iterative policy improvement before transfer back to the physical world. EmbodiRSI uses policy execution feedback to guide subsequent experience acquisition and policy updates. Two complementary mechanisms close this loop: Collaborative Error Correction generates agent-assisted corrective trajectories from policy-reached states, while Adaptive Data Collection directs expert demonstration generation toward the current policy's weaknesses. The task-specific simulation serves as a reusable workspace for policy warm-up, repeatable evaluation, failure diagnosis, and targeted data generation across successive RSI rounds. Across three tabletop environments and 14 subtasks, EmbodiRSI increases scene-balanced autonomous simulation success from 50.4% to 83.5% over two RSI updates. With 400 adaptive simulated trajectories and only ten real-world refinement trajectories per subtask, EmbodiRSI achieves 83.1% scene-balanced autonomous real-world success, compared with 75.0% for adaptation using 200 real-world demonstrations per subtask. These results demonstrate that feedback-driven recursive improvement in deployment-specific simulations can enable data-efficient adaptation of embodied policies to physical environments.
- Abstract(参考訳): ロボット操作ポリシーを新しいタスクや環境に適用することは、データ集約性が高いが、さらなる改善に必要なデータは、ポリシーの現在の機能と障害モードに依存する。
EmbodiRSIは,タスク固有のシミュレーションをターゲットの配置シナリオから構築し,物理世界に戻る前に反復的政策改善のための低コストな環境として利用する,再帰的自己改善(RSI)のためのエージェントシステムである。
EmbodiRSIは、ポリシー実行フィードバックを使用して、その後の経験取得とポリシー更新をガイドする。
協調的誤り訂正(Collaborative Error Correction)は、エージェント支援された修正軌道をポリシーが規定された状態から生成する一方、Adaptive Data Collectionは、専門家による実証生成を現在のポリシーの弱点に向けて指示する。
タスク固有のシミュレーションは、ポリシーウォームアップ、繰り返し評価、障害診断、連続したRSIラウンドにわたるターゲットデータ生成のための再利用可能なワークスペースとして機能する。
3つのテーブルトップ環境と14のサブタスクの中で、EmbodiRSIは2つのRSI更新に対してシーンバランスの取れた自律シミュレーションの成功を50.4%から83.5%に引き上げている。
400の適応的シミュレートされた軌道と、サブタスクごとに10の現実世界の軌道しか持たないため、EmbodiRSIは83.1%のシーンバランスの自律的な実世界の成功を達成している。
これらの結果から, デプロイメント固有のシミュレーションにおけるフィードバックによる再帰的改善が, 物理環境への具体的ポリシーの適応をデータ効率で実現できることが示唆された。
関連論文リスト
- Stable and Efficient Real-World Online VLA Post-Training via Asynchronous Replay-Anchored Policy Improvement [60.83624556700821]
本稿では,リプレイ動作における批評家とアクターの更新の両方を基盤として,ロールアウトと学習を同時に行うフレームワークを提案する。
RAPolicyを4つのシングルタスク設定と1つのジョイント5タスク設定で実世界で評価し,オンライントレーニングの予算は1~2時間に過ぎなかった。
論文 参考訳(メタデータ) (2026-09-19T08:45:18Z) - Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience [10.327708268675503]
Support-Constrained Off-Domain Reinforcement (SCORE) は、シミュレーションにおいてRLを実際のデータで事前訓練された生成ポリシーのサポートに制約する、リアルからシミュレート・トゥ・リアルなフレームワークである。
SCOREは、ポリシー最適化が適切に制約されている場合、現実世界の操作ポリシーを大幅に改善できることを示す。
論文 参考訳(メタデータ) (2026-06-25T18:52:27Z) - LoopSR: Looping Sim-and-Real for Lifelong Policy Adaptation of Legged Robots [20.715834172041763]
デプロイ後の段階において、RLポリシーを継続的に洗練する、生涯にわたるポリシー適応フレームワークであるLoopSRを提案する。
LoopSRはトランスフォーマーベースのエンコーダを使用して、現実世界の軌道を潜在空間にマッピングする。
オートエンコーダアーキテクチャとコントラスト学習手法を採用し、実世界のダイナミクスの特徴抽出を強化する。
論文 参考訳(メタデータ) (2024-09-26T16:02:25Z) - Evaluating Real-World Robot Manipulation Policies in Simulation [91.55267186958892]
実環境と模擬環境の制御と視覚的格差は、信頼性のある模擬評価の鍵となる課題である。
実環境に完全忠実なデジタル双生児を作らなくても、これらのギャップを軽減できる手法を提案する。
シミュレーション環境の集合体であるSIMPLERを作成した。
論文 参考訳(メタデータ) (2024-05-09T17:30:16Z) - Robust Visual Sim-to-Real Transfer for Robotic Manipulation [79.66851068682779]
シミュレーションにおけるビジュモータポリシーの学習は、現実世界よりも安全で安価である。
しかし、シミュレーションデータと実データとの相違により、シミュレータ訓練されたポリシーは実際のロボットに転送されると失敗することが多い。
視覚的なsim-to-real領域ギャップを埋める一般的なアプローチは、ドメインランダム化(DR)である。
論文 参考訳(メタデータ) (2023-07-28T05:47:24Z) - AdaptSim: Task-Driven Simulation Adaptation for Sim-to-Real Transfer [10.173835871228718]
AdaptSimは、ターゲット(現実)環境でのタスクパフォーマンスの最適化を目的としている。
まず、強化学習を用いたシミュレーションにおける適応ポリシーをメタラーニングする。
次に、ポリシートレーニングのための新しいシミュレーションパラメータ分布を推定することにより、反復的実世界の適応を行う。
論文 参考訳(メタデータ) (2023-02-09T19:10:57Z) - Latent-Variable Advantage-Weighted Policy Optimization for Offline RL [70.01851346635637]
オフラインの強化学習メソッドは、新しいトランジションを環境に問い合わせる必要なしに、事前にコンパイルされたデータセットから学習ポリシーを保証します。
実際には、オフラインデータセットは、しばしば異種、すなわち様々なシナリオで収集される。
より広範な政策分布を表現できる潜在変数ポリシーを活用することを提案する。
提案手法は,次回のオフライン強化学習法の性能を,異種データセット上で49%向上させる。
論文 参考訳(メタデータ) (2022-03-16T21:17:03Z) - Lifelong Unsupervised Domain Adaptive Person Re-identification with
Coordinated Anti-forgetting and Adaptation [127.6168183074427]
本稿では,LUDA (Lifelong Unsupervised Domain Adaptive) という新たなタスクを提案する。
これは、モデルがターゲット環境のラベル付けされていないデータに継続的に適応する必要があるため、難しい。
我々は、CLUDA-ReIDと呼ばれるこのタスクのための効果的なスキームを設計し、そこでは、アンチフォージェッティングが適応と調和して調整される。
論文 参考訳(メタデータ) (2021-12-13T13:19:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。