論文の概要: WM-DAgger: Enabling Efficient Data Aggregation for Imitation Learning with World Models
- arxiv url: http://arxiv.org/abs/2604.11351v1
- Date: Mon, 13 Apr 2026 11:49:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.511377
- Title: WM-DAgger: Enabling Efficient Data Aggregation for Imitation Learning with World Models
- Title(参考訳): WM-DAgger:世界モデルを用いた模倣学習のための効率的なデータ集約を実現する
- Authors: Anlan Yu, Zaishu Chen, Peili Song, Zhiqing Hong, Haotian Wang, Desheng Zhang, Tian He, Yi Ding, Daqing Zhang,
- Abstract要約: 効率的なデータ集約フレームワークであるWM-DAggerを提案する。
我々は、目の届くロボットアームと数発のデモでタスクを操作することに重点を置いている。
我々は、WM-DAggerを複数の実世界のロボットタスクで広範囲に検証する。
- 参考スコア(独自算出の注目度): 22.67666648771421
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Imitation learning is a powerful paradigm for training robotic policies, yet its performance is limited by compounding errors: minor policy inaccuracies could drive robots into unseen out-of-distribution (OOD) states in the training set, where the policy could generate even bigger errors, leading to eventual failures. While the Data Aggregation (DAgger) framework tries to address this issue, its reliance on continuous human involvement severely limits scalability. In this paper, we propose WM-DAgger, an efficient data aggregation framework that leverages World Models to synthesize OOD recovery data without requiring human involvement. Specifically, we focus on manipulation tasks with an eye-in-hand robotic arm and only few-shot demonstrations. To avoid synthesizing misleading data and overcome the hallucination issues inherent to World Models, our framework introduces two key mechanisms: (1) a Corrective Action Synthesis Module that generates task-oriented recovery actions to prevent misleading supervision, and (2) a Consistency-Guided Filtering Module that discards physically implausible trajectories by anchoring terminal synthesized frames to corresponding real frames in expert demonstrations. We extensively validate WM-DAgger on multiple real-world robotic tasks. Results that our method significantly improves success rates, achieving a 93.3\% success rate in soft bag pushing with only five demonstrations. The source code is publicly available at https://github.com/czs12354-xxdbd/WM-Dagger.
- Abstract(参考訳): マイナーなポリシーの不正確さは、トレーニングセット内のロボットを予期せぬアウト・オブ・ディストリビューション(OOD)状態に追い込む可能性がある。
Data Aggregation(DAgger)フレームワークはこの問題に対処しようとしているが、継続的人間による関与への依存はスケーラビリティを著しく制限している。
本稿では、WM-DAggerを提案する。WM-DAggerは、世界モデルを利用してOOD回復データを人間の関与なしに合成する効率的なデータ集約フレームワークである。
具体的には、目の届くロボットアームと数発のデモによる操作作業に焦点を合わせます。
誤解を招くデータの合成を回避し,世界モデル固有の幻覚的問題を克服するため,(1)タスク指向のリカバリ動作を生成する修正行動合成モジュール,(2)専門家による実フレームに端末合成フレームを固定することで,物理的に不可解なトラジェクトリを破棄する一貫性誘導フィルタリングモジュールの2つのメカニズムを導入している。
我々は、WM-DAggerを複数の実世界のロボットタスクで広範囲に検証する。
その結果,本手法は成功率を大幅に向上し,軟式袋押出実験では5回しか成功率を93.3倍に向上させることができた。
ソースコードはhttps://github.com/czs12354-xxdbd/WM-Daggerで公開されている。
関連論文リスト
- Optimizing Neurorobot Policy under Limited Demonstration Data through Preference Regret [45.21845762562799]
MYOE(Master your own expertise)は、ロボットエージェントが限られた実演データサンプルから複雑な振る舞いを学習できるようにする自己シミュレーションフレームワークである。
人間の知覚と行動に触発されて、クエリ可能な混合参照状態空間モデル(QMoP-SSM)を提案し、設計する。
我々の実験は、他の最先端RLfD方式と比較して、我々のエージェントの堅牢性、適応性、およびサンプル外性能を実証した。
論文 参考訳(メタデータ) (2026-04-04T00:03:59Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning [31.000965640377128]
ABot-M0は、システマティックデータキュレーションパイプラインを構築するフレームワークである。
これは不均一な生データを統一的で効率的な表現にエンドツーエンドに変換することを可能にする。
ABot-M0はデュアルストリーム機構を通じてモジュール認識をサポートする。
論文 参考訳(メタデータ) (2026-02-11T16:47:01Z) - One-Shot Real-World Demonstration Synthesis for Scalable Bimanual Manipulation [45.00986521352502]
BiDemoSynは1つの実世界の例から、接触に富んだ物理的に実現可能なバイマダルなデモンストレーションを合成するフレームワークである。
BiDemoSynデータに基づいてトレーニングされたポリシーは、新しいオブジェクトのポーズや形状に対して堅牢に一般化されていることを示す。
BiDemoSynのデータに基づいてトレーニングされたポリシーは、ゼロショットのクロスボデーメントを新しいロボットプラットフォームに転送する。
論文 参考訳(メタデータ) (2025-12-10T03:48:16Z) - Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models [53.20969621498248]
本稿では,多種多様な計画および実行障害を生成するために,軌道を手続き的に乱す自動ロボット故障合成手法を提案する。
RLBench-Fail, BridgeDataV2-Fail, UR5-Failの3つの新しい故障検出ベンチマークを構築した。
次に、詳細な障害推論と検出のためのマルチビューイメージを備えたVLMであるGuardianをトレーニングします。
論文 参考訳(メタデータ) (2025-12-01T17:57:27Z) - StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation [56.996371714721995]
高度に圧縮された2つの状態表現を学習する教師なしの手法を提案する。
私たちの表現は効率的で解釈可能で、既存のVLAベースのモデルとシームレスに統合されます。
提案手法は,コンパクトな状態表現から一般化可能なロボットモーションを学習できることから,StaMoと命名する。
論文 参考訳(メタデータ) (2025-10-06T17:37:24Z) - Action Flow Matching for Continual Robot Learning [54.10050120844738]
ロボット工学における継続的な学習は、変化する環境やタスクに常に適応できるシステムを求める。
本稿では,オンラインロボット力学モデルアライメントのためのフローマッチングを利用した生成フレームワークを提案する。
ロボットは,不整合モデルで探索するのではなく,行動自体を変換することで,より効率的に情報収集を行う。
論文 参考訳(メタデータ) (2025-04-25T16:26:15Z) - Dynamic Non-Prehensile Object Transport via Model-Predictive Reinforcement Learning [24.079032278280447]
バッチ強化学習(RL)とモデル予測制御(MPC)を組み合わせたアプローチを提案する。
提案手法は,ロボットウェイタータスクを実行するFranka Pandaロボットのシミュレーションおよび実世界実験により検証される。
論文 参考訳(メタデータ) (2024-11-27T03:33:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。