論文の概要: VAMPS: Visual and Motor Policies from Sampling-Based Planning
- arxiv url: http://arxiv.org/abs/2610.05331v1
- Date: Sun, 04 Oct 2026 15:54:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 21:33:20.646444
- Title: VAMPS: Visual and Motor Policies from Sampling-Based Planning
- Title(参考訳): VAMPS: サンプリングベースプランニングによる視覚と運動のポリシー
- Abstract要約: VAMPSは、モデル予測パス積分(MPPI)制御を使用して、人間のデモなしで再利用可能なポリシーをトレーニングするフレームワークである。
ビジュモータポリシーでは、VAMPSは実際のロボットデータから直接動作する。
VAMPSは、シミュレーション後にハードウェア転送が行われるか、あるいは自律的に収集された実ロボットデータから直接ポリシーを学ぶことができる。
- 参考スコア(独自算出の注目度): 11.387768547654183
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Learning robot policies directly on physical systems remains difficult because data collection is costly and policy exploration can be unsafe. We introduce Visual and Motor Policies from Sampling-Based Planning (VAMPS), a framework that uses Model Predictive Path Integral (MPPI) control to train reusable policies without human demonstrations. VAMPS supports two training modes. For one-step proprioceptive policies, it operates iteratively in simulation: the policy warm-starts MPPI, and the refined trajectories provide new supervision as the policy changes. A learned terminal value improves short-horizon planning, while an Implicit Q-Learning (IQL) critic guides the policy update. Iterative refinement outperforms training once on frozen MPPI data, and we transfer the learned locomotion policy to a Unitree Go2. For visuomotor policies, VAMPS operates directly from real-robot data. MPPI uses task-specific state estimates to plan and execute trajectories while recording RGB and sensor observations on a Flexiv Rizon 10S. Action Chunking with Transformers predicts action chunks, reducing the effective prediction horizon, and is trained offline on this fixed dataset. We demonstrate visuomotor pick-and-place and force-aware whiteboard erasing. In the latter task, the policy additionally observes the measured $6$-D wrench and desired normal force. These results show that VAMPS can learn policies either in simulation followed by hardware transfer or directly from autonomously collected real-robot data.
- Abstract(参考訳): データ収集は費用がかかり、ポリシー探索は安全ではないため、物理的なシステム上でロボットポリシーを直接学習することは依然として困難である。
モデル予測パス積分(MPPI)制御を用いて,人間の実演なしに再利用可能なポリシーを訓練するフレームワークである,サンプリングベースプランニング(VAMPS)の視覚・運動政策を紹介する。
VAMPSは2つのトレーニングモードをサポートする。
政策はMPPIをウォームスタートさせ、改良された軌道は政策変更に伴う新たな監督を提供する。
学習した端末値によって短期計画が改善され、Implicit Q-Learning(IQL)がポリシー更新をガイドしている。
反復リファインメントは凍結MPPIデータ上でトレーニングを1回上回り、学習したロコモーションポリシーをUnitree Go2に転送する。
ビジュモータポリシーでは、VAMPSは実際のロボットデータから直接動作する。
MPPIは、Flexiv Rizon 10SでRGBとセンサー観測を記録しながら、タスク固有の状態推定を使って軌道を計画し実行している。
Transformerを使用したアクションチャンキングは、アクションチャンクを予測し、効果的な予測水平線を低減し、この固定データセットでオフラインでトレーニングされる。
バイスモータピック・アンド・プレイス(visuomotor pick-and-place)とフォース対応ホワイトボードの消去を実証した。
後者のタスクでは、このポリシーは測定値の6ドル-Dレンチと所望の正規力も観察する。
これらの結果から,VAMPSは,シミュレーション後にハードウェア転送を行うか,あるいは自律的に収集した実ロボットデータから直接,ポリシーを学習できることがわかった。
関連論文リスト
- Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control [7.9318819245146415]
Sampling-Guided Policy Search (SGPS)は、シミュレーションされたUnitree Go2とG1ロボット上での移動、障害物、クレートプッシュ、および双方向搬送のポリシーを学ぶ。
1つのGPUで、SGPSは、シミュレーションされたUnitree Go2とG1ロボット上での移動、障害物、クレートプッシュ、および双方向の搬送のポリシーを学ぶ。
ハードウェアの配備では、蒸留されたポリシーはゼロショットを本物のGo2に転送し、オンボードの奥行きを使って自律的にトロールし、クロールし、ハードルをクリアし、それらの動作を切り替える。
論文 参考訳(メタデータ) (2026-09-17T15:33:07Z) - TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models [49.463896453707065]
VLA(Vision-Language-Action)モデルは目覚ましい進歩を遂げているが、展開時の分散シフトには弱いままである。
近年のVLAモデルは、プロンプトが政策行動の効率的なインターフェースとして機能することを示唆しているが、既存のプロンプトベースのステアリングは通常、外部ガイダンスに依存している。
VLAのテストタイムトレーニング(TTT)は、プロンプトの最適化によって実現可能か?
我々は、遅延プロンプト最適化(LPO)に基づくテスト時間トレーニングフレームワークであるTTT-VLAでこの問題に対処する。
論文 参考訳(メタデータ) (2026-06-02T04:10:39Z) - Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning [42.74142065376427]
本稿では,Z-Perturbation Reinforcement Learning (ZPRL)を提案する。
現実世界では、ZPRLは模倣ベースポリシーよりも4つのタスクの平均成功率を33.7%向上させる。
論文 参考訳(メタデータ) (2026-05-19T14:43:26Z) - Relative Entropy Pathwise Policy Optimization [66.03329137921949]
そこで本稿では,Q値モデルをオンライントラジェクトリから純粋に訓練するオンラインアルゴリズムを提案する。
安定トレーニングのための制約付き更新と探索のためのポリシを組み合わせる方法を示し、価値関数学習を安定化させる重要なアーキテクチャコンポーネントを評価する。
論文 参考訳(メタデータ) (2025-07-15T06:24:07Z) - CUPID: Curating Data your Robot Loves with Influence Functions [29.79350259314518]
CUPIDは、模倣学習ポリシーのための新しい影響関数理論定式化に基づく、ロボットデータキュレーション手法である。
我々は,1)政策パフォーマンスを損なうトレーニングデモをフィルタリングし,2)政策を最も改善する新たなトラジェクトリをサブセレクトするために,CUPIDを用いてデータをキュレートする。
論文 参考訳(メタデータ) (2025-06-23T20:49:34Z) - Dream to Drive: Model-Based Vehicle Control Using Analytic World Models [67.20720048255362]
我々は次の状態予測器、最適プランナー、最適逆状態の学習を可能にする3つの新しいタスク設定を提案する。
現在の動作に関して次のシミュレータ状態の勾配を必要とする分析ポリシ(APG)とは異なり、提案したセットアップは、現在の状態に関して次の状態の勾配に依存する。
論文 参考訳(メタデータ) (2025-02-14T08:46:49Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - Robust Visual Sim-to-Real Transfer for Robotic Manipulation [79.66851068682779]
シミュレーションにおけるビジュモータポリシーの学習は、現実世界よりも安全で安価である。
しかし、シミュレーションデータと実データとの相違により、シミュレータ訓練されたポリシーは実際のロボットに転送されると失敗することが多い。
視覚的なsim-to-real領域ギャップを埋める一般的なアプローチは、ドメインランダム化(DR)である。
論文 参考訳(メタデータ) (2023-07-28T05:47:24Z) - Cyclic Policy Distillation: Sample-Efficient Sim-to-Real Reinforcement
Learning with Domain Randomization [10.789649934346004]
循環政策蒸留法(CPD)という試料効率の高い手法を提案する。
CPDはランダム化されたパラメータの範囲をいくつかの小さなサブドメインに分割し、各サブドメインにローカルポリシーを割り当てる。
学習された全ての地域政策は、シム・トゥ・リアル・トランスファーのグローバル・ポリシーに蒸留される。
論文 参考訳(メタデータ) (2022-07-29T09:22:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。