論文の概要: Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience
- arxiv url: http://arxiv.org/abs/2606.27475v1
- Date: Thu, 25 Jun 2026 18:52:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.292881
- Title: Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience
- Title(参考訳): サポート制約付きRLは実世界の経験のない実世界の政策改善を可能にする
- Abstract要約: Support-Constrained Off-Domain Reinforcement (SCORE) は、シミュレーションにおいてRLを実際のデータで事前訓練された生成ポリシーのサポートに制約する、リアルからシミュレート・トゥ・リアルなフレームワークである。
SCOREは、ポリシー最適化が適切に制約されている場合、現実世界の操作ポリシーを大幅に改善できることを示す。
- 参考スコア(独自算出の注目度): 10.327708268675503
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robots trained on real world data tend to be imprecise, slow, and brittle to perturbations. Improving these policies with reinforcement learning (RL) is an appealing alternative, but this process often requires expensive training in the real world. Performing policy improvement in simulation instead provides a far cheaper alternative, but unconstrained RL in simulation can exploit contact and dynamics mismatches, resulting in unsafe behaviors that do not transfer to hardware. Common forms of regularization can furthermore limit improvement by overconstraining to an imperfect behavior prior. In this work, we propose Support-Constrained Off-Domain REinforcement (SCORE), a real-to-sim-to-real framework that constrains RL in simulation to the support of a generative policy pretrained on real data. We instantiate this constraint through flow steering, restricting SCORE to actions the base policy can already produce, which ensures transferable behaviors while maximizing policy improvement. Improving a policy with SCORE requires minimal effort: it learns from sparse rewards, avoids distillation, and leaves the base policy untouched. Across eight real-world dexterous multi-fingered robotic manipulation tasks, SCORE improves average success rate from 37.8% to 89.9%, compared to 59.5% for the best baseline, and reaches success in 36.8% fewer steps than the base policy. Ultimately, through extensive experiments and ablations, we show that simulation can substantially improve real-world manipulation policies when policy optimization is appropriately constrained, introducing a new paradigm for real-to-sim-to-real policy improvement. Videos and code are available at https://weirdlabuw.github.io/score/.
- Abstract(参考訳): 現実世界のデータに基づいて訓練されたロボットは、摂動に対して不正確で遅く、脆弱である傾向がある。
強化学習(RL)によるこれらのポリシーの改善は、魅力的な代替手段であるが、このプロセスは、しばしば現実世界で高価なトレーニングを必要とする。
シミュレーションにおけるポリシーの改善は、はるかに安価な代替手段を提供するが、シミュレーションにおける制約のないRLは、接触やダイナミクスのミスマッチを悪用し、ハードウェアに転送しない安全でない振る舞いをもたらす。
一般的な正規化の形式は、以前の不完全な行動に過度に拘束することで改善を制限することができる。
本研究では,実データ上で事前訓練された生成ポリシーのサポートに対して,シミュレーションにおいてRLを制約するリアルタイム・シミュレート・トゥ・リアル・フレームワークであるSCOREを提案する。
我々はフローステアリングによってこの制約をインスタンス化し、SCOREを基本方針が既に生み出している行動に制限し、政策改善を最大化しつつ、伝達可能な行動を保証する。
SCOREによる政策改善には最小限の努力が必要であり、粗末な報酬から学び、蒸留を回避し、基本方針を無傷で残す。
8つの実世界の奇抜な多指ロボット操作タスクの中で、SCOREは平均的な成功率を37.8%から89.9%に改善し、最高のベースラインでは59.5%、基本方針より36.8%少ないステップで成功している。
究極的には、広範な実験と改善を通じて、政策最適化が適切に制約された場合、シミュレーションが現実世界の操作ポリシーを大幅に改善できることを示し、現実からシミュレート・トゥ・リアルな政策改善のための新しいパラダイムを導入する。
ビデオとコードはhttps://weirdlabuw.github.io/score/.comで公開されている。
関連論文リスト
- EXPO: Stable Reinforcement Learning with Expressive Policies [74.30151915786233]
2つのパラメータ化ポリシーで値の最大化を実現するために,サンプル効率のよいオンライン強化学習アルゴリズムを提案する。
提案手法は, 従来手法に比べて試料効率を最大2~3倍向上させる。
論文 参考訳(メタデータ) (2025-07-10T17:57:46Z) - Accelerating Residual Reinforcement Learning with Uncertainty Estimation [20.516264459225734]
残留強化学習(Residual Reinforcement Learning, RL)は、修正行動を提供する軽量な残留ポリシーを学習することで、事前訓練されたポリシーを適用するための一般的なアプローチである。
残留RLは基本方針全体を微調整するよりもサンプリング効率が高いが、既存の手法はスパース報酬に苦慮し、決定論的基本方針のために設計されている。
本稿では, サンプル効率をさらに向上し, 基本方針に適合させるため, 残留RLの2つの改良点を提案する。
論文 参考訳(メタデータ) (2025-06-21T03:18:01Z) - Post-Convergence Sim-to-Real Policy Transfer: A Principled Alternative to Cherry-Picking [5.027571997864706]
本稿では,最短ケースの性能伝達最適化手法を導入することで,コンバージェンス後のsim-to-real転送問題に対処する。
実験は、シミュレーションから実世界の実験室にRLに基づく移動ポリシーを移すことの有効性を実証した。
論文 参考訳(メタデータ) (2025-04-21T19:48:05Z) - Safe Continual Domain Adaptation after Sim2Real Transfer of Reinforcement Learning Policies in Robotics [3.7491742648742568]
ドメインランダム化(Domain randomization)は、シミュレーションから現実のロボットアプリケーションへのポリシーの転送を容易にする技術である。
実世界のロボット制御において,安全な配置時ポリシー適用を可能にする手法を提案する。
論文 参考訳(メタデータ) (2025-03-13T23:28:11Z) - Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone [72.17534881026995]
ポリシーに依存しないRL(PA-RL)と呼ばれるオフラインおよびオンラインの微調整手法を開発する。
オンラインRLファインチューニングアルゴリズムであるCal-QLを用いて、7BジェネラリストロボットポリシーであるOpenVLAのファインチューニングに成功した最初の結果を示す。
論文 参考訳(メタデータ) (2024-12-09T17:28:03Z) - Offline Reinforcement Learning with Closed-Form Policy Improvement
Operators [88.54210578912554]
行動制約付きポリシー最適化は、オフライン強化学習に対処するための成功パラダイムであることが示されている。
本稿では,閉形式政策改善演算子を提案する。
我々は、標準的なD4RLベンチマークにおいて、最先端アルゴリズムに対するそれらの効果を実証的に実証した。
論文 参考訳(メタデータ) (2022-11-29T06:29:26Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z) - Building a Foundation for Data-Driven, Interpretable, and Robust Policy
Design using the AI Economist [67.08543240320756]
AIエコノミストフレームワークは,2段階強化学習とデータ駆動型シミュレーションを用いて,効果的な,柔軟な,解釈可能なポリシー設計を可能にする。
RLを用いて訓練されたログリニア政策は、過去の結果と比較して、公衆衛生と経済の両面から社会福祉を著しく改善することがわかった。
論文 参考訳(メタデータ) (2021-08-06T01:30:41Z) - Guided Constrained Policy Optimization for Dynamic Quadrupedal Robot
Locomotion [78.46388769788405]
我々は,制約付きポリシー最適化(CPPO)の実装に基づくRLフレームワークであるGCPOを紹介する。
誘導制約付きRLは所望の最適値に近い高速収束を実現し,正確な報酬関数チューニングを必要とせず,最適かつ物理的に実現可能なロボット制御動作を実現することを示す。
論文 参考訳(メタデータ) (2020-02-22T10:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。