論文の概要: Warp RL: Reshaping Base Policy Distributions for Dynamics Adaptation
- arxiv url: http://arxiv.org/abs/2606.31043v2
- Date: Wed, 01 Jul 2026 05:04:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.076681
- Title: Warp RL: Reshaping Base Policy Distributions for Dynamics Adaptation
- Title(参考訳): Warp RL: 動的適応のための基本方針分布の再構築
- Abstract要約: 残留強化学習は、その動作に付加的な補正を学習することにより、事前訓練されたロボットポリシーに適応する。
基底分布が幾何的に変化した系と一致していない場合、残差補正は未適応のポリシーでさえも過小評価可能であることを示す。
基本方針の行動分布の可逆的状態条件変換を付加残差に置き換える政策適応手法であるWarp RLを提案する。
- 参考スコア(独自算出の注目度): 3.3656696418661975
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Residual reinforcement learning adapts a pretrained robot policy by learning an additive correction to its actions. While effective when adaptation amounts to shifting the base policy's action distribution, additive corrections cannot change the distribution's shape, scale, or state-dependent geometry -- limitations we formalize as wrong variance, miscalibrated confidence, and non-uniform correction. We show that these matter under dynamics shift: when the base distribution is geometrically mismatched to the shifted system, residual correction can underperform even the unadapted policy. We propose Warp RL, a policy adaptation method that replaces additive residuals with an invertible, state-conditioned transformation of the base policy's action distribution. Instantiated with monotonic rational-quadratic spline flows (arXiv:1906.04032), Warp RL preserves identity initialization, strictly generalizes additive residual correction, and exposes a structured adaptation space suitable for both policy-gradient and gradient-free optimization. Across a variety of ManiSkill3 manipulation tasks with controlled dynamics shifts, Warp RL matches residual correction when translation is sufficient and substantially outperforms it when adaptation requires distributional reshaping. We further demonstrate that warping can replace additive correction in an off-policy sim-to-real pipeline, achieving comparable success rate with 30% faster task completion on a real-robot peg-insertion task.
- Abstract(参考訳): 残留強化学習は、その動作に付加的な補正を学習することにより、事前訓練されたロボットポリシーに適応する。
基本方針の行動分布に適応するほど効果があるが、加法補正は分布の形状、スケール、状態依存の幾何を変えることはできない。
基底分布が幾何的にずれた系と一致した場合、残差補正は未適応のポリシーでさえも過小評価される。
基本方針の行動分布の可逆的状態条件変換を付加残差に置き換える政策適応手法であるWarp RLを提案する。
単調な有理クアクラティックスプラインフロー (arXiv:1906.04032) で証明されたワープRLは、アイデンティティ初期化を保ち、加法的残差補正を厳密に一般化し、ポリシー勾配と勾配自由最適化の両方に適した構造化適応空間を公開する。
ManiSkill3操作タスクは、制御された動的シフトを伴うが、Warp RLは、翻訳が十分であれば残留補正と一致し、適応が分散変換を必要とする場合、大幅に性能が向上する。
さらに、実際のロボットペグ挿入タスクで30%高速なタスク完了で同等の成功率を達成することで、非政治的なsim-to-realパイプラインにおける加算補正を置き換えることができることを示す。
関連論文リスト
- ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback [1.711436622393758]
オンライン残留ポリシー適応(英語: Online Residual Policy Adaptation、ORPA)は、ロボット行動のフィードバック駆動による修正を可能にするフレームワークである。
ORPAは事前訓練された制御ポリシーを軽量でフィードバック条件付きモジュールで拡張し、関節空間内での残留調整を直接予測する。
ORPAをALOHAプラットフォームを用いて精度の高い操作タスクのセットで評価し、ベースライン制御ポリシやルールベースの逆運動学補正と比較して、小さな摂動による成功率と回復率の改善を実証した。
論文 参考訳(メタデータ) (2026-08-18T03:30:12Z) - ReFPO: Reflow Regularization for Flow Matching Policy Gradients [58.32178725687043]
本稿では,フローマッチングポリシーに明示的なリフロー正規化を追加する,シンプルなオンラインRL手法を提案する。
ReFPOはGridWorld, MuJoCo Playground, および高次元ヒューマノイド制御タスクにおける平均性能と離散化を改善することを実験的に実証した。
論文 参考訳(メタデータ) (2026-06-19T04:23:10Z) - Transfer Learning Across Policy Regimes in Adaptive Multi-Agent Systems [0.0]
政策モデルはしばしば、政策指標と結果の関係が制度的に安定していると仮定する。
本稿では,適応型マルチエージェントシステムにおける伝達学習問題としての状態変化について検討する。
論文 参考訳(メタデータ) (2026-06-15T10:16:01Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent [53.828537014796574]
オンラインの非政治強化学習(RL)は、ポリシークラスと更新ルールの2つの選択肢によって構成されている。
我々は、MeanFlow変換を通じてノイズをアクションにマッピングする一段階生成ポリシークラスであるMeanFlow Policiesを提案する。
7つのMuJoCoベンチマークで、Sは1ステップの推論効率を維持しながら、ガウスおよび生成ベースラインを改善する。
論文 参考訳(メタデータ) (2026-05-20T15:14:14Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training [18.849117699859622]
訓練安定性は、大規模言語モデルの強化学習における中心的な課題である。
変動周波数レベルのソフトポリシー最適化(VESPO)を提案する。
数学的推論ベンチマークの実験では、VESPOは安定なトレーニングを64倍の安定度と完全な非同期実行で維持している。
論文 参考訳(メタデータ) (2026-02-11T09:48:08Z) - Recurrent Equivariant Constraint Modulation: Learning Per-Layer Symmetry Relaxation from Data [36.287199718605]
等価ニューラルネットワークは、基礎となるタスク対称性を利用して一般化を改善する。
本稿では,レイヤワイド制約変調機構であるRecurrent Equivariant ConstraintModulation (RECM)を提案する。
RECMは、トレーニング信号と各層の入力ターゲット分布の対称性からのみ適切な緩和レベルを学習する。
論文 参考訳(メタデータ) (2026-02-02T21:59:35Z) - RFS: Reinforcement Learning with Residual Flow Steering for Dexterous Manipulation [7.500999283386335]
残留フローステアリング(Residual Flow Steering、RFS)は、事前訓練された生成ポリシーを適用するためのデータ効率の強化学習フレームワークである。
RFSは、残留動作と潜時雑音分布を協調的に最適化することにより、事前訓練されたフローマッチングポリシーを操る。
シミュレーションと実世界の両方の設定において, RFS が効率よく微調整できることを示す。
論文 参考訳(メタデータ) (2026-02-02T08:11:57Z) - GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping [63.33669214116784]
GRPO-Guardは、既存のGRPOフレームワークのシンプルで効果的な拡張である。
PPOクリッピングが有害な更新を適切に制限することを保証するため、バランスとステップ一貫性の重要度を回復する。
重いKL正則化に頼ることなく、暗黙の過最適化を実質的に緩和する。
論文 参考訳(メタデータ) (2025-10-25T14:51:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。