論文の概要: Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies
- arxiv url: http://arxiv.org/abs/2608.08545v1
- Date: Sun, 09 Aug 2026 07:45:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.865001
- Title: Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies
- Title(参考訳): ロバストナビゲーション政策のための構造化パラメトリック環境下でのカリキュラム生成
- Authors: Prishita Ray,
- Abstract要約: 本稿では,一方向勾配最適化を用いた構造化連続環境パラメータのカリキュラム生成フレームワークを提案する。
提案手法は,2つの連続制御OpenAI Gym環境にまたがって評価される。
提案手法は,5つのランダムシードに対して,バニラポリシートレーニング,ランダムパラメータサンプリング,手動カリキュラム,フロンティアベース手法,自己更新強化学習(SPRL),ガウス混合モデルを用いた絶対学習進歩(ALP-GMM),リバースカリキュラム学習ベースラインを常に上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robust navigation policies for autonomous agents must generalize across continuously varying environmental conditions such as turn rates, obstacles, friction, pits, and slopes. Curriculum generation provides a principled mechanism for improving generalization by progressively adapting training environments, but designing such curricula in a sample-efficient and automated manner remains challenging. This paper proposes a reparameterized curriculum generation framework for structured continuous environment parameters using unidirectional gradient-based optimization. To improve robustness in multimodal observation spaces consisting of image-based and scalar inputs, a distribution-shift regularization objective is incorporated to encourage the learning of finer-grained latent representations. The proposed method is evaluated across two continuous-control OpenAI Gym environments: a 2D obstacle-based Car Racing variant and Bipedal Walker variant, where coupled environment parameters jointly influence policy performance. Across five random seeds, our method consistently outperforms vanilla policy training, random parameter sampling, manual curricula, frontier-based methods, Self-Paced Reinforcement Learning (SPRL), Absolute Learning Progress with Gaussian Mixture Models (ALP-GMM), and reverse curriculum learning baselines. Ablation studies further demonstrate the effectiveness of the reparameterized curriculum mechanism across both environments, while highlighting environment-dependent benefits of the auxiliary regularization objective.
- Abstract(参考訳): 自律エージェントのロバストなナビゲーションポリシーは、ターンレート、障害物、摩擦、ピット、斜面など、継続的に変化する環境条件にまたがって一般化されなければならない。
カリキュラム生成は、学習環境を段階的に適応させることで一般化を改善するための原則的なメカニズムを提供するが、そのようなカリキュラムをサンプル効率で自動的に設計することは依然として困難である。
本稿では,一方向勾配最適化を用いた構造化連続環境パラメータの再パラメータ化カリキュラム生成フレームワークを提案する。
画像ベースおよびスカラー入力からなるマルチモーダル観測空間におけるロバスト性を改善するため、よりきめ細かな潜在表現の学習を促進するために、分布シフト正規化目的を組み込んだ。
提案手法は2つの連続制御型OpenAI Gym環境 – 2次元障害物系カーレーシングモデルと2次元ウォーカーモデル – で評価される。
提案手法は,5つのランダムシードに対して,バニラポリシートレーニング,ランダムパラメータサンプリング,手動カリキュラム,フロンティアベース手法,自己更新強化学習(SPRL),ガウス混合モデルを用いた絶対学習進歩(ALP-GMM),リバースカリキュラム学習ベースラインを常に上回っている。
さらに, 補助正規化目標の環境依存的メリットを強調しつつ, 両環境にまたがる再パラメータ化カリキュラム機構の有効性について検討した。
関連論文リスト
- From Noise to Control: Parameterized Diffusion Policies [54.941343992110426]
本研究では,学習行動多様体に埋め込まれた連続パラメータに条件付き拡散ポリシーを学習するためのフレームワークを提案する。
政策重みを更新することなく、既知の戦略間の円滑な距離と、新しい制約への効率的な適応を可能にする。
論文 参考訳(メタデータ) (2026-05-29T20:21:50Z) - LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning [90.86828952599147]
提案するLaST-R1(LaST-R1)は,「最近の推論・行動」政策を活用するために設計された,新しい強化学習フレームワークである。
LaST-R1 は LIBERO ベンチマークで 99.9% の平均成功率を達成した。
実世界の展開では、LaST-R1はSOTAが監督する微調整アプローチよりも22.5%平均的に改善されている。
論文 参考訳(メタデータ) (2026-04-30T17:59:52Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - A Cross-Environment and Cross-Embodiment Path Planning Framework via a Conditional Diffusion Model [6.482051262912219]
本研究の目的は、未確認環境や新しいロボットマニピュレータに再訓練せずに一般化できる経路計画フレームワークを開発することである。
本稿では,Voxelized scene representationsに基づく共同空間軌跡を生成する拡散型計画モデルであるGADGETを提案する。
実験結果から,GADGETは球状障害物,ビンピッキング,シェルフ環境において衝突強度の低い高い高い成功率を達成できた。
論文 参考訳(メタデータ) (2025-10-21T23:30:14Z) - Equivariant Goal Conditioned Contrastive Reinforcement Learning [5.019456977535218]
Contrastive Reinforcement Learning (CRL)は、ラベルのない相互作用から有用な構造化表現を抽出するための有望なフレームワークを提供する。
等変制約を用いた潜在空間をさらに構造化する等変CRLを提案する。
我々のアプローチは、状態ベースと画像ベースの両方の設定において、さまざまなシミュレーションタスクにおいて、強いベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2025-07-22T01:13:45Z) - RISE: Robust Imitation through Stochastic Encoding [0.764671395172401]
本稿では,環境パラメータの誤った測定をポリシー学習に明示的に対応させる,新しい模倣学習フレームワークを提案する。
我々のフレームワークは、障害状態、向き、速度などのパラメータを潜在空間にエンコードし、テスト時間を改善する。
我々は,2つのロボットプラットフォームに対するアプローチを検証するとともに,目標達成性能をベースライン法と比較し,安全性の向上を図っている。
論文 参考訳(メタデータ) (2025-03-15T19:52:16Z) - Reparameterized Policy Learning for Multimodal Trajectory Optimization [61.13228961771765]
本研究では,高次元連続行動空間における強化学習のためのパラメータ化政策の課題について検討する。
本稿では,連続RLポリシーを最適軌道の生成モデルとしてモデル化する原理的フレームワークを提案する。
本稿では,マルチモーダルポリシーパラメータ化と学習世界モデルを活用した実用的モデルベースRL手法を提案する。
論文 参考訳(メタデータ) (2023-07-20T09:05:46Z) - Grounding Aleatoric Uncertainty in Unsupervised Environment Design [32.00797965770773]
部分的に観測可能な設定では、最適ポリシーは、環境のアレタリックなパラメータに対する地道的な分布に依存する可能性がある。
基礎となるトレーニングデータがCICSによってバイアスを受ける場合であっても, 地中実効性関数を最適化するミニマックス後悔UED法を提案する。
論文 参考訳(メタデータ) (2022-07-11T22:45:29Z) - Non-Parametric Stochastic Policy Gradient with Strategic Retreat for
Non-Stationary Environment [1.5229257192293197]
非パラメトリックな最適制御ポリシのシーケンスを学習するための体系的な方法論を提案する。
本手法はDDPG法とTD3法を学習性能の点で大きな差で上回っている。
論文 参考訳(メタデータ) (2022-03-24T21:41:13Z) - A Regularized Implicit Policy for Offline Reinforcement Learning [54.7427227775581]
オフラインの強化学習は、環境とのさらなるインタラクションなしに、固定データセットから学習を可能にする。
フレキシブルだが十分に調整された完全実装ポリシーの学習を支援するフレームワークを提案する。
D4RLデータセットの実験とアブレーション研究により、我々のフレームワークとアルゴリズム設計の有効性が検証された。
論文 参考訳(メタデータ) (2022-02-19T20:22:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。