論文の概要: Optimal Reward Shaping: Autonomous Car Parking Case Study
- arxiv url: http://arxiv.org/abs/2607.23617v1
- Date: Sun, 26 Jul 2026 11:49:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.171503
- Title: Optimal Reward Shaping: Autonomous Car Parking Case Study
- Title(参考訳): 最適なリワードシェイピング:自動駐車ケーススタディ
- Abstract要約: 本稿では、アライメントフィードバック、ドライブ方向スイッチの正規化、および自律並列駐車タスクで評価されたアライメントエピソード終了機構を特徴とするパラメータ化報酬形成フレームワークを提案する。
共最適化されたディープQネットワーク(DQN)エージェントは,サロゲートに基づくベイズ最適化を用いて特性制御障害モードを解く。
- 参考スコア(独自算出の注目度): 1.1458853556386799
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Designing effective reward functions for model-free reinforcement learning under non-holonomic constraints remains a persistent challenge, often resulting in severe local minima such as policy paralysis or over-conservative hazard avoidance. In this work, we present a parameterized reward shaping framework featuring coverage-gated alignment feedback, drive-direction switch regularization, and an aligned episode termination mechanism evaluated on an autonomous parallel parking task. Crucially, we show that environmental reward parameters and algorithmic hyperparameters are deeply co-dependent, requiring joint meta-optimization to achieve stable convergence. By employing surrogate-based Bayesian optimization, our co-optimized Deep Q-Network (DQN) agent resolves characteristic control failure modes, significantly outperforming uncalibrated baselines across both success rate and trajectory smoothness.
- Abstract(参考訳): 非ホロノミック制約下でモデルレス強化学習のための効果的な報酬関数を設計することは、永続的な課題であり、しばしば政策の麻痺や過保守的ハザード回避のような深刻な局所的なミニマをもたらす。
本研究では,自動並列駐車作業において,カバーゲート型アライメントフィードバック,ドライブ方向スイッチの正規化,およびアライメント型エピソード終了機構を特徴とするパラメータ化報酬形成フレームワークを提案する。
重要なことは、環境報酬パラメータとアルゴリズムのハイパーパラメーターが深く相互依存していることを示し、安定した収束を達成するためには共同メタ最適化が必要である。
共最適化されたディープQネットワーク(DQN)エージェントは,サロゲートに基づくベイズ最適化を用いて特性制御障害モードを解く。
関連論文リスト
- Safe Overtaking for Autonomous Racing Using Hierarchical Optimization and Learning-Based Control [14.05083688629287]
本稿では,安全確認軌道制御から操作レベルの意思決定を分離する階層的オーバーテイクフレームワークを提案する。
強化学習ポリシは、離散時間CBF減衰パラメータをオンラインで適応し、車両入力を直接制御することなく、コンテキスト依存の安全マージンの変調を可能にする。
論文 参考訳(メタデータ) (2026-07-15T00:19:14Z) - Saturation-Aware Robust Trajectory Optimization for Reusable Launch Vehicles via Differentiable Physics [9.011250637911248]
再利用可能なロケットの高アングル・オブ・アタック・フリップ操作は、ロバストな軌道最適化の課題を示す。
本稿では飽和を考慮したロバスト軌道最適化のための微分可能な物理フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-02T14:30:37Z) - Momentum-constrained Hybrid Heuristic Trajectory Optimization Framework with Residual-enhanced DRL for Visually Impaired Scenarios [20.048701695146963]
本稿では,Momentum-Constrained Hybrid Heuristic Trajectory Optimization Framework (MHTOF)を提案する。
快適性と安全性の両立を図るため,Huristic Trajectory Smpling Cluster (HTSC) とMomentum-Constrained Trajectory Optimization (MTO) を設計した。
複雑な動的シナリオでは、MHHTOFはリスクを低減した安定した速度と加速度曲線を示す。
論文 参考訳(メタデータ) (2026-04-16T13:16:00Z) - Robust Co-design Optimisation for Agile Fixed-Wing UAVs [0.359986669039879]
自律システムの共同設計は、シーケンシャルなアプローチの強力な代替手段として現れてきた。
我々は、アジャイルの固定翼UAVのための堅牢な共同設計フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-11T15:56:14Z) - On the Plasticity and Stability for Post-Training Large Language Models [54.757672540381236]
塑性と安定性勾配の矛盾として根本原因を同定する。
本稿では,確率的衝突解決法(PCR)を提案する。
PCRはトレーニングの軌道を著しく滑らかにし、様々な推論タスクにおいて優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-06T07:31:26Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - QoS-Aware Hierarchical Reinforcement Learning for Joint Link Selection and Trajectory Optimization in SAGIN-Supported UAV Mobility Management [52.15690855486153]
宇宙空間統合ネットワーク (SAGIN) がユビキタスUAV接続を実現するための重要なアーキテクチャとして登場した。
本稿では,SAGINにおけるUAVモビリティ管理を制約付き多目的関節最適化問題として定式化する。
論文 参考訳(メタデータ) (2025-12-17T06:22:46Z) - ADARL: Adaptive Low-Rank Structures for Robust Policy Learning under Uncertainty [28.291179179647795]
我々は、ロバスト性を改善する二段階最適化フレームワークであるtextbfAdaptive Rank Representation (AdaRL) を提案する。
下位レベルでは、AdaRLは、センチュロイドモデルの周りにあるワッサーシュタイン球からサンプリングされた力学を用いて、固定ランク制約の下でポリシー最適化を行う。
上層では、偏微分トレードオフのバランスをとるためにランクを適応的に調整し、ポリシーパラメータを低階多様体に投影する。
論文 参考訳(メタデータ) (2025-10-13T20:05:34Z) - Resilient Constrained Reinforcement Learning [87.4374430686956]
本稿では,複数の制約仕様を事前に特定しない制約付き強化学習(RL)のクラスについて検討する。
報酬訓練目標と制約満足度との間に不明確なトレードオフがあるため、適切な制約仕様を特定することは困難である。
我々は、ポリシーと制約仕様を一緒に検索する新しい制約付きRLアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-28T18:28:23Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。