論文の概要: Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control
- arxiv url: http://arxiv.org/abs/2604.03023v1
- Date: Fri, 03 Apr 2026 13:13:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.478001
- Title: Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control
- Title(参考訳): 高精度制御のための回帰水平クレジットアサインメントを用いた行動制約強化学習
- Authors: Siwei Ju, Jan Tauberschmidt, Oleg Arenz, Peter van Vliet, Jan Peters,
- Abstract要約: 強化学習は高いパフォーマンス戦略を発見することができるが、望ましい人間の行動から離れることが多い。
本研究では,実演を超越した行動制約付き強化学習フレームワークを提案する。
プロのドライバーのデータを用いて,高忠実度レースカーシミュレーションのアプローチを評価する。
- 参考スコア(独自算出の注目度): 13.52467502450336
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learning high-performance control policies that remain consistent with expert behavior is a fundamental challenge in robotics. Reinforcement learning can discover high-performing strategies but often departs from desirable human behavior, whereas imitation learning is limited by demonstration quality and struggles to improve beyond expert data. We propose a behavior-constrained reinforcement learning framework that improves beyond demonstrations while explicitly controlling deviation from expert behavior. Because expert-consistent behavior in dynamic control is inherently trajectory-level, we introduce a receding-horizon predictive mechanism that models short-term future trajectories and provides look-ahead rewards during training. To account for the natural variability of human behavior under disturbances and changing conditions, we further condition the policy on reference trajectories, allowing it to represent a distribution of expert-consistent behaviors rather than a single deterministic target. Empirically, we evaluate the approach in high-fidelity race car simulation using data from professional drivers, a domain characterized by extreme dynamics and narrow performance margins. The learned policies achieve competitive lap times while maintaining close alignment with expert driving behavior, outperforming baseline methods in both performance and imitation quality. Beyond standard benchmarks, we conduct human-grounded evaluation in a driver-in-the-loop simulator and show that the learned policies reproduce setup-dependent driving characteristics consistent with the feedback of top-class professional race drivers. These results demonstrate that our method enables learning high-performance control policies that are both optimal and behavior-consistent, and can serve as reliable surrogates for human decision-making in complex control systems.
- Abstract(参考訳): 専門家の行動に整合した高性能な制御ポリシーを学ぶことは、ロボット工学における根本的な課題である。
強化学習は高いパフォーマンス戦略を発見することができるが、望ましい人間の行動から離れることが多い。
本稿では,専門家の行動から逸脱を明示的に制御しながら,実演を超えて改善する行動制約強化学習フレームワークを提案する。
動的制御におけるエキスパート一貫性の挙動は本質的に軌跡レベルであるため、短期的な将来の軌跡をモデル化し、訓練中にルックアヘッド報酬を提供する後退水平予測機構を導入する。
乱れや変化条件下での人間の行動の自然変動を考慮し、基準軌跡のポリシーを更に条件化し、単一の決定論的対象ではなく、専門家による行動の分布を表現できるようにした。
提案手法は,プロドライバーのデータを用いて,高忠実度レースカーシミュレーションのアプローチを実証的に評価する。
学習したポリシーは、専門家の運転行動と密接な整合を維持しながら、競争的なラップタイムを達成する。
標準ベンチマークの他に、ドライバ・イン・ザ・ループシミュレータで人為的な評価を行い、学習したポリシーが上位クラスのプロレースドライバーのフィードバックと一致した設定依存運転特性を再現することを示す。
これらの結果から, 複雑な制御システムにおいて, 最適かつ行動整合性があり, 人的意思決定のための信頼性の高いサロゲートとして機能する, 高性能な制御ポリシーの学習が可能であることが示唆された。
関連論文リスト
- Expert Knowledge-driven Reinforcement Learning for Autonomous Racing via Trajectory Guidance and Dynamics Constraints [39.69523326789163]
本稿では、自律走行のための誘導軌道と動的制約強化学習(TraD-RL)法を提案する。
提案手法は,テンペルホフ空港街路回路をモデルとした高忠実度シミュレーション環境において評価される。
実験の結果,TraD-RLは自動走行車のラップ速度と走行安定性の両方を効果的に改善することが示された。
論文 参考訳(メタデータ) (2026-03-06T02:51:54Z) - Post-Training and Test-Time Scaling of Generative Agent Behavior Models for Interactive Autonomous Driving [3.8612647047433217]
グループ相対行動最適化は、行動リアリズムを維持しながら安全性を40%以上改善する。
Warm-Kは、動き選択における一貫性と多様性のバランスをとる温かいスタートのTop-Kサンプリング戦略である。
論文 参考訳(メタデータ) (2025-12-15T12:18:50Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Can Large Reasoning Models Self-Train? [51.0277533541394]
多数決投票を簡単な自己フィードバック機構として利用し、強化学習において自己学習が持続できるかどうかを検討する。
この基本的なアプローチは、モデルの推論性能だけでなく、次のRLイテレーションでより良い品質フィードバックを生成する能力も改善します。
しかし、我々の分析では、このような自己学習パラダイムの限界も明らかにしています - 自己回帰の長いRLは、報酬のハッキングにつながるため、突然、そして完全なパフォーマンスが崩壊します。
論文 参考訳(メタデータ) (2025-05-27T17:16:00Z) - Discrete Contrastive Learning for Diffusion Policies in Autonomous Driving [18.624545462468642]
本研究では,既存の運転データから,コントラスト学習を利用して運転スタイルの辞書を抽出する手法を提案する。
我々の経験的評価は、我々のアプローチが生み出す行動が、機械学習ベースのベースライン手法よりも安全かつ人間的であることを確認した。
論文 参考訳(メタデータ) (2025-03-07T08:26:04Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Imitating, Fast and Slow: Robust learning from demonstrations via
decision-time planning [96.72185761508668]
テストタイムでの計画(IMPLANT)は、模倣学習のための新しいメタアルゴリズムである。
IMPLANTは,標準制御環境において,ベンチマーク模倣学習手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2022-04-07T17:16:52Z) - Imitation Learning by State-Only Distribution Matching [2.580765958706854]
観察からの模倣学習は、人間の学習と同様の方法で政策学習を記述する。
本稿では,解釈可能な収束度と性能測定値とともに,非逆学習型観測手法を提案する。
論文 参考訳(メタデータ) (2022-02-09T08:38:50Z) - Behaviorally Diverse Traffic Simulation via Reinforcement Learning [16.99423598448411]
本稿では,自律運転エージェントのための簡易なポリシー生成アルゴリズムを提案する。
提案アルゴリズムは,深層強化学習の表現能力と探索能力を活用することで,多様性と運転能力のバランスをとる。
本手法の有効性を,いくつかの挑戦的な交差点シーンにおいて実験的に示す。
論文 参考訳(メタデータ) (2020-11-11T12:49:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。