論文の概要: Regularized Reward-Punishment Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2606.28152v1
- Date: Fri, 26 Jun 2026 14:50:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.524944
- Title: Regularized Reward-Punishment Reinforcement Learning
- Title(参考訳): 正規化Reward-Punishment強化学習
- Authors: Jiexin Wang, Eiji Uchibe,
- Abstract要約: KL-Coupled Policy Regularization(KCPR)は、Reward-Punishment Reinforcement Learning(RPRL)のための政策調整フレームワークである。
KCPRは、互いに前に動的に学習したものとして扱うことで、協調的なポリシー間の直接的な相互作用を可能にする。
KCSOは結合したソフト最適化ポリシーとKL規則化されたベルマン演算子を出力し、報酬情報と罰情報が共同で価値伝播に影響を与える。
- 参考スコア(独自算出の注目度): 11.968363294876136
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose KL-Coupled Policy Regularization (KCPR), a policy coordination framework for Reward-Punishment Reinforcement Learning (RPRL). Based on KCPR, we derive KL-Coupled Soft Optimality (KCSO) and develop its deep realization, klDMP. Unlike existing RPRL approaches that optimize reward-seeking and punishment-related policies largely independently, KCPR enables direct interactions between companion policies by treating each as a dynamically learned prior for the other. KCSO yields coupled soft-optimal policies and KL-regularized Bellman operators, allowing reward and punishment information to jointly influence value propagation. To improve learning stability, we introduce a companion-prior softening mechanism and evaluate separate replay-buffer designs for balancing reward- and punishment-related experience. Experiments in grid-world and Gazebo robotic navigation tasks demonstrate that klDMP improves safety and learning stability while maintaining competitive task performance compared with DQN, SQL and softDMP. These results suggest that policy-level coordination provides an effective mechanism for integrating multiple behavioral objectives and may serve as a useful design principle for reinforcement learning systems with interacting motivational processes.
- Abstract(参考訳): 本稿では,RPRL(Reward-Punishment Reinforcement Learning)のための政策調整フレームワークであるKL-Coupled Policy Regularization(KCPR)を提案する。
KCPRに基づいて、KL結合型ソフト最適性(KCSO)を導出し、その深い実現であるklDMPを開発する。
報酬の探索と罰に関する政策をほぼ独立に最適化する既存のRPRLアプローチとは異なり、KCPRは、相互に動的に学習される事前として扱うことで、相補的なポリシー間の直接的な相互作用を可能にする。
KCSOは結合したソフト最適化ポリシーとKL規則化されたベルマン演算子を出力し、報酬情報と罰情報が共同で価値伝播に影響を与える。
学習の安定性を向上させるため,報奨と処罰に関する経験のバランスをとるために,相補的事前ソフト化機構を導入し,個別のリプレイバッファ設計を評価する。
グリッドワールドとガゼボのロボットナビゲーションタスクの実験では、klDMPはDQN、SQL、SoftDMPと比較して、競争力のあるタスク性能を維持しながら安全性と学習安定性を向上させる。
これらの結果は、政策レベルの調整が、複数の行動目標を統合する効果的なメカニズムを提供し、相互作用するモチベーションプロセスを持つ強化学習システムにおいて有用な設計原理となることを示唆している。
関連論文リスト
- Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - HCPO: Hierarchical Conductor-Based Policy Optimization in Multi-Agent Reinforcement Learning [27.23172015117646]
本稿では,共同政策の表現能力を直接強化する指揮者型共同政策枠組みを提案する。
また,導体とエージェントのポリシー更新を,性能改善に対応する方向に指示する階層的導体に基づくポリシー最適化アルゴリズムを開発した。
その結果,HCPOは協調効率と安定性に関して,競争力のあるMARLベースラインよりも優れていた。
論文 参考訳(メタデータ) (2025-11-15T09:19:41Z) - Curriculum Learning With Counterfactual Group Relative Policy Advantage For Multi-Agent Reinforcement Learning [15.539607264374242]
マルチエージェント強化学習 (MARL) は, 協調的対人作業において高い性能を示した。
本稿では,自己適応型難易度調整機構を用いた動的カリキュラム学習フレームワークを提案する。
本手法はトレーニングの安定性と最終性能を両立させ,最先端の手法と競合する結果を得る。
論文 参考訳(メタデータ) (2025-06-09T08:38:18Z) - Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving [1.4063588986150455]
本稿では,これらの制約を克服するために,信頼誘導型人間-AIコラボレーション(C-HAC)戦略を開発する。
C-HACは、人間との相互作用を最小限に抑えたヒト誘導政策の迅速かつ安定した学習を実現する。
様々な運転シナリオに対する実験により、C-HACは安全性、効率、全体的な性能において従来の方法よりも大幅に優れていたことが判明した。
論文 参考訳(メタデータ) (2025-06-04T04:31:10Z) - KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning [72.53466291156604]
教師の指導(KD)と自己探索(RL)を通じて推論モデルを協調的に最適化するテキスト化後学習フレームワークである textbfKDRL を提案する。
まず、GRPOとKDを統合する統一目的を定式化し、異なるKL近似、KL係数、報酬誘導KD戦略が学習後の全体的なダイナミクスと性能にどのように影響するかを体系的に検討する。
論文 参考訳(メタデータ) (2025-06-02T19:46:41Z) - Prior Constraints-based Reward Model Training for Aligning Large Language Models [58.33118716810208]
本稿では,この問題を解決するために,事前制約に基づくリワードモデル(PCRM)のトレーニング手法を提案する。
PCRMは、前回の制約、特に各比較ペアの出力間の長さ比とコサイン類似性を、最適化の規模を調節しスコアマージンを制御するための報酬モデルトレーニングに組み入れている。
実験結果から,PCRMは報酬スコアのスケーリングを効果的に抑制することによりアライメント性能を著しく向上することが示された。
論文 参考訳(メタデータ) (2024-04-01T07:49:11Z) - COPR: Continual Human Preference Learning via Optimal Policy Regularization [54.4973136224034]
RLHF(Reinforcement Learning from Human Feedback)は、大規模言語モデル(LLM)と人間の嗜好の整合性を改善するために一般的に用いられる。
本稿では,最適政策理論からインスピレーションを得たCOPR法を提案する。
論文 参考訳(メタデータ) (2024-02-22T02:20:08Z) - Coherent Soft Imitation Learning [17.345411907902932]
模倣学習法は、政策の行動クローニング(BC)や報酬の逆強化学習(IRL)を通じて専門家から学ぶ。
この研究は、BCとIRLの両方の強度を捉える模倣法に由来する。
論文 参考訳(メタデータ) (2023-05-25T21:54:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。