論文の概要: Convex-Concave Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.09108v1
- Date: Tue, 06 Oct 2026 20:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.603868
- Title: Convex-Concave Reinforcement Learning
- Title(参考訳): 凸凹強化学習
- Abstract要約: 政策学習は、今日の政策学習の最も簡潔で高密度な応用の多くを推進している。
しかし、それが抱える中核的な問題は、直接的なポリシーパラメータ化の下でもリターンを最大化することです。
この一見非構造的な構造は実際には問題ではないことを示す。
- 参考スコア(独自算出の注目度): 12.326242110978853
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Policy learning drives many of the most consequential and heavily-invested applications of reinforcement learning today. Yet the core optimization problem it rests on (maximizing expected return) is notoriously non-convex, even under a direct policy parameterization, and the field has largely responded by avoiding it: optimizing convex surrogate approximations of the return under trust-region constraints (NPG, TRPO, PPO, AWR). We show that this seemingly unstructured problem is not actually structureless. In log-density-ratio coordinates $y := \log[π/π_n]$, the exact per-iteration objective, computable via per-decision importance sampling (PDIS), is a difference-of-convex-constrained difference-of-convex (DC-constrained DC) program. This structure lets us move beyond surrogate approximations: it recovers CPI, NPG, TRPO, and AWR as special cases along interpretable axes, and it opens a multi-step axis $k$ that couples consecutive decisions. We solve the per-iteration program with sequential convex programming (SCP), the standard solver for difference-of-convex problems, and give convergence guarantees under mild conditions, bridging the difference-of-convex optimization and RL literatures. Empirically, multi-step Convex-Concave RL (CCRL) wins on diagnostic MDPs where credit must propagate across a horizon (its advantage growing with the dependency length), is competitive with a tuned PPO on classic control, and on a realistic, stochastic, mid-horizon healthcare domain converges markedly faster than tuned PPO to the same near-optimal survival, with an 11.3% higher area under the training curve.
- Abstract(参考訳): 政策学習は、今日の強化学習の最も重要かつ徹底した応用の多くを推進している。
しかし、その中心となる最適化問題は(期待されるリターンを最大化する)直接の方針パラメータ化の下でも非凸であることで知られており、この分野は、信頼範囲制約(NPG, TRPO, PPO, AWR)の下でのリターンのサロゲート近似を最適化することで、それを避けることで大きく対応している。
この一見非構造的な問題は、実際には無構造ではないことを示す。
log-density-ratio coordinates $y := \log[π/π_n]$, the exact per-iteration objective, computable via per-decision importance sample (PDIS), is a difference-of-convex-constrained difference-of-convex (DC-constrained DC) program。
この構造により、CPI, NPG, TRPO, AWR を解釈可能な軸に沿って特殊ケースとして回収し、連続的な決定を交わす多段軸 $k$ を開くことができる。
逐次凸計画 (SCP) を用いて, 逐次凸計画 (SCP) を解き, 軽度条件下での収束保証を行い, 差分凸最適化とRL文献をブリッジする。
実証的に、マルチステップのConvex-Concave RL(CCRL)は、水平線を越えて信用が伝播しなければならない診断(依存性長の増大に有利な)で勝利し、古典的なコントロールで調整されたPPOと競合する。
関連論文リスト
- MoSSP: A Momentum-Based Single-Loop Stochastic Penalty Method for Nonconvex Constrained DC-Regularized Optimization [6.024178662558234]
本稿では,DC正則化を用いた非制約問題のクラスを示す。
証明可能な複雑性保証を伴う問題に対してMomentum Mo Mo Penalty法を提案する。
論文 参考訳(メタデータ) (2026-05-28T09:06:26Z) - Weakly Time-Coupled Approximation of Markov Decision Processes [3.573962752571186]
有限水平マルコフ決定プロセス(MDPs)は、ベルムダンのバリュエーションやエクササイズ、リアルオプションなど、運用と金融に発生する。
共通近似は基底関数を用いた値関数を表すが、重み付け方法は異なる段階最適化を扱う。
この結合は近似アーキテクチャのアーチファクトであり、段差依存が地平線に依存しない弱時間結合近似(WTCA)を開発する。
論文 参考訳(メタデータ) (2026-03-13T04:14:42Z) - Closing the Approximation Gap of Partial AUC Optimization: A Tale of Two Formulations [121.39938773554523]
ROC曲線の下の領域(AUC)は、クラス不均衡と決定制約の両方を持つ実世界のシナリオにおける重要な評価指標である。
PAUC最適化の近似ギャップを埋めるために,2つの簡単なインスタンス単位のミニマックス修正を提案する。
得られたアルゴリズムは、サンプルサイズと典型的な一方方向と双方向のPAUCに対して$O(-2/3)$の収束率の線形パーイテレーション計算複雑性を享受する。
論文 参考訳(メタデータ) (2025-12-01T02:52:33Z) - Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function Approximation [32.74649239695449]
制約決定過程(CMDP)における強化学習問題について検討する。
本稿では,リニアCMDPに対するRLアルゴリズムを提案する。
その結果,近年の線形CMDPアルゴリズムでは,制約に違反するか,指数計算コストに悪影響を及ぼす結果が得られた。
論文 参考訳(メタデータ) (2025-02-14T13:07:25Z) - Efficiently Training Deep-Learning Parametric Policies using Lagrangian Duality [55.06411438416805]
制約付きマルコフ決定プロセス(CMDP)は、多くの高度な応用において重要である。
本稿では,パラメトリックアクターポリシーを効率的に訓練するための2段階深度決定規則(TS-DDR)を提案する。
現状の手法と比較して, 解の質を高め, 数桁の計算時間を削減できることが示されている。
論文 参考訳(メタデータ) (2024-05-23T18:19:47Z) - Stable Nonconvex-Nonconcave Training via Linear Interpolation [51.668052890249726]
本稿では,ニューラルネットワークトレーニングを安定化(大規模)するための原理的手法として,線形アヘッドの理論解析を提案する。
最適化過程の不安定性は、しばしば損失ランドスケープの非単調性によって引き起こされるものであり、非拡張作用素の理論を活用することによって線型性がいかに役立つかを示す。
論文 参考訳(メタデータ) (2023-10-20T12:45:12Z) - Faster Algorithm and Sharper Analysis for Constrained Markov Decision
Process [56.55075925645864]
制約付き意思決定プロセス (CMDP) の問題点について検討し, エージェントは, 複数の制約を条件として, 期待される累積割引報酬を最大化することを目的とする。
新しいユーティリティ・デュアル凸法は、正規化ポリシー、双対正則化、ネステロフの勾配降下双対という3つの要素の新たな統合によって提案される。
これは、凸制約を受ける全ての複雑性最適化に対して、非凸CMDP問題が$mathcal O (1/epsilon)$の低い境界に達する最初の実演である。
論文 参考訳(メタデータ) (2021-10-20T02:57:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。