論文の概要: Deterministic Pareto-Optimal Policy Synthesis for Multi-Objective Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2606.26397v1
- Date: Wed, 24 Jun 2026 21:28:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.08686
- Title: Deterministic Pareto-Optimal Policy Synthesis for Multi-Objective Reinforcement Learning
- Title(参考訳): 多目的強化学習のための決定論的パレート最適ポリシー合成
- Abstract要約: 我々は、チェビシェフのスカラー化から動機付けられた新しい選好条件のベルマン作用素を導入する。
これらの収束Q推定値から決定論的ポリシーを抽出する方法を示す。
実験により,本アルゴリズムは複雑なトレードオフを回復することを確認した。
- 参考スコア(独自算出の注目度): 3.960587756853285
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Real-world decision-making often requires balancing multiple conflicting objectives, a challenge that standard Reinforcement Learning (RL) frequently addresses by aggregating rewards into a single scalar signal. While effective for simple tasks, this approach often fails to capture the full spectrum of optimal trade-offs, known as the Pareto frontier. In this paper, we introduce a novel preference-conditioned Bellman operator, motivated from the Chebyshev scalarization, designed to compute deterministic Pareto-optimal policies for Multi-Objective Markov Decision Processes (MOMDPs). We prove that this operator satisfies an enveloping property, where the estimated value functions upper-bound the true Pareto frontier, and demonstrate that it monotonically converges to a coverage set of this frontier. Furthermore, we also show how to extract deterministic policies from these converged Q-estimates. This ensures the agent can recover a policy for any given preference, capturing the entire Pareto-optimal frontier while guaranteeing each synthesized policy remains approximately Pareto-optimal. Experimental results validate that our algorithm successfully recovers complex trade-offs, providing a solution for deterministic Pareto-optimal policy synthesis.
- Abstract(参考訳): 現実の意思決定は、しばしば複数の矛盾する目標のバランスを必要とする。これは標準強化学習(RL)が1つのスカラー信号に報酬を集約することで頻繁に対処する課題である。
単純なタスクでは有効であるが、このアプローチはパレートフロンティアとして知られる最適なトレードオフの完全なスペクトルを捕捉できないことが多い。
本稿では,多目的マルコフ決定プロセス(MOMDP)に対する決定論的パレート最適ポリシーの計算を目的とした,Chebyshevスカラライゼーションをモチベーションとした新規な選好条件ベルマン演算子を提案する。
この演算子は、推定値が真のパレートフロンティアの上界で機能する包絡性を満たすことを証明し、このフロンティアの被覆集合に単調に収束することを示す。
さらに、これらの収束Q推定値から決定論的ポリシーを抽出する方法も示す。
これにより、エージェントは任意の好みのポリシーを回復し、パレート最適フロンティア全体を捕捉し、各合成されたポリシーがほぼパレート最適であることを保証する。
実験結果から,提案アルゴリズムは複雑なトレードオフを回復し,決定論的パレート最適政策合成のソリューションを提供する。
関連論文リスト
- Exact Model-Free Policy Iteration for Co-safe LTL Planning [2.5735476569508995]
本研究では,有限マルコフ決定過程における共安全線形時間論理のモデル自由強化学習について検討する。
そこで我々は,まずディスカウントされたサロゲートを用いてクランプ集合を同定する2段階のモデルフリー強化学習法を開発した。
我々は、政策評価ステップのほぼ確実に収束と、政策反復アルゴリズムの有限終了を最適ポリシーで証明する。
論文 参考訳(メタデータ) (2026-08-05T16:58:25Z) - A Noise-Robust Elicit-to-Optimize Framework for Distortion Riskmetrics via Inverse Reinforcement Learning [6.58410442967839]
逆強化学習(IRL)と強化学習(RL)を統合したノイズローバスト・エリシット・トゥ・オプティマイズ・フレームワークを提案する。
適応型IRL法では,雑音の観測結果からエージェントの潜在リスク目標を推定する手法を提案する。
総合的な実証研究は、複雑な金融環境におけるフレームワークのエレケーションの正確さと有効性を示している。
論文 参考訳(メタデータ) (2026-07-15T21:22:50Z) - A Single Deep Preference-Conditioned Policy for Learning Pareto Coverage Sets [0.4369550829556578]
非線形スカラー化下での優先-解決対応の特異性と連続性について検討した。
この問題を解決するために,スムーズなTchebycheffスカラー化を単調な効用として用いた。
各更新は、以前のポリシーを参考に、Kullback-Leibler-regularized MDPの解決と等価であることを示す。
論文 参考訳(メタデータ) (2026-05-09T13:35:50Z) - Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards [47.557539197058496]
逆推論のためのランダムポリシー評価(ROVER)について紹介する。
ROVERは、一様政体Q値上のソフトマックスから作用をサンプリングする最小限だが高効率なRL法である。
textbfquality(textbf+8.2 on pass@1, textbf+16.8 on pass@256)と textbfdiversity(textbf+17.6%)の両方で優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2025-09-29T16:09:07Z) - Recursive Reward Aggregation [60.51668865089082]
本稿では,報酬関数の変更を不要としたフレキシブルな行動アライメントのための代替手法を提案する。
マルコフ決定過程(MDP)の代数的視点を導入することにより、ベルマン方程式が報酬の生成と集約から自然に現れることを示す。
我々のアプローチは決定論的および決定論的設定の両方に適用され、価値に基づくアルゴリズムとアクター批判的アルゴリズムとシームレスに統合される。
論文 参考訳(メタデータ) (2025-07-11T12:37:20Z) - Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes [12.666842349236788]
本稿では,ロバストなマルコフ決定過程に対するミラー降下ポリシーの最適化について述べる。
政策勾配法を用いて、ラグランジアン上のポリシー(最大値)と遷移カーネル(最小値)の両方を最適化する。
実験は、制約付きおよび制約なし最適化におけるミラー降下ポリシー最適化の利点を確認する。
論文 参考訳(メタデータ) (2025-06-29T09:55:52Z) - Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes [59.27926064817273]
我々はC-PGと呼ばれる探索非依存のアルゴリズムを導入し,支配的仮定の下でのグローバルな最終点収束保証を享受する。
制約制御タスクにおいて,アクションベース(C-PGAE)とパラメータベース(C-PGPE)の両方を実証的に検証する。
論文 参考訳(メタデータ) (2025-06-06T10:29:05Z) - Non-maximizing policies that fulfill multi-criterion aspirations in expectation [0.7874708385247353]
動的プログラミングおよび強化学習において、エージェントの逐次決定のためのポリシーは通常、目標をスカラー報酬関数として表現することによって決定される。
複数の異なる評価指標を持つ有限非巡回決定マルコフプロセスを考えるが、これは必ずしもユーザが最大化したい量を表すものではない。
提案アルゴリズムは,本課題を簡易性を用いて実現可能集合を近似し,その実現可能性を維持しつつ,前もって願望を伝達することによって達成することを保証する。
論文 参考訳(メタデータ) (2024-08-08T11:41:04Z) - Learning Optimal Deterministic Policies with Stochastic Policy Gradients [62.81324245896716]
政策勾配法(PG法)は連続強化学習(RL法)問題に対処する手法として成功している。
一般的には、収束(ハイパー)政治は、決定論的バージョンをデプロイするためにのみ学習される。
本稿では,サンプルの複雑性とデプロイされた決定論的ポリシのパフォーマンスのトレードオフを最適化するために,学習に使用する探索レベルの調整方法を示す。
論文 参考訳(メタデータ) (2024-05-03T16:45:15Z) - Trust-Region-Free Policy Optimization for Stochastic Policies [60.52463923712565]
本研究では,政策に対する信頼領域の制約が,基礎となるモノトニック改善の保証を損なうことなく,信頼領域のない制約によって安全に置き換えられることを示す。
我々は,TREFree(Trust-Region-Free Policy Optimization)と呼ばれるアルゴリズムを,信頼領域の制約が不要であるとして明示する。
論文 参考訳(メタデータ) (2023-02-15T23:10:06Z) - Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds
Globally Optimal Policy [95.98698822755227]
本研究は,リスクに敏感な深層強化学習を,分散リスク基準による平均報酬条件下で研究する試みである。
本稿では,ポリシー,ラグランジュ乗算器,フェンシェル双対変数を反復的かつ効率的に更新するアクタ批判アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-12-28T05:02:26Z) - Kalman meets Bellman: Improving Policy Evaluation through Value Tracking [59.691919635037216]
政策評価は強化学習(RL)における重要なプロセスである
我々はKalman Optimization for Value Approximation (KOVA)と呼ばれる最適化手法を考案した。
KOVAはパラメータとノイズリターンの不確実性の両方に関する正規化対象関数を最小化する。
論文 参考訳(メタデータ) (2020-02-17T13:30:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。