論文の概要: A Single Deep Preference-Conditioned Policy for Learning Pareto Coverage Sets
- arxiv url: http://arxiv.org/abs/2605.08946v1
- Date: Sat, 09 May 2026 13:35:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.983783
- Title: A Single Deep Preference-Conditioned Policy for Learning Pareto Coverage Sets
- Title(参考訳): パレート被覆集合を学習するための1つの深層述語ポリシー
- Authors: Akihiro Kubo, Kosuke Nakanishi, Shin Ishii,
- Abstract要約: 非線形スカラー化下での優先-解決対応の特異性と連続性について検討した。
この問題を解決するために,スムーズなTchebycheffスカラー化を単調な効用として用いた。
各更新は、以前のポリシーを参考に、Kullback-Leibler-regularized MDPの解決と等価であることを示す。
- 参考スコア(独自算出の注目度): 0.4369550829556578
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Preference-conditioned multi-objective reinforcement learning aims to learn a single policy that captures trade-offs across preferences, but under nonlinear scalarization the uniqueness and continuity of the preference-to-solution correspondence remain unclear. We study this problem in tabular multi-objective Markov decision processes (MDPs) using smooth Tchebycheff scalarization as a monotone utility. Under mild interior conditions on the preference set, we prove that each preference induces a unique Pareto-optimal return vector and that this vector depends Lipschitz-continuously on the preference, providing a principled foundation for preference sweeping toward dense Pareto-front coverage. To compute these targets, we formulate the problem over occupancy measures and derive Concave Mirror Descent Policy Iteration (CMDPI), which achieves an $O(1/k)$ objective-suboptimality rate. We further show that each update is equivalent to solving a Kullback-Leibler-regularized MDP with the previous policy as reference, yielding a policy-iteration interpretation and finite-iterate policy continuity across preferences. We instantiate the update as a deep actor-critic algorithm preserving previous-policy regularization. On eight MO-Gymnasium tasks, it achieves the best average hypervolume rank among recent baselines and strong expected-utility performance. Continuous-control experiments indicate gains beyond the discrete-action setting.
- Abstract(参考訳): 優先条件付き多目的強化学習は、選好間のトレードオフを捉える単一の方針を学ぶことを目的としているが、非線形スキャラライズの下では、選好対解決対応の独自性と連続性は不明確である。
単調なチェビシェフスキャラライゼーションを単調な効用として用いた表層多目的マルコフ決定過程(MDP)においてこの問題を考察する。
選好集合上の穏やかな内部条件の下で、各選好が一意なパレート最適回帰ベクトルを誘導し、このベクターがリプシッツ-連続的に選好に依存することを証明し、より密なパレート-フロント被覆に対する選好の根本的基礎を与える。
これらの目標を計算するために、占有率の問題を定式化し、CMDPI(Concave Mirror Descent Policy Iteration)を導出する。
さらに、各更新は、以前のポリシーを参考に、Kullback-Leibler-regularized MDPの解決と等価であることを示し、ポリシーイテレーションの解釈と優先事項間の有限イテレートポリシーの継続性を導出する。
我々は、この更新を、前政界の正規化を保ったディープアクター批判アルゴリズムとしてインスタンス化する。
8つのMO-Gymnasiumタスクにおいて、近年のベースラインと高い期待ユーティリティ性能の中で、平均超体積ランクを達成している。
連続制御実験は、離散的なアクション設定以上の利得を示す。
関連論文リスト
- Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization [2.595968385299781]
多目的強化学習は、複数の、しばしば矛盾する目標のバランスをとる政策を学ぼうとする。
PPOベースのフレームワークである$D3PO$を導入し、これらの問題に直接対処するために、多目的ポリシー最適化を再編成する。
D3PO$は、分解された最適化パイプラインを通じてオブジェクトごとの学習信号を保存し、安定化後にのみ好みを統合する。
論文 参考訳(メタデータ) (2026-02-08T01:45:01Z) - Coverage Improvement and Fast Convergence of On-policy Preference Learning [67.36750525893514]
言語モデルアライメントのためのオンラインのオンラインプライオリティ学習アルゴリズムは、オフラインのアルゴリズムよりも大幅に優れている。
我々は,サンプリング政策の包括的範囲が政治訓練を通じてどのように進展するかを分析する。
一般機能クラス設定における報奨蒸留のための原則的オンライン方式を開発した。
論文 参考訳(メタデータ) (2026-01-13T10:46:06Z) - Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient [18.64288030584699]
異種多エージェント強化学習(MARL)
逐次計算された$Q_psi*(s,a_1:i)$を、Q関数から派生した$phi_psi*(s,a_1:i)$に客観的に置き換える。
一般化Q批判(GQC)を批判関数とし、悲観的不確実性制約損失を用いて異なるQ値推定を最適化する。
論文 参考訳(メタデータ) (2025-07-14T07:16:01Z) - Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning [66.4260157478436]
政策学習における強化学習について検討する。
目的は、特定の種類の利害関係において最高の政策と競争力のある政策を見つけることである。
論文 参考訳(メタデータ) (2025-07-06T14:40:05Z) - Importance-Weighted Offline Learning Done Right [16.4989952150404]
文脈的帯域幅問題におけるオフラインポリシー最適化の問題について検討する。
目標は、準最適行動ポリシーによって収集された決定データのデータセットに基づいて、ほぼ最適ポリシーを学ぶことである。
我々は、citet2015の「単純探索」推定に基づく単純な代替手法が、過去の全ての結果よりもほぼ全ての可能な条件で優れた性能保証を与えることを示した。
論文 参考訳(メタデータ) (2023-09-27T16:42:10Z) - Provable Offline Preference-Based Reinforcement Learning [95.00042541409901]
本研究では,PbRL(Preference-based Reinforcement Learning)の問題について,人間のフィードバックを用いて検討する。
我々は、報酬が軌道全体にわたって定義できる一般的な報酬設定について考察する。
我々は, 軌道毎の集中性によって上界に拘束できる新しい単極集中係数を導入する。
論文 参考訳(メタデータ) (2023-05-24T07:11:26Z) - First-order Policy Optimization for Robust Markov Decision Process [40.2022466644885]
我々はロバストマルコフ決定過程(MDP)の解法を考える。
MDPは、不確実な遷移カーネルを持つ割引状態、有限状態、有限作用空間 MDP の集合を含む。
$(mathbfs,mathbfa)$-矩形不確かさ集合に対して、ロバストな目的に関するいくつかの構造的な観察を確立する。
論文 参考訳(メタデータ) (2022-09-21T18:10:28Z) - Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs [113.8752163061151]
非定常線形カーネルマルコフ決定過程(MDP)におけるエピソード強化学習(RL)の研究
線形最適化アンダーライン最適化アルゴリズム(PROPO)を提案する。
PROPOはスライディングウィンドウベースのポリシー評価と周期的リスタートベースのポリシー改善の2つのメカニズムを特徴としている。
論文 参考訳(メタデータ) (2021-10-18T02:33:20Z) - Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds
Globally Optimal Policy [95.98698822755227]
本研究は,リスクに敏感な深層強化学習を,分散リスク基準による平均報酬条件下で研究する試みである。
本稿では,ポリシー,ラグランジュ乗算器,フェンシェル双対変数を反復的かつ効率的に更新するアクタ批判アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-12-28T05:02:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。