論文の概要: Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
- arxiv url: http://arxiv.org/abs/2606.00367v1
- Date: Fri, 29 May 2026 21:16:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.361016
- Title: Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
- Title(参考訳): 長期的決定問題におけるペアワイズ選好による強化学習
- Abstract要約: 定常マルコフポリシーはすべての履歴に依存したポリシーの中で最適であり、マルコフ決定競合を正確に解くことはPであり、単純反復アルゴリズムはサブ線形速度で最適ポリシーに収束することを示す。
- 参考スコア(独自算出の注目度): 39.37053034185478
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning problems typically define the goal as maximizing the expected value of a scalar reward function. But, pairwise preferences are often easier to specify than scalar rewards, and they express certain goals that scalar rewards cannot. Methods for reinforcement learning with pairwise preferences have thus received growing interest. Unfortunately, these methods are inefficient in problems with long time horizons, and they lack guarantees on the performance of Markov policies relative to history-dependent policies, which bridge the theory and practice of reinforcement learning. We therefore propose the \textit{Markov decision contest} as a new problem model for reinforcement learning with pairwise preferences. We prove that stationary Markov policies are optimal among all history-dependent policies, that solving a Markov decision contest exactly is in P, and that a simple iterative algorithm converges to an optimal policy at a sublinear rate. Lastly, in a set of high-dimensional decision problems with long time horizons, we show that our approximate algorithm is significantly more learning-efficient than prior work.
- Abstract(参考訳): 強化学習問題は通常、目標をスカラー報酬関数の期待値の最大化として定義する。
しかし、ペアの好みはスカラー報酬よりも簡単に指定でき、スカラー報酬ができない特定の目標を表現する。
相互選好による強化学習の手法に注目が集まっている。
残念なことに、これらの手法は長期的地平線の問題では非効率であり、強化学習の理論と実践を橋渡しする歴史に依存した政策に対するマルコフ政策のパフォーマンスの保証を欠いている。
そこで本稿では,2対の好みを持つ強化学習のための新しい問題モデルとして,‘textit{Markov decision contest’を提案する。
定常マルコフポリシがすべての履歴に依存したポリシの中で最適であること、マルコフ決定競合を正確に解くことはPであり、単純反復アルゴリズムがサブ線形レートで最適ポリシーに収束することを証明する。
最後に、長い時間的地平線を持つ高次元決定問題の集合において、我々の近似アルゴリズムは従来よりも学習効率がかなり高いことを示す。
関連論文リスト
- Optimal Data Acquisition for Reinforcement Learning: A Large Deviations Perspective [5.848643785361479]
本稿では,政策選択誤差確率の指数的減衰率を原理的効率指標として紹介する。
我々は、ネストされた問題の最適解という観点から、最適性の相補的な2つの概念を定式化する。
得られた強化学習アルゴリズムは, 最適性基準の下でほぼロマンスに最適であることが証明された。
論文 参考訳(メタデータ) (2026-05-27T16:08:56Z) - Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes [12.666842349236788]
本稿では,ロバストなマルコフ決定過程に対するミラー降下ポリシーの最適化について述べる。
政策勾配法を用いて、ラグランジアン上のポリシー(最大値)と遷移カーネル(最小値)の両方を最適化する。
実験は、制約付きおよび制約なし最適化におけるミラー降下ポリシー最適化の利点を確認する。
論文 参考訳(メタデータ) (2025-06-29T09:55:52Z) - Learning Optimal Deterministic Policies with Stochastic Policy Gradients [62.81324245896716]
政策勾配法(PG法)は連続強化学習(RL法)問題に対処する手法として成功している。
一般的には、収束(ハイパー)政治は、決定論的バージョンをデプロイするためにのみ学習される。
本稿では,サンプルの複雑性とデプロイされた決定論的ポリシのパフォーマンスのトレードオフを最適化するために,学習に使用する探索レベルの調整方法を示す。
論文 参考訳(メタデータ) (2024-05-03T16:45:15Z) - On Bellman's principle of optimality and Reinforcement learning for
safety-constrained Markov decision process [0.0]
安全強化学習の枠組みである安全制約付きマルコフ決定プロセスの最適性について検討する。
データからラグランジアンを学習するための改良された$Q$-learningアルゴリズムを構築した。
論文 参考訳(メタデータ) (2023-02-25T20:36:41Z) - Policy learning "without" overlap: Pessimism and generalized empirical Bernstein's inequality [94.89246810243053]
本論文は,事前収集した観測値を利用して最適な個別化決定規則を学習するオフライン政策学習について検討する。
既存の政策学習法は、一様重なりの仮定、すなわち、全ての個々の特性に対する全ての作用を探索する正当性は、境界を低くしなければならない。
我々は,点推定の代わりに低信頼度境界(LCB)を最適化する新しいアルゴリズムであるPPLを提案する。
論文 参考訳(メタデータ) (2022-12-19T22:43:08Z) - Reinforcement Learning Policies in Continuous-Time Linear Systems [0.0]
パラメータ推定を慎重にランダムにすることで、最適行動の学習を迅速に行うオンラインポリシーを提案する。
非接触系の力学に対する鋭い安定性を証明し、準最適動作による無限小の後悔を厳密に特定する。
我々の分析は、継続的強化学習における基本的な課題に光を当て、同様の問題に対する有用な基礎となることを示唆している。
論文 参考訳(メタデータ) (2021-09-16T00:08:50Z) - A Boosting Approach to Reinforcement Learning [59.46285581748018]
複雑度が状態数に依存しない意思決定プロセスにおける強化学習のための効率的なアルゴリズムについて検討する。
このような弱い学習手法の精度を向上させることができる効率的なアルゴリズムを提供する。
論文 参考訳(メタデータ) (2021-08-22T16:00:45Z) - Beyond Value-Function Gaps: Improved Instance-Dependent Regret Bounds
for Episodic Reinforcement Learning [50.44564503645015]
有限エピソードマルコフ決定過程における強化学習のための改良されたギャップ依存的後悔境界を提供する。
楽観的なアルゴリズムでは,より強い後悔境界を証明し,多数のMDPに対して新たな情報理論的下限を伴う。
論文 参考訳(メタデータ) (2021-07-02T20:36:05Z) - Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds
Globally Optimal Policy [95.98698822755227]
本研究は,リスクに敏感な深層強化学習を,分散リスク基準による平均報酬条件下で研究する試みである。
本稿では,ポリシー,ラグランジュ乗算器,フェンシェル双対変数を反復的かつ効率的に更新するアクタ批判アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-12-28T05:02:26Z) - Average Reward Adjusted Discounted Reinforcement Learning:
Near-Blackwell-Optimal Policies for Real-World Applications [0.0]
強化学習は、与えられたマルコフ決定プロセスの最適な定常ポリシーを見つけることを目的としている。
本稿では,広く適用されている標準割引強化学習フレームワークについて,理論的考察を行う。
我々はブラックウェル-最適強化学習アルゴリズムを新たに構築する。
論文 参考訳(メタデータ) (2020-04-02T08:05:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。