論文の概要: A Hierarchy of Policy Learning Problems
- arxiv url: http://arxiv.org/abs/2607.03385v1
- Date: Fri, 03 Jul 2026 14:40:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.602215
- Title: A Hierarchy of Policy Learning Problems
- Title(参考訳): 政策学習問題の階層化
- Authors: Hamsa Bastani, Osbert Bastani, Shihan Chen,
- Abstract要約: 政策学習問題間の関係を研究するための枠組みを提供する。
政策存在問題は、改善政策問題に還元されることが示される。
これらの結果は、幅広い政策学習問題を研究する上での価値を強調している。
- 参考スコア(独自算出の注目度): 25.912923963157752
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Policy learning has received substantial attention with the goal of learning policies from observational data for decision-making. A majority of work in this space has focused on developing algorithms for computing policies that minimize regret compared to the optimal policy. However, in many practical settings, there is insufficient data to obtain low regret. As a result, recent work has shifted attention to alternative objectives, most notably, studying whether it is possible to learn an improving policy that statistically significantly outperforms baseline policies. We argue that there is substantial merit in studying a broader range of policy learning problems. When there is insufficient data to learn an improving policy, there may still be useful questions that can be answered. To this end, we provide a mathematical framework for studying the relationships between policy learning problems. We formalize three problems within our framework: beyond the optimal policy problem and the improving policy problem, we also propose the policy existence problem, which aims to determine if an improving policy exists. Within our framework, we show that the policy existence problem reduces to the improving policy problem, which in turn reduces to the optimal policy problem; these reductions prove that each problem is at least as easy as the next one (in sample complexity). A key question remains: is this hardness strict? We provide partial answers. First, the gap between the optimal policy and improving policy problems is strict. For the improving policy and policy existence problems, we prove that a sublinear polynomial gap exists under natural conditions on improving policy learning algorithms. Thus, we may be able to answer questions about the existence of an improving policy even when we cannot find one. These results highlight the value in studying a broader range of policy learning problems.
- Abstract(参考訳): 政策学習は、意思決定のための観察データから政策を学ぶことを目的として、大きな注目を集めている。
この分野の作業の大部分は、最適ポリシーと比較して後悔を最小限に抑える、コンピューティングポリシーのためのアルゴリズムの開発に重点を置いている。
しかし、多くの実践的な設定では、少ない後悔を得るには不十分なデータがある。
その結果、最近の研究は代替目的に注目が移り、特に、統計的にベースライン政策を著しく上回る改善政策を学べるかどうかを研究している。
我々は、幅広い政策学習問題を研究する上で大きなメリットがあると主張している。
改善方針を学ぶのに不十分なデータがある場合、答えられる有用な質問がまだあるかもしれない。
この目的のために,政策学習問題間の関係を研究するための数学的枠組みを提供する。
我々は、最適政策問題と改善政策問題に加えて、改善政策が存在するかどうかを判断する政策存在問題も提案する。
枠組みの中では、政策存在問題は改善政策問題に還元され、結果的に最適な政策問題に還元され、これらの還元は、各問題が次の問題(サンプル複雑度)と同じくらい簡単なことを証明している。
この硬さは厳格か?
私たちは部分的に答えを出します。
第一に、最適政策と政策改善のギャップは厳格である。
政策と政策存在問題を改善するために,政策学習アルゴリズムの改良に関する自然条件下での非線形多項式ギャップの存在を証明した。
したがって、見つからない場合でも、改善政策の存在についての質問に答えることができるかもしれない。
これらの結果は、幅広い政策学習問題を研究する上での価値を強調している。
関連論文リスト
- Partial Policy Gradients for RL in LLMs [43.33467583837307]
政策勾配における政策構造をモデル化するための自然なアプローチを提案する。
より小さな部分集合はより単純なポリシーを表しており、経験的勾配推定がより正確であるため、より確実に学習することができる。
我々は,複数のペルソナ・アライメントの会話問題に対して,経験的な政策評価を行った。
論文 参考訳(メタデータ) (2026-03-06T10:47:41Z) - Quantile-Optimal Policy Learning under Unmeasured Confounding [55.72891849926314]
ここでは,報酬分布が (0, 1) で最大$alpha$-quantileを持つポリシーを見つけることを目標とする量子最適政策学習について検討する。
このような問題は、(i)報酬分布の関数としての量子目標の非線形性、(ii)未観測の共起問題、(iii)オフラインデータセットのカバー不足という3つの大きな課題に悩まされている。
論文 参考訳(メタデータ) (2025-06-08T13:37:38Z) - Residual Policy Gradient: A Reward View of KL-regularized Objective [48.39829592175419]
強化学習と模倣学習は多くの領域で広く成功しているが、実世界の展開には制約が残っている。
ポリシーのカスタマイズは、その固有の特性を維持しつつ、新しいタスク固有の要件を満たしながら、事前のポリシーに適応することを目的として導入された。
ポリシーのカスタマイズに対する原則的なアプローチはResidual Q-Learning (RQL)であり、マルコフ決定プロセス(MDP)として問題を定式化し、価値に基づく学習アルゴリズムのファミリを導出する。
RQLをポリシーグラデーションメソッドに拡張し、グラデーションベースのRL設定でのポリシーカスタマイズを可能にするResidual Policy Gradient(RPG)を導入する。
論文 参考訳(メタデータ) (2025-03-14T02:30:13Z) - Conservative Exploration for Policy Optimization via Off-Policy Policy
Evaluation [4.837737516460689]
我々は,少なくとも学習者がその性能を保証できなければならない保守的な探索の問題を,少なくとも基本方針と同程度によく研究する。
連続有限ホライゾン問題におけるポリシー最適化のための最初の保守的証明可能なモデルフリーアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-12-24T10:59:32Z) - Towards A Unified Policy Abstraction Theory and Representation Learning
Approach in Markov Decision Processes [39.94472154078338]
本稿では,異なるレベルでの政策特徴に関連する3種類の政策抽象化を含む統一的な政策抽象化理論を提案する。
そして、それらを3つの政策指標に一般化し、政策の距離(すなわち類似性)を定量化する。
実証実験では,政策の差異を識別し,政策の一般化を伝達する上で,提案した政策指標と表現の有効性について検討する。
論文 参考訳(メタデータ) (2022-09-16T03:41:50Z) - CAMEO: Curiosity Augmented Metropolis for Exploratory Optimal Policies [62.39667564455059]
最適政策の分布を考察し研究する。
実験シミュレーションでは、CAMEOは古典的な制御問題を全て解決するポリシーを実際に得ることを示した。
さらに,本論文では,異なるリスクプロファイルを示す異なるポリシーを,解釈可能性に関する興味深い実践的応用に対応して提示する。
論文 参考訳(メタデータ) (2022-05-19T09:48:56Z) - PG3: Policy-Guided Planning for Generalized Policy Generation [25.418642034856365]
本稿では,政策探索の指針となるスコア関数に着目した一般政策探索手法について検討する。
このアプローチの背景にある主な考え方は、その候補を評価するためのメカニズムとして、トレーニング問題の計画立案に候補ポリシーを使うべきだということです。
6つのドメインの実証的な結果は、PG3が複数のベースラインよりも効率的かつ効果的に一般化されたポリシーを学習していることを確認する。
論文 参考訳(メタデータ) (2022-04-21T21:59:25Z) - Accelerating Safe Reinforcement Learning with Constraint-mismatched
Policies [34.555500347840805]
本稿では,ベースライン制御ポリシと学習者が満たさなければならない制約のセットを備える場合の強化学習の問題点について考察する。
本稿では,タスクに対する期待リターンの最大化,基本方針への距離の最小化,制約満足度セットへのポリシーの投影とを交互に行う反復的ポリシ最適化アルゴリズムを提案する。
我々のアルゴリズムは、最先端のベースラインを一貫して上回り、制約違反を10倍少なくし、平均で40%高い報酬を得る。
論文 参考訳(メタデータ) (2020-06-20T20:20:47Z) - Policy Evaluation Networks [50.53250641051648]
我々は,簡潔な埋め込みにおいて重要なポリシー情報を保持できる,スケーラブルで差別化可能なフィンガープリント機構を導入する。
実験の結果、これらの3つの要素を組み合わせることで、トレーニングデータを生成するものよりも優れたポリシーを作成できることが示された。
論文 参考訳(メタデータ) (2020-02-26T23:00:27Z) - Preventing Imitation Learning with Adversarial Policy Ensembles [79.81807680370677]
模倣学習は、政策プライバシに関する問題を引き起こす専門家を観察することで、ポリシーを再現することができる。
プロプライエタリなポリシーをクローンする外部オブザーバに対して、どうすれば保護できるのか?
新しい強化学習フレームワークを導入し、準最適政策のアンサンブルを訓練する。
論文 参考訳(メタデータ) (2020-01-31T01:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。