論文の概要: Smooth Learning with Hard Constraints via Legendre-Regularized Policies
- arxiv url: http://arxiv.org/abs/2607.24007v1
- Date: Mon, 27 Jul 2026 05:09:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.316993
- Title: Smooth Learning with Hard Constraints via Legendre-Regularized Policies
- Title(参考訳): 伝説的規則化政策による制約付き平滑な学習
- Authors: Zikun Lin, Rui Chen, Yijie Wang,
- Abstract要約: 望ましいポリシークラスは、リッチなコンテキスト-決定関係を学ぶのに十分な表現力を持つべきである。
既存のアプローチは通常、これらの要件の一部だけを強調する。
本稿では,正規化最適化問題の解として決定をパラメータ化するレジェンダ規則化ポリシーを提案する。
- 参考スコア(独自算出の注目度): 7.443661873840447
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We revisit contextual optimization from the perspective of policy class design. A desirable policy class should be expressive enough to learn rich context-decision relationships, should enforce hard feasibility constraints rather than soft penalty terms, and should remain smooth enough for gradient-based training on downstream decision losses. Existing approaches usually emphasize only part of these requirements. We propose Legendre-regularized policies, which parameterize decisions as solutions of regularized optimization problems over the original feasible region. This construction yields policies that are feasible by construction and differentiable with respect to learned latent parameters. We prove that the associated optimizer map is single-valued, maps onto the relative interior of the feasible set, admits an explicit Jacobian, is Lipschitz continuous, and can be made arbitrarily smooth. We also establish a universal approximation result showing that the proposed class can approximate any continuous feasible policy on compact context sets. The framework unifies explicitly regularized optimizers and implicit perturbation-based smooth optimizers. Experiments on contextual newsvendor and resource allocation problems show that our approach improves prescriptive performance relative to the benchmark methods.
- Abstract(参考訳): 我々は、ポリシークラス設計の観点から文脈最適化を再考する。
望ましい政策クラスは、リッチな文脈決定関係を学ぶのに十分な表現力を持ち、ソフトペナルティ用語よりもハードファシビリティ制約を強制し、下流の意思決定損失に対する勾配に基づくトレーニングを十分に円滑に行うべきである。
既存のアプローチは通常、これらの要件の一部だけを強調する。
本稿では,正規化最適化問題の解として決定をパラメータ化するレジェンダ規則化ポリシーを提案する。
この構成は、構築によって実現可能であり、学習された潜在パラメータに関して微分可能なポリシーをもたらす。
我々は、関連するオプティマイザ写像が単値であり、実現可能な集合の相対的な内部に写像し、明示的なヤコビアンを認め、リプシッツ連続であり、任意に滑らかにすることができることを証明した。
また、提案クラスがコンパクトな文脈集合上で連続可能なポリシーを近似できることを示す普遍近似結果も確立する。
このフレームワークは、明示的に正規化されたオプティマイザと暗黙の摂動に基づくスムーズなオプティマイザを統一する。
文脈ニュースベンダの実験と資源配分問題により,我々の手法は,ベンチマーク手法と比較して規範的性能の向上を図っている。
関連論文リスト
- Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning [66.4260157478436]
政策学習における強化学習について検討する。
目的は、特定の種類の利害関係において最高の政策と競争力のある政策を見つけることである。
論文 参考訳(メタデータ) (2025-07-06T14:40:05Z) - Optimal Baseline Corrections for Off-Policy Contextual Bandits [61.740094604552475]
オンライン報酬指標の偏りのないオフライン推定を最適化する意思決定ポリシーを学習することを目指している。
学習シナリオにおける同値性に基づく単一のフレームワークを提案する。
我々のフレームワークは、分散最適非バイアス推定器の特徴付けを可能にし、それに対する閉形式解を提供する。
論文 参考訳(メタデータ) (2024-05-09T12:52:22Z) - Constraint-Generation Policy Optimization (CGPO): Nonlinear Programming for Policy Optimization in Mixed Discrete-Continuous MDPs [21.246169498568342]
CGPOは、表現力のある非線形力学を持つ多くのDC-MDPに対して、無限の範囲の初期状態に対する有界なポリシーエラーを保証する。
CGPOは、最悪の状態軌跡を生成して、政策上の欠陥を診断し、最適な行動の反実的な説明を提供する。
在庫管理,貯水池管理,物理制御など,各種分野におけるCGPOの適用性について実験的に検証した。
論文 参考訳(メタデータ) (2024-01-20T07:12:57Z) - Policy Gradient Algorithms Implicitly Optimize by Continuation [7.351769270728942]
我々は、政策段階的なアルゴリズムの探索は、目の前にある政策の回帰の継続であり、その回帰を最大化するよりも、政策は歴史に依存しているべきだと論じる。
論文 参考訳(メタデータ) (2023-05-11T14:50:20Z) - Policy learning "without" overlap: Pessimism and generalized empirical Bernstein's inequality [94.89246810243053]
本論文は,事前収集した観測値を利用して最適な個別化決定規則を学習するオフライン政策学習について検討する。
既存の政策学習法は、一様重なりの仮定、すなわち、全ての個々の特性に対する全ての作用を探索する正当性は、境界を低くしなければならない。
我々は,点推定の代わりに低信頼度境界(LCB)を最適化する新しいアルゴリズムであるPPLを提案する。
論文 参考訳(メタデータ) (2022-12-19T22:43:08Z) - Bounded Robustness in Reinforcement Learning via Lexicographic
Objectives [54.00072722686121]
強化学習における政策の堅牢性は、いかなるコストでも望ましいものではないかもしれない。
本研究では,任意の観測ノイズに対して,政策が最大限に頑健になる方法について検討する。
本稿では,どのような政策アルゴリズムにも適用可能なロバストネス誘導方式を提案する。
論文 参考訳(メタデータ) (2022-09-30T08:53:18Z) - Off-Policy Evaluation with Policy-Dependent Optimization Response [90.28758112893054]
我々は,テキスト政治に依存した線形最適化応答を用いた非政治評価のための新しいフレームワークを開発した。
摂動法による政策依存推定のための非バイアス推定器を構築する。
因果介入を最適化するための一般的なアルゴリズムを提供する。
論文 参考訳(メタデータ) (2022-02-25T20:25:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。