論文の概要: Non-Convex Sparse Reinforcement Learning via Non-Monotone Inclusions
- arxiv url: http://arxiv.org/abs/2607.04990v2
- Date: Tue, 07 Jul 2026 05:16:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.315896
- Title: Non-Convex Sparse Reinforcement Learning via Non-Monotone Inclusions
- Title(参考訳): 非モノトン包摂による非凸スパース強化学習
- Abstract要約: この研究は、強化学習(RL)における効率的な特徴選択と、非単調包摂理論への2つの重要な貢献を提供する。
- 参考スコア(独自算出の注目度): 7.408148824204063
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This work delivers two key contributions: one to efficient feature selection in reinforcement learning (RL), the other to the theory of non-monotone inclusions. On the RL side, the estimation bias inherent in conventional regularization schemes is addressed by augmenting classical least-squares temporal-difference (LSTD) policy evaluation with the sparsity-inducing, non-convex projected minimax concave (PMC) penalty. Because the PMC penalty is weakly convex, the resulting fixed-point problem is no longer monotone; instead, it falls under a broader class of non-monotone inclusions involving the sum of a monotone Lipschitz operator and a hypomonotone operator. On the theory side, novel convergence conditions are developed for the forward-reflected-backward splitting (FRBS) method applied to this broader class of non-monotone inclusion problems. Under mild conditions, Lyapunov stability and the existence of a limit point of the sequence of FRBS iterates are established; alternatively, under the weak Minty variational inequality assumption, exact convergence is guaranteed. Numerical tests on benchmark datasets show that the proposed FRBS iterates, applied to the non-convexly regularized LSTD problem, substantially outperform state-of-the-art feature-selection methods, especially when many noisy features are present.
- Abstract(参考訳): この研究は、強化学習(RL)における効率的な特徴選択と、非単調包摂理論への2つの重要な貢献を提供する。
RL側では、従来の正規化スキームに固有の推定バイアスに対処するため、従来の最小二乗時間差分法(LSTD)の政策評価を、空間誘導型、非凸射影ミニマックス円錐法(PMC)のペナルティで強化する。
PMCのペナルティは弱凸であるため、結果として生じる固定点問題はもはや単調ではなく、代わりに単調リプシッツ作用素と低単調作用素の和を含むより広範な非単調包含のクラスに該当する。
理論面では、このより広範な非単調な包摂問題に適用されるフォワード-反射-後方分割法(FRBS)法に対して、新しい収束条件が展開される。
穏やかな条件下では、リアプノフ安定性と FRBS の反復列の極限点の存在が確立され、あるいは弱いミンティ変量不等式仮定の下では、正確な収束が保証される。
ベンチマークデータセットの数値実験により,非凸正規化 LSTD 問題に適用したFRBS は,特に多くのノイズのある特徴が存在する場合において,かなり優れた特徴選択法であることがわかった。
関連論文リスト
- Parameter-Free Non-Ergodic Extragradient Algorithms for Solving Monotone Variational Inequalities [0.0]
拘束単調なVIsに対する非漸近的最終定位保証を用いたパラメータフリーの指数分解法を開発した。
このフレームワークをバックトラックラインサーチによりローカルリプシッツ演算子に拡張し,パラメータ自由性を保ちながら同じレートを得る。
論文 参考訳(メタデータ) (2026-04-09T00:02:30Z) - Graph-based Clustering Revisited: A Relaxation of Kernel $k$-Means Perspective [73.18641268511318]
本稿では,クラスタリング結果を導出するための正規制約のみを緩和するグラフベースのクラスタリングアルゴリズムを提案する。
二重制約を勾配に変換するために、非負の制約をクラス確率パラメータに変換する。
論文 参考訳(メタデータ) (2025-09-23T09:14:39Z) - Nonconvex Regularization for Feature Selection in Reinforcement Learning [7.408148824204063]
本研究では,理論収束保証付き強化学習(RL)における特徴選択のための効率的なバッチアルゴリズムを提案する。
数値実験により,提案手法が州選択シナリオを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2025-09-19T06:21:20Z) - Stability and Generalization for Bellman Residuals [8.250374560598493]
ベルマン残留最小化(BRM)はオフライン強化学習の魅力的な治療法として浮上している。
本稿では,SGDAが近傍のデータセット上で実行され,O(1/n)平均引数-安定性境界が得られる,単一のリアプノフポテンシャルを紹介する。
その結果、標準のニューラルネットワークパラメータ化とミニバッチSGDが得られた。
論文 参考訳(メタデータ) (2025-08-26T07:15:36Z) - Revisiting Convergence: Shuffling Complexity Beyond Lipschitz Smoothness [50.78508362183774]
シャッフル型勾配法はその単純さと迅速な経験的性能のために実践的に好まれる。
リプシッツ条件は一般的な機械学習スキームでは満たされないことが多い。
論文 参考訳(メタデータ) (2025-07-11T15:36:48Z) - An Accelerated Alternating Partial Bregman Algorithm for ReLU-based Matrix Decomposition [0.0]
本稿では,非負行列上に補正されたスパース低ランク特性について検討する。
本稿では,クラスタリングと圧縮タスクに有用な構造を取り入れた新しい正規化項を提案する。
我々は、任意の$Lge 1$に対して常に持つ$L$-smoothプロパティを維持しながら、対応する閉形式解を導出する。
論文 参考訳(メタデータ) (2025-03-04T08:20:34Z) - Convergence of the Chambolle-Pock Algorithm in the Absence of Monotonicity [4.307128674848627]
Chambolle-Pockアルゴリズム(CPA)は、大規模な凸構造問題の解法の成功により、過去10年間で人気を博している。
この研究は、関連する原始双対作用素上のいわゆる弱ミント条件によって定量化される、(非)単調性の異なる問題に対する収束解析を拡張した。
論文 参考訳(メタデータ) (2023-12-11T17:20:24Z) - High-Probability Bounds for Stochastic Optimization and Variational
Inequalities: the Case of Unbounded Variance [59.211456992422136]
制約の少ない仮定の下で高確率収束結果のアルゴリズムを提案する。
これらの結果は、標準機能クラスに適合しない問題を最適化するために検討された手法の使用を正当化する。
論文 参考訳(メタデータ) (2023-02-02T10:37:23Z) - Clipped Stochastic Methods for Variational Inequalities with
Heavy-Tailed Noise [64.85879194013407]
単調なVIPと非単調なVIPの解法における信頼度に対数的依存を持つ最初の高確率結果が証明された。
この結果は光尾の場合で最もよく知られたものと一致し,非単調な構造問題に新鮮である。
さらに,多くの実用的な定式化の勾配雑音が重く,クリッピングによりSEG/SGDAの性能が向上することを示す。
論文 参考訳(メタデータ) (2022-06-02T15:21:55Z) - Variance-Reduced Splitting Schemes for Monotone Stochastic Generalized
Equations [0.0]
演算子を期待値とする単調な包摂問題を考える。
分割スキームの直接適用は、各ステップにおける期待値マップによる問題解決の必要性により複雑である。
本稿では,不確実性に対処する手法を提案する。
論文 参考訳(メタデータ) (2020-08-26T02:33:27Z) - On Lower Bounds for Standard and Robust Gaussian Process Bandit
Optimization [55.937424268654645]
有界ノルムを持つ関数のブラックボックス最適化問題に対するアルゴリズム非依存な下界を考える。
本稿では, 単純さ, 汎用性, エラー確率への依存性の向上など, 後悔の下位境界を導出するための新しい証明手法を提案する。
論文 参考訳(メタデータ) (2020-08-20T03:48:14Z) - Lower bounds in multiple testing: A framework based on derandomized
proxies [107.69746750639584]
本稿では, 各種コンクリートモデルへの適用例を示す, デランドマイズに基づく分析戦略を提案する。
これらの下界のいくつかを数値シミュレーションし、Benjamini-Hochberg (BH) アルゴリズムの実際の性能と密接な関係を示す。
論文 参考訳(メタデータ) (2020-05-07T19:59:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。