論文の概要: The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity
- arxiv url: http://arxiv.org/abs/2608.06283v1
- Date: Thu, 06 Aug 2026 17:09:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.970917
- Title: The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity
- Title(参考訳): 凸性を超えた低次不調整ランゲヴィンアルゴリズム
- Abstract要約: SG-TULA(Subgradiented Unadjusted Langevin Algorithm)を導入する。
ワッサーシュタイン2距離における非漸近収束境界を導出する。
関連する問題に対する過剰なリスク推定を提供する。
- 参考スコア(独自算出の注目度): 2.676349883103404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study the problem of sampling from target distributions whose potentials are simultaneously non-smooth, subject to superlinear gradient growth, and non-convex. We introduce the Subgradient Tamed Unadjusted Langevin Algorithm (SG-TULA), a discretisation of the Langevin diffusion that operates directly on subgradients, without relying on computationally demanding smoothing procedures. To handle the superlinear regime, taming techniques are employed to produce a stable, explicit scheme. We derive non-asymptotic convergence bounds in Wasserstein-2 distance, with all constants tracked explicitly in terms of dimension and inverse temperature, improving upon the currently known rates for subgradient-based Langevin algorithms. We further provide excess risk estimates for the associated optimisation problem. We verify the assumptions, with explicit constants, for the regularized pretraining potential of a LLM in the GPT-2 lineage and the boosted coordinate-wise variant of SG-TULA pretrains the former competitively against finetuned AdamW and Muon, for which no comparable non-asymptotic guarantees are presently available.
- Abstract(参考訳): 本研究では,超線形勾配成長と非凸を対象とする非平滑な対象分布からのサンプリング問題について検討した。
本稿では,SG-TULA(Subgradient Tamed Unadjusted Langevin Algorithm)を提案する。
超線形構造を扱うために、安定的で明示的なスキームを生成するためにタミング技術が用いられている。
我々は、ワッサーシュタイン2距離における非漸近収束境界を導出し、すべての定数を次元と逆温度で明示的に追跡し、現在知られている勾配に基づくランゲヴィンアルゴリズムの速度を改善する。
さらに、関連する最適化問題に対して、過剰なリスク推定を提供する。
GPT-2 系統における LLM の正規化事前学習ポテンシャルと SG-TULA の促進された座標ワイド変種に対する仮定を明示定数で検証し、AdamW と Muon に対抗して前者の事前学習を行う。
関連論文リスト
- Stochastic Gradient Descent over P2 [4.6107344298094235]
勾配降下(SGD)は、ガウス雑音による勾配の複雑なランダム性を置き換える拡散近似を認める。
我々は、類似近似の原理が、ワッサーシュタイン空間 P2 上で定義された函数である確率測度よりも最適化するために成り立つかどうかを考察する。
論文 参考訳(メタデータ) (2026-09-11T13:15:38Z) - The Role of Gradient Modification in Heavy-Tailed Nonconvex Stochastic Min-Max Optimization [50.59470683896735]
min-max最適化は、現代の機械学習に応用されているため、注目を集めている。
我々は、勾配降下(SGDA)の包括的理論を提供する。
我々は,Stoc-GDAMとStoc-TRmaxという新たなクリッピングフリーアルゴリズムを開発し,グラディエントクリッピングを使わずに,目標精度への最適依存を実現する。
論文 参考訳(メタデータ) (2026-09-05T12:49:28Z) - Fitting Unknown Number of Hyperplanes with Manifold Optimization [57.48093263119306]
未知数の線形平面をデータに適合させることは、機械学習の根本的な課題である。
既存のアプローチはしばしば最適な最適化に苦しむか、幾何的整合性に欠ける。
論文 参考訳(メタデータ) (2026-05-27T14:02:20Z) - Error estimates for tamed Euler and Randomized Euler schemes for SDEs with locally Lipschitz drift with applications to non-logconcave sampling and optimization [0.0]
局所的なリプシッツによる微分方程式の数値的な離散化、超最適に成長するドリフト、そしてソボレフの不等式を満たす非対数凹分布からのサンプリングがもたらす意味について検討する。
超線形成長下での無作為なランダム化ランゲヴィンスキームの総変分における非漸近的保証を初めて確立する。
論文 参考訳(メタデータ) (2026-05-24T08:35:24Z) - Revisiting Zeroth-Order Optimization: Minimum-Variance Two-Point Estimators and Directionally Aligned Perturbations [57.179679246370114]
乱摂動の分布は, 摂動段差がゼロになる傾向にあるため, 推定子の分散を最小限に抑える。
以上の結果から, 一定の長さを維持するのではなく, 真の勾配に方向を合わせることが可能であることが示唆された。
論文 参考訳(メタデータ) (2025-10-22T19:06:39Z) - The Performance Of The Unadjusted Langevin Algorithm Without Smoothness Assumptions [0.0]
本稿では,Langevinをベースとしたアルゴリズムを提案する。
ULAのようなサンプリング器の性能は、必ずしも低規則性で任意に劣化しないことを示す。
論文 参考訳(メタデータ) (2025-02-05T18:55:54Z) - Gradient-Based Non-Linear Inverse Learning [2.6149030745627644]
ランダム設計下での非線形逆問題の文脈における統計的逆学習について検討する。
勾配勾配勾配 (GD) と降下勾配 (SGD) を, それぞれ一定のステップサイズを用いて小バッチで適用した。
我々の分析は、対象関数の滑らかさに関する古典的な前提条件の下で、両方のアルゴリズムの収束率を導出する。
論文 参考訳(メタデータ) (2024-12-21T22:38:17Z) - Gradient Normalization Provably Benefits Nonconvex SGD under Heavy-Tailed Noise [60.92029979853314]
重み付き雑音下でのグラディエントDescence(SGD)の収束を確実にする上での勾配正規化とクリッピングの役割について検討する。
我々の研究は、重尾雑音下でのSGDの勾配正規化の利点を示す最初の理論的証拠を提供する。
我々は、勾配正規化とクリッピングを取り入れた加速SGD変種を導入し、さらに重み付き雑音下での収束率を高めた。
論文 参考訳(メタデータ) (2024-10-21T22:40:42Z) - Convergence of mean-field Langevin dynamics: Time and space
discretization, stochastic gradient, and variance reduction [49.66486092259376]
平均場ランゲヴィンダイナミクス(英: mean-field Langevin dynamics、MFLD)は、分布依存のドリフトを含むランゲヴィン力学の非線形一般化である。
近年の研究では、MFLDは測度空間で機能するエントロピー規則化された凸関数を地球規模で最小化することが示されている。
有限粒子近似,時間分散,勾配近似による誤差を考慮し,MFLDのカオスの均一時間伝播を示す枠組みを提供する。
論文 参考訳(メタデータ) (2023-06-12T16:28:11Z) - Benign Underfitting of Stochastic Gradient Descent [72.38051710389732]
本研究では,適切な学習データを得ることで,一般化性能を実現する「従来型」学習ルールとして,勾配降下度(SGD)がどの程度理解されるかを検討する。
類似現象が起こらない近縁な交換SGDを解析し、その集団リスクが実際に最適な速度で収束することを証明する。
論文 参考訳(メタデータ) (2022-02-27T13:25:01Z) - On the Convergence of Stochastic Extragradient for Bilinear Games with
Restarted Iteration Averaging [96.13485146617322]
本稿では, ステップサイズが一定であるSEG法の解析を行い, 良好な収束をもたらす手法のバリエーションを示す。
平均化で拡張した場合、SEGはナッシュ平衡に確実に収束し、スケジュールされた再起動手順を組み込むことで、その速度が確実に加速されることを証明した。
論文 参考訳(メタデータ) (2021-06-30T17:51:36Z) - Non-Convex Optimization via Non-Reversible Stochastic Gradient Langevin
Dynamics [27.097121544378528]
グラディエント・ランゲヴィン・ダイナミクス (Gradient Langevin Dynamics, SGLD) は、非目的勾配を最適化する強力なアルゴリズムである。
NSGLDは非可逆拡散の離散化に基づいている。
論文 参考訳(メタデータ) (2020-04-06T17:11:03Z) - GradientDICE: Rethinking Generalized Offline Estimation of Stationary
Values [75.17074235764757]
対象ポリシーの状態分布とサンプリング分布の密度比を推定するグラディエントDICEを提案する。
GenDICEはそのような密度比を推定するための最先端技術である。
論文 参考訳(メタデータ) (2020-01-29T22:10:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。