論文の概要: Understanding Schedule-Free Methods in Nonconvex Optimization: Rate Guarantees and Escaping Saddles
- arxiv url: http://arxiv.org/abs/2607.09167v1
- Date: Fri, 10 Jul 2026 07:52:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.807741
- Title: Understanding Schedule-Free Methods in Nonconvex Optimization: Rate Guarantees and Escaping Saddles
- Title(参考訳): 非凸最適化におけるスケジュールフリー手法の理解:レート保証と回避
- Authors: Jiseok Chae, Donghwan Kim,
- Abstract要約: 我々は、スケジュールフリー降下とスケジュールフリー勾配の最悪のケース解析を行う。
シュドレ-フリーは1次法で最適の最悪の収束率が得られることを示す。
- 参考スコア(独自算出の注目度): 19.842865136383153
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Schedule-Free methods have attracted growing interest for alleviating the burden of designing and tuning a learning rate scheduler, while matching and sometimes even outperforming optimizers with tuned schedulers. Despite their strong empirical results, their convergence theory in nonconvex optimization, where modern machine learning objectives typically arise, has remained largely unexplored. In this paper, we provide worst-case analyses of Schedule-Free gradient descent and Schedule-Free stochastic gradient descent, in their standard form and without auxiliary modifications or restrictive conditions, for smooth but possibly nonconvex objectives. Based on a Lyapunov analysis derived from the continuous-time limiting ordinary differential equation associated with these methods, we show that Schedule-Free gradient descent and Schedule-Free stochastic gradient descent achieve the optimal worst-case convergence rates attainable among first-order methods. We further formulate Schedule-Free gradient descent as a nonautonomous dynamical system and prove strict-saddle avoidance under an arbitrarily small one-time perturbation. These theoretical results provide a better understanding of the strong performance that Schedule-Free methods demonstrate.
- Abstract(参考訳): スケジュールフリーな手法は、学習率スケジューラの設計とチューニングの負担を軽減する一方で、マッチングや、時にはチューニングされたスケジューラによる最適化よりも優れたパフォーマンスを実現している。
その強い経験的結果にもかかわらず、現代の機械学習の目的が一般的に生じる非凸最適化における収束理論は、ほとんど未解明のままである。
本稿では,スムーズかつ非凸な目的に対して,スケジュール自由勾配降下とスケジュール自由確率勾配降下を標準形式とし,補助的な修正や制約条件を伴わない最悪のケース解析を行う。
これらの手法に付随する常微分方程式の連続時間制限から導かれるリアプノフ解析に基づいて、一階法で達成可能な最適最悪のケース収束率を、スケジュールフリー勾配勾配とスケジュールフリー確率勾配勾配が達成できることを示す。
さらに、非正則な力学系としてスケジュール-自由勾配降下を定式化し、任意に小さな1時間摂動の下で厳密なサドル回避を証明した。
これらの理論的結果は、Schedule-Freeメソッドが示す強い性能をよりよく理解する。
関連論文リスト
- Bringing Order to Asynchronous SGD: Towards Optimality under Data-Dependent Delays with Momentum [16.032739611868685]
非同期分散勾配トレーニング(SGD)は、スケーラブルな分散トレーニングを可能にするが、安定性に悩まされる。
遅延依存学習率や安定度認識トレーニングといった既存の緩和戦略は、通常遅延勾配を廃止または廃止する。
本稿では,安定度を緩和しながら遅延勾配から情報を保存するために,モーメントに基づく非同期フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-03T20:24:24Z) - Exponential Convergence of (Stochastic) Gradient Descent for Separable Logistic Regression [14.718691362208622]
簡単な非適応的なステップサイズスケジュールによる勾配勾配勾配は、マージン条件下での分離可能なロジスティック回帰の指数収束を実現することを示す。
また、線形探索や特殊手順を回避する軽量適応的なステップサイズルールを用いて勾配降下の指数収束を確立する。
論文 参考訳(メタデータ) (2026-02-21T19:31:07Z) - Provably Convergent Decentralized Optimization over Directed Graphs under Generalized Smoothness [1.5892054128426507]
ヘッセンノルムは勾配ノルムとともに線型に成長することを許され、したがってリプシッツの滑らかさを超えて急速に変化する勾配を調節する。
我々は、指向性通信グラフ上の正確な収束を保証するため、勾配追従手法と勾配クリッピングを統合する。
本研究の結果は, 勾配差が非有界である場合でも有効であり, 提案手法は現実的な異種データ環境に適用可能である。
論文 参考訳(メタデータ) (2026-01-07T04:25:33Z) - On the Optimal Construction of Unbiased Gradient Estimators for Zeroth-Order Optimization [57.179679246370114]
既存の手法の潜在的な制限は、ステップサイズが提案されない限り、ほとんどの摂動推定器に固有のバイアスである。
本稿では, 良好な構成を維持しつつ, バイアスを排除した非バイアス勾配スケーリング推定器のファミリーを提案する。
論文 参考訳(メタデータ) (2025-10-22T18:25:43Z) - Stability and convergence analysis of AdaGrad for non-convex optimization via novel stopping time-based techniques [17.34603953600226]
適応勾配(AdaGrad)は、ディープラーニングの強力なツールとして登場した。
AdaGradを包括的に分析し、文献の既存のギャップを埋める。
論文 参考訳(メタデータ) (2024-09-08T08:29:51Z) - Gradient-Variation Online Learning under Generalized Smoothness [56.38427425920781]
勾配変分オンライン学習は、オンライン関数の勾配の変化とともにスケールする後悔の保証を達成することを目的としている。
ニューラルネットワーク最適化における最近の取り組みは、一般化された滑らかさ条件を示唆し、滑らかさは勾配ノルムと相関する。
ゲームにおける高速収束と拡張逆最適化への応用について述べる。
論文 参考訳(メタデータ) (2024-08-17T02:22:08Z) - The Road Less Scheduled [45.01813613035411]
最適化停止ステップTの仕様を必要としない既存の学習率スケジュールは、Tに依存する学習率スケジュールにより大幅に改善される。
本稿では,スケジュールを全面的に活用することで,この停止時間を回避するアプローチを提案する。
我々のスケジュール自由アプローチは運動量を持つ標準スケジュールに余分なハイパーパラメータを導入しない。
論文 参考訳(メタデータ) (2024-05-24T16:20:46Z) - Locally Optimal Descent for Dynamic Stepsize Scheduling [45.6809308002043]
本稿では,段階的スケジュールのマニュアルと時間的チューニングを簡略化することを目的とした,理論に基づく新しい動的学習スケジューリング手法を提案する。
本手法は,スムーズな勾配方向の局所最適練習速度を推定することに基づく。
提案手法は,既存手法と比較して最小限のチューニングが必要であることが示唆された。
論文 参考訳(メタデータ) (2023-11-23T09:57:35Z) - Improper Learning with Gradient-based Policy Optimization [62.50997487685586]
未知のマルコフ決定過程に対して学習者がmベースコントローラを与えられる不適切な強化学習設定を考える。
制御器の不適切な混合のクラス上で動作する勾配に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2021-02-16T14:53:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。