論文の概要: Unveiling High-Probability Generalization in Decentralized SGD
- arxiv url: http://arxiv.org/abs/2605.10205v1
- Date: Mon, 11 May 2026 08:51:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 02:24:05.553104
- Title: Unveiling High-Probability Generalization in Decentralized SGD
- Title(参考訳): 分散SGDにおける高確率一般化の展開
- Authors: Jiahuan Wang, Ping Luo, Ziqing Wen, Dongsheng Li, Tao Sun,
- Abstract要約: 分散一般化降下法(D-SGD)は大規模分散学習の効率的な方法である。
既存の研究は主に期待された結果に対処し、$mathcalOleft(frac1sqrtmnlog (1/)right)$に制限された。
最適な$mathcalOleft(frac1sqrtmnlog (1/)right)$を目指して,D-SGDの高確率学習理論を開発した。
- 参考スコア(独自算出の注目度): 41.8909496809588
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decentralized stochastic gradient descent (D-SGD) is an efficient method for large-scale distributed learning. Existing generalization studies mainly address expected results, achieving rates limited to $\mathcal{O}\left(\frac{1}{δ\sqrt{mn}}\right)$, where $δ$ is the confidence parameter, $m$ the number of workers, and $n$ the sample size. When $m=1$, D-SGD reduces to traditional SGD, whose optimal high-probability generalization bound is $\mathcal{O}\left(\frac{1}{\sqrt{n}}\log (1/δ)\right)$. This discrepancy reveals a gap between high-probability guarantees for SGD and those for D-SGD. To close this, we develop a high-probability learning theory for D-SGD, aiming for the optimal $\mathcal{O}\left(\frac{1}{\sqrt{mn}}\log (1/δ)\right)$ rate. We refine bounds for D-SGD using pointwise uniform stability in distributed learning-a weaker notion than uniform stability-and analyze them across convex, strongly convex, and non-convex settings. We also provide high-probability results for gradient-based measures in non-convex cases where only local minima exist, and derive optimization error and excess risk bounds. Finally, accounting for communication overhead, we analyze generalization bounds for local models within time-varying frameworks.
- Abstract(参考訳): 分散確率勾配降下法(D-SGD)は大規模分散学習の効率的な方法である。
既存の一般化研究は主に期待された結果に対処し、$\mathcal{O}\left(\frac{1}{δ\sqrt{mn}}\right)$, $δ$は信頼パラメータ、$m$は労働者数、$n$はサンプルサイズに制限される。
m=1$のとき、D-SGD は従来の SGD に還元され、その最適高確率一般化境界は $\mathcal{O}\left(\frac{1}{\sqrt{n}}\log (1/δ)\right)$ となる。
この不一致は、SGDの高確率保証とD-SGDの高確率保証のギャップを明らかにする。
そこで我々は, D-SGDの高確率学習理論を開発し, 最適な$\mathcal{O}\left(\frac{1}{\sqrt{mn}}\log (1/δ)\right)$レートを求める。
分散学習における点方向の均一安定性(一様安定性よりも弱い概念)を用いてD-SGDのバウンダリを洗練し、凸、強凸、非凸設定にわたって解析する。
また,局所最小値のみが存在する非凸の場合の勾配に基づく測度に対して高い確率性を示し,最適化誤差と過剰リスク境界を導出する。
最後に、通信オーバーヘッドを考慮し、時間変動フレームワーク内の局所モデルに対する一般化境界を解析する。
関連論文リスト
- Can SGD Handle Heavy-Tailed Noise? [6.111519084375339]
Gradient Descent (SGD) は大規模最適化のための機械学習プロジェクトであるが、重尾雑音下での理論的挙動は理解されていない。
このような悪条件下でSGDが確実に成功できるかどうかを精査する。
論文 参考訳(メタデータ) (2025-08-06T20:09:41Z) - Convergence Analysis of Decentralized ASGD [1.8710230264817358]
本稿では,ノード間の部分同期や制限的ネットワークトポロジを必要としない分散非同期SGD(DASGD)に対する新しい収束速度解析法を提案する。
我々の収束証明は、固定段数と任意の非滑らかで同質でL字型の目的函数を仮定する。
論文 参考訳(メタデータ) (2023-09-07T14:50:31Z) - Lower Generalization Bounds for GD and SGD in Smooth Stochastic Convex
Optimization [9.019243171993553]
トレーニングステップ$T$とStep-size$eta$は、滑らかな凸最適化(SCO)問題の認定に影響を与える可能性がある。
まず、グラディエントDescent(GD)とグラディエントDescent(SGD)の厳密な過剰リスク低境界を提供する。
近年の作業は、より良い速度で達成できるが、トレーニング時間が長い場合には改善が減少する。
論文 参考訳(メタデータ) (2023-03-19T20:24:33Z) - Topology-aware Generalization of Decentralized SGD [91.59494285490784]
D-SGDの一般化性はスペクトルギャップと正の相関関係を示す。
我々の知る限り、これはD-SGDの一般化に関する最初の研究である。
論文 参考訳(メタデータ) (2022-06-25T16:03:48Z) - Benign Underfitting of Stochastic Gradient Descent [72.38051710389732]
本研究では,適切な学習データを得ることで,一般化性能を実現する「従来型」学習ルールとして,勾配降下度(SGD)がどの程度理解されるかを検討する。
類似現象が起こらない近縁な交換SGDを解析し、その集団リスクが実際に最適な速度で収束することを証明する。
論文 参考訳(メタデータ) (2022-02-27T13:25:01Z) - SGD Generalizes Better Than GD (And Regularization Doesn't Help) [39.588906680621825]
我々は、勾配勾配(SGD)の一般化性能と全バッチ勾配(GD)の分離結果を与える。
同じステップ数で、GD はオーバーフィットし、$Omega(1)$ generalization error で解を出力することを示した。
本稿では,GDによる経験的リスクの最小化が,基本的には上記の結果を変えるものではないことを論じ,安定性,暗黙バイアス,一般化における学習アルゴリズムの役割を再考する。
論文 参考訳(メタデータ) (2021-02-01T19:18:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。