論文の概要: LOSCAR-SGD: Local SGD with Communication-Computation Overlap and Delay-Corrected Sparse Model Averaging
- arxiv url: http://arxiv.org/abs/2605.20866v1
- Date: Wed, 20 May 2026 08:01:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.561481
- Title: LOSCAR-SGD: Local SGD with Communication-Computation Overlap and Delay-Corrected Sparse Model Averaging
- Title(参考訳): LOSCAR-SGD:通信計算オーバーラップと遅延補正スパースモデル平均化によるローカルSGD
- Authors: Yassine Maziane, Ammar Mahran, Artavazd Maranjyan, Peter Richtárik,
- Abstract要約: コミュニケーションは分散学習における大きなボトルネックである。
このコストを削減する3つの方法は、通信圧縮、ローカルトレーニング、通信-計算オーバーラップである。
本稿では,サブセットモデル座標のみを通信するローカルサブセットであるLOSCAR-SGDを提案する。
- 参考スコア(独自算出の注目度): 41.99844472131922
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Communication is a major bottleneck in distributed learning, especially in large-scale settings and in federated learning environments with slow links. Three standard ways to reduce this cost are communication compression, local training, and communication-computation overlap. Methods that combine these ingredients are used in practice and have been found to be effective for large-scale training, but there is little theory for methods that combine all three. We study a heterogeneous-compute setting in which different workers may take different numbers of local steps, and we propose LOSCAR-SGD, a Local SGD method that communicates only a sparse subset of model coordinates and continues optimizing while communication is in flight. A key ingredient is a delay-corrected merge rule that incorporates delayed synchronized information without discarding the progress made during the overlap phase. We give convergence guarantees for smooth non-convex objectives and show how sparsity, overlap, and worker heterogeneity affect the rate. To the best of our knowledge, this is the first theory for this combination of ingredients. Experiments further show that communication-computation overlap reduces training time and that the delay-corrected merge outperforms naive overwriting.
- Abstract(参考訳): コミュニケーションは分散学習の大きなボトルネックであり、特に大規模な設定や遅いリンクを持つフェデレートされた学習環境においてである。
このコストを削減するための3つの標準的な方法は、通信圧縮、ローカルトレーニング、通信-計算オーバーラップである。
これらの具材を組み合わせる方法は実際は使われており、大規模な訓練に有効であることが確認されているが、これら3つの具材を組み合わせる方法については、ほとんど理論がない。
そこで我々は,異なる作業者が異なる局所的なステップを採り入れられるような異種計算環境について検討し,また,通信中におけるモデル座標のスパース部分のみを通信し,最適化を継続するローカルSGD手法であるLOSCAR-SGDを提案する。
鍵となる要素は、遅延補正マージルールであり、オーバーラップフェーズ中に行われた進捗を破棄することなく、遅延同期情報を組み込む。
我々は、スムーズな非凸目的に対して収束保証を与え、空間性、重なり合い、労働者の不均一性が率にどのように影響するかを示す。
私たちの知る限りでは、これがこの成分の組み合わせの最初の理論である。
さらに、通信計算の重なりがトレーニング時間を短縮し、遅延補正されたマージが上書きよりも優れていることを示す実験も行われた。
関連論文リスト
- Accelerating Wireless Distributed Learning via Hybrid Split and Federated Learning Optimization [58.557093803478274]
フェデレートラーニング(FL)とスプリットラーニング(SL)は、無線ネットワークにおいて効果的な分散ラーニングパラダイムである。
ハイブリッドスプリットとフェデレート学習(HSFL)の両方の利点を活用するために、一部のデバイスはFLモードで動作し、その他のデバイスはSLモードで動作することができる。
本論文は,(1)学習モードの選択が全体の学習性能にどのように影響するか,2)バッチサイズとどのように相互作用するか,という3つの重要な疑問に対処することによって,HSFLを加速することを目的としている。
論文 参考訳(メタデータ) (2025-11-25T02:29:22Z) - Asynchronous Local Computations in Distributed Bayesian Learning [8.516532665507835]
本稿では,高速な計算と通信オーバヘッドを同時に低減するために,ゴシップに基づく通信を提案する。
我々は、特に低データ範囲において、より高速な初期収束と性能精度の向上を観察する。
UCI MLレポジトリのガンマ望遠鏡とmHealthデータセットで,それぞれ平均78%,90%以上の分類精度を達成した。
論文 参考訳(メタデータ) (2023-11-06T20:11:41Z) - Magnitude Matters: Fixing SIGNSGD Through Magnitude-Aware Sparsification
in the Presence of Data Heterogeneity [60.791736094073]
通信オーバーヘッドは、ディープニューラルネットワークの分散トレーニングにおいて、大きなボトルネックのひとつになっています。
本稿では,SIGNSGDの非収束問題に対処する等級化方式を提案する。
提案手法は,Fashion-MNIST, CIFAR-10, CIFAR-100データセットを用いて検証した。
論文 参考訳(メタデータ) (2023-02-19T17:42:35Z) - Escaping Saddle Points with Bias-Variance Reduced Local Perturbed SGD
for Communication Efficient Nonconvex Distributed Learning [58.79085525115987]
ローカル手法は通信時間を短縮する有望なアプローチの1つである。
局所的データセットが局所的損失の滑らかさよりも小さい場合,通信の複雑さは非局所的手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2022-02-12T15:12:17Z) - Wireless Federated Learning with Limited Communication and Differential
Privacy [21.328507360172203]
本稿では,空力計算(AirComp)に基づくフェデレーション学習(FL)モデルにおいて,リモートユーザにおけるローカルデータセットの効率的な通信と差分プライバシー(DP)における次元性低減の役割について検討する。
論文 参考訳(メタデータ) (2021-06-01T15:23:12Z) - Local Stochastic Gradient Descent Ascent: Convergence Analysis and
Communication Efficiency [15.04034188283642]
Local SGDは分散学習における通信オーバーヘッドを克服するための有望なアプローチである。
局所sgdaは均質データと異質データの両方において分散ミニマックス問題を確実に最適化できることを示す。
論文 参考訳(メタデータ) (2021-02-25T20:15:18Z) - Distributed Sparse SGD with Majority Voting [5.32836690371986]
分散学習のための分散コミュニケーション戦略として,多数決に基づく疎間コミュニケーション戦略を導入する。
テスト精度を損なうことなく,最大x4000圧縮を達成可能であることを示す。
論文 参考訳(メタデータ) (2020-11-12T17:06:36Z) - Sparse Communication for Training Deep Networks [56.441077560085475]
同期勾配降下(SGD)は、ディープラーニングモデルの分散トレーニングに最もよく用いられる手法である。
このアルゴリズムでは、各ワーカーは他のワーカーと局所勾配を共有し、すべてのワーカーの平均勾配を使ってパラメータを更新する。
いくつかの圧縮スキームについて検討し、3つの重要なパラメータが性能に与える影響を同定する。
論文 参考訳(メタデータ) (2020-09-19T17:28:11Z) - Detached Error Feedback for Distributed SGD with Random Sparsification [98.98236187442258]
コミュニケーションのボトルネックは、大規模なディープラーニングにおいて重要な問題である。
非効率な分散問題に対する誤りフィードバックよりも優れた収束性を示す分散誤差フィードバック(DEF)アルゴリズムを提案する。
また、DEFよりも優れた境界を示すDEFの一般化を加速するDEFAを提案する。
論文 参考訳(メタデータ) (2020-04-11T03:50:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。