論文の概要: Convergence Theory of Knowledge Distillation in Asynchronous P2P Gossip Learning Network
- arxiv url: http://arxiv.org/abs/2609.01952v1
- Date: Tue, 01 Sep 2026 23:52:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.011478
- Title: Convergence Theory of Knowledge Distillation in Asynchronous P2P Gossip Learning Network
- Title(参考訳): 非同期P2Pゴシップ学習ネットワークにおける知識蒸留の収束理論
- Abstract要約: 分散化されたサーバレス学習は、さまざまなアーキテクチャを実行するデバイスをますます接続します。
知識蒸留は重量よりも柔らかい予測を交換し、この障害を横取りする。
完全分散非同期ピアツーピア(P2P)KDに対する収束理論を提供する。
- 参考スコア(独自算出の注目度): 2.355814441789658
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decentralized, serverless learning increasingly connects devices running different architectures, where the standard tool, decentralized SGD, is undefined as models with different parameter counts cannot be averaged. Knowledge distillation (KD) exchanges soft predictions rather than weights and sidesteps this obstacle, yet convergence theory for fully decentralized, asynchronous peer-to-peer (P2P) KD is lacking. We provide one, relocating consensus from parameter space to function (output) space: a KD event is a geometric contraction operator in logit space on the peers' predictive distributions, which we analyse in the Hilbert space of predictions on a reference measure. Under standard smoothness/variance assumptions and two realizability assumptions, one bridging parameter SGD to the functional step and one controlling restricted task/KD alignment, the time-averaged functional stationarity and function-space disagreement converge at rate $O(1/(ηT))$ to an $O(η)+O(B_f^2)+O(ζ_f^2)$ neighbourhood. Here $B_f$ is the distance from the task optimum to the peers' reachable classes and $ζ_f$ measures persistent local-task heterogeneity. Across homogeneous, width-heterogeneous, and mixed-family networks of the experiments, KD contracts function disagreement by $40-61\times$, while isolated training does not. The sampled stationarity diagnostic has late transient exponents $0.99-1.90$ on the shared-skeleton main runs, and the four-point step-size sweep exhibits the predicted transient: neighbourhood tradeoff.
- Abstract(参考訳): 分散化されたサーバレス学習は、さまざまなアーキテクチャを実行するデバイスをますます接続する。標準的なツールである分散SGDは、パラメータ数が異なるモデルでは平均化できないため、未定義である。
知識蒸留(KD)は、重みよりも柔らかい予測を交換し、この障害を助長するが、完全に分散化された非同期ピアツーピア(P2P)KDの収束理論は欠如している。
パラメータ空間から関数(出力)空間へコンセンサスを移す: KD イベントは、ピアの予測分布上のロジット空間における幾何収縮作用素であり、基準測度上の予測のヒルベルト空間で解析する。
標準的な滑らかさ/分散仮定と2つの実現可能性仮定の下で、1つのブリッジパラメータ SGD を関数ステップに、もう1つは制限されたタスク/KDアライメントを制御し、時間平均の関数定常性と関数空間の不一致は、$O(1/(ηT))$ で$O(η)+O(B_f^2)+O(\_f^2)$ に収束する。
ここで、$B_f$はタスク最適からピアのリーチ可能なクラスまでの距離であり、$a_f$は永続的なローカルタスクの不均一性を測定する。
実験の均一性、幅ヘテロジニアス、混合ファミリーネットワーク全体において、KDコントラクトは40-61\times$で不一致に機能するが、孤立トレーニングはそうではない。
サンプリングされた静止度診断は、共有スケルトンメインランでの遅延指数が0.99-1.90ドルであり、4点のステップサイズスイープは予測された過渡性:近傍のトレードオフを示す。
関連論文リスト
- Between-User Collapse Under Popularity-Biased Feedback: A Centered-Covariance Theorem and Computable Phase Boundary [0.0]
我々は,人気度の高いBPRトレーニングが,協調フィルタリング埋め込みのユーザ間幾何学にどう影響するかを考察する。
定常アイテムによる人気バイアスのあるフィードバックの下では、$C$は安定した状態に収束する。
次に、その効果の限界について検討する。
論文 参考訳(メタデータ) (2026-08-03T17:33:25Z) - Demystifying Pipeline Parallelism: First Theory for PipeDream [53.657104889705856]
本稿では、PDスタイルの手法に対して、クリーンな非収束性をもたらす固定ブロック-SGD抽象化としてランダム化PipeDream(PD)を導入する。
定常PDによって引き起こされる遅延は、$S2 - S/2 + O(1)$ for $S$として増大するので、スタイルリードのコントリビューションは、チューナレート形式で$(2S4)$、同等に$(S4/K)$としてスケールする。
論文 参考訳(メタデータ) (2026-06-02T11:14:57Z) - Federated Language Models Under Bandwidth Budgets: Distillation Rates and Conformal Coverage [12.805268849262243]
集中できない帯域制限ノードに散在するデータに基づいて言語モデルを訓練することは、臨床ネットワーク、企業知識基盤、科学コンソーシアムで発生する設定である。
ノード間でデータを分散し続けなければならない状況について検討し、明示的な帯域幅予算の下では、何の統計的保証が得られるのかを問う。
論文 参考訳(メタデータ) (2026-05-11T05:01:43Z) - High-Probability Convergence in Decentralized Stochastic Optimization with Gradient Tracking [69.90407799170687]
分散最適化における高確率収束保証について検討する。
その結果, 地平線上の条件は, 比較時間と同一であることがわかった。
論文 参考訳(メタデータ) (2026-04-30T22:45:21Z) - Tight Convergence Rates for Online Distributed Linear Estimation with Adversarial Measurements [66.94250413799232]
分散パラメータ-サーバ-ワーカー設定における乱数ベクトル$X$の推定について検討する。
主な課題は、敵の計測と非同期である。
その結果, 分散線形推定におけるロバスト性, 識別性, 統計的効率の統一的有限時間評価が得られた。
論文 参考訳(メタデータ) (2026-04-07T11:45:55Z) - Stability and Generalization of Push-Sum Based Decentralized Optimization over Directed Graphs [55.77845440440496]
プッシュベースの分散通信は、情報交換が非対称である可能性のある通信ネットワークの最適化を可能にする。
我々は、グラディエント・プッシュ(SGP)アルゴリズムのための統一的な一様安定性フレームワークを開発する。
重要な技術的要素は、2つの量に束縛された不均衡認識の一般化である。
論文 参考訳(メタデータ) (2026-02-24T05:32:03Z) - SGD with Dependent Data: Optimal Estimation, Regret, and Inference [3.038061705362137]
勾配降下 (SGD) は, 広範囲の段階的スケジュールと探索率スキームの下で, 独立情報と依存情報の両方に対応できることが示されている。
SGDは統計的に最適な推定誤差と後悔を同時に達成し,既存の結果を拡張し,改善することを示す。
オンラインのスパースレグレッションのために、我々はSGDベースの新しいアルゴリズムを開発し、ストレージの$d$のみを使用し、1イテレーションあたり$O(d)$フロップを必要とする。
論文 参考訳(メタデータ) (2026-01-04T04:52:11Z) - DP-CSGP: Differentially Private Stochastic Gradient Push with Compressed Communication [71.60998478544028]
本稿では,分散学習グラフのための圧縮通信(termedfrac-CSGP)を用いた差分的プライベート・グラディエント・プッシュを提案する。
一般の非数学的かつ滑らかな目的関数に対して,本アルゴリズムは高精度かつ効率的な通信を実現するために設計されていることを示す。
論文 参考訳(メタデータ) (2025-12-15T17:37:02Z) - Clustered Switchback Designs for Experimentation Under Spatio-temporal Interference [44.644520116360106]
我々は, 平均治療効果 (GATE) を推定し, 全単位を常に治療やコントロールに曝露した平均結果の差を推定した。
そこで我々は,単位をクラスタにグループ化し,時間ステップをブロックにグループ化する,クラスタ化されたスイッチバック設計を提案する。
良好なクラスタリングを許容するグラフに対して, トラッピングされたHorvitz-Thompson推定器が$tilde O(1/NT)$平均二乗誤差(MSE)を達成することを示す。
我々の結果は、citethu2022switchback、ugander2013graph、citetleung2022rateの結果を同時に一般化する。
論文 参考訳(メタデータ) (2023-12-25T01:00:58Z) - Faster Convergence of Local SGD for Over-Parameterized Models [1.5504102675587357]
現代の機械学習アーキテクチャは、しばしば非常に表現力が高い。
不均一なデータ設定における過パラメータ化関数に対する局所SGD(またはFedAvg)の収束を解析する。
一般凸損失関数に対しては、$O(K/T)$の誤差が成立する。
非剰余関数に対しては、どちらの場合も$O(K/T)$の誤差が証明される。
確立された収束率を、合理的に小さなステップサイズで一定の要因に密着した問題インスタンスを提供することで、結果を完成させる。
論文 参考訳(メタデータ) (2022-01-30T04:05:56Z) - A Unified Theory of Decentralized SGD with Changing Topology and Local
Updates [70.9701218475002]
分散通信方式の統一収束解析を導入する。
いくつかの応用に対して普遍収束率を導出する。
私たちの証明は弱い仮定に依存している。
論文 参考訳(メタデータ) (2020-03-23T17:49:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。