論文の概要: Worker Disagreement Reveals Sharp Directions in Local SGD
- arxiv url: http://arxiv.org/abs/2605.27739v1
- Date: Tue, 26 May 2026 22:30:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.581757
- Title: Worker Disagreement Reveals Sharp Directions in Local SGD
- Title(参考訳): ローカルSGDのシャープ方向を従業員が明らかに
- Authors: Tolga Dimlioglu, Kristi Topollai, Anna Choromanska,
- Abstract要約: ディープ・ニューラル・ネットワーク・トレーニングは、しばしば非常に異方的な損失幾何学を示し、いくつかの鋭い支配的なヘッセン方向と大きな平らなバルクが共存する。
したがって、支配部分空間を見積もるのは有用であるが、直接 Hessian-based 法ではコストがかかる。
標準的なローカルSGDは、労働者の不一致によってこの幾何学を露出することを示す。
- 参考スコア(独自算出の注目度): 10.137918123395563
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep neural network training often exhibits highly anisotropic loss geometry, where a few sharp dominant Hessian directions coexist with a large flatter bulk. Gradients tend to align disproportionately with these dominant directions, although stable progress often requires movement through flatter bulk directions. Estimating the dominant subspace is therefore useful but costly with direct Hessian-based methods. We show that standard Local SGD exposes this geometry through worker disagreement. We theoretically show that the worker-average gap covariance is shaped by stochastic-gradient noise and Hessian curvature, causing workers to disagree along sharp, curvature-sensitive directions. Thus, worker-average gaps provide a cheap Hessian-free estimator of the dominant subspace. Experiments on MLPs, CNNs, and Transformers show that subspaces formed by worker-average gaps capture a substantial fraction of the gradient component lying in the dominant Hessian eigenspace.
- Abstract(参考訳): ディープ・ニューラル・ネットワーク・トレーニングは、しばしば非常に異方的な損失幾何学を示し、いくつかの鋭い支配的なヘッセン方向と大きな平らなバルクが共存する。
勾配はこれらの支配的な方向と不均等に一致する傾向にあるが、安定な進行は、しばしばより平坦なバルク方向に移動する必要がある。
したがって、支配部分空間を見積もるのは有用であるが、直接 Hessian-based 法ではコストがかかる。
標準的なローカルSGDは、労働者の不一致によってこの幾何学を露出することを示す。
理論的には, 作業者平均ギャップの共分散は確率的勾配雑音とヘッセン曲率によって形成され, 作業者が鋭く曲率に敏感な方向で不一致を生じさせる。
したがって、労働者平均ギャップは支配部分空間の安値なヘッセンフリー推定器を提供する。
MLP、CNN、Transformersの実験は、労働者平均ギャップによって形成される部分空間が、支配的なヘッセン固有空間に存在している勾配成分のかなりの部分を占めることを示した。
関連論文リスト
- Flatness and Gradient Alignment Are Both Necessary: Spectral-Aware Gradient-Aligned Exploration for Multi-Distribution Learning [7.794885131732119]
マルチディストリビューション・ラーニング・セッティングにおいて,平坦性と勾配のアライメントを考慮すべきであることを示す。
両用語を対象とするSAGE(Spectral-Aware Gradient-Aligned Exploration)を提案する。
5つの領域一般化と2つのマルチタスク学習ベンチマーク実験により,提案手法が新たな最先端技術を確立することを示す。
論文 参考訳(メタデータ) (2026-05-08T15:52:34Z) - Riemannian Flow Matching for Disentangled Graph Domain Adaptation [51.98961391065951]
グラフドメイン適応(GDA)は典型的には、ユークリッド空間におけるグラフ埋め込みの整列に逆学習を使用する。
DisRFMは、埋め込みとフローベースのトランスポートを統一する幾何学的なGDAフレームワークである。
論文 参考訳(メタデータ) (2026-01-31T11:05:35Z) - Accelerating Neural Network Training Along Sharp and Flat Directions [6.576051895863941]
本研究では、Dminant部分空間の補集合への更新を制限するSGDの変種であるBulk-SGDについて検討する。
損失ランドスケープにおける平坦な方向に対応するバルク部分空間に沿った更新は収束を加速するが、安定性を損なう可能性があることを示す。
本研究は,曲率認識設計における原則的アプローチを示唆するものである。
論文 参考訳(メタデータ) (2025-05-17T12:13:05Z) - Last-Iterate Convergence of Adaptive Riemannian Gradient Descent for Equilibrium Computation [52.73824786627612]
本稿では,テクスト幾何学的強単調ゲームに対する新たな収束結果を確立する。
我々のキーとなる結果は、RGDがテクスト幾何学的手法で最終定位線形収束を実現することを示しています。
全体として、ユークリッド設定を超えるゲームに対して、幾何学的に非依存な最終点収束解析を初めて提示する。
論文 参考訳(メタデータ) (2023-06-29T01:20:44Z) - Why is parameter averaging beneficial in SGD? An objective smoothing perspective [13.863368438870562]
勾配降下(SGD)とその暗黙バイアスは、しばしばミニマの鋭さによって特徴づけられる。
Izmailov et alで実証的に観察された一般用平均SGDアルゴリズムについて検討した。
本研究では,SGDの平均値が局所的な局所最小値を回避するスムーズな目的を効率的に最適化できることを証明した。
論文 参考訳(メタデータ) (2023-02-18T16:29:06Z) - Visualizing high-dimensional loss landscapes with Hessian directions [0.0]
低次元の損失表現における曲率特性が、元の損失空間における曲率特性にどのように依存するかを考察する。
元の空間のサドル点は、ランダムな射影が用いられる場合、期待される下次元表現のように正しく識別されることは滅多にない。
論文 参考訳(メタデータ) (2022-08-28T13:18:47Z) - Manifold Learning Benefits GANs [59.30818650649828]
我々は、識別器に多様体学習ステップを組み込むことにより、生成的敵ネットワークを改善する。
我々の設計では、多様体学習と符号化のステップは判別器の層に絡み合っている。
近年の最先端のベースラインに比較して,大幅な改善が見られた。
論文 参考訳(メタデータ) (2021-12-23T14:59:05Z) - Orthogonal Jacobian Regularization for Unsupervised Disentanglement in
Image Generation [64.92152574895111]
直交ジャコビアン正規化法(OroJaR)を提案する。
提案手法は, 絡み合った, 制御可能な画像生成に有効であり, 最先端の手法に対して好適に機能する。
論文 参考訳(メタデータ) (2021-08-17T15:01:46Z) - Manifold Learning via Manifold Deflation [105.7418091051558]
次元削減法は、高次元データの可視化と解釈に有用な手段を提供する。
多くの一般的な手法は単純な2次元のマニフォールドでも劇的に失敗する。
本稿では,グローバルな構造を座標として組み込んだ,新しいインクリメンタルな空間推定器の埋め込み手法を提案する。
実験により,本アルゴリズムは実世界および合成データセットに新規で興味深い埋め込みを復元することを示した。
論文 参考訳(メタデータ) (2020-07-07T10:04:28Z) - Differentiating through the Fr\'echet Mean [51.32291896926807]
フレット平均(Fr'echet mean)はユークリッド平均の一般化である。
任意のリーマン多様体に対して Fr'echet 平均を微分する方法を示す。
これにより、Fr'echet平均を双曲型ニューラルネットワークパイプラインに完全に統合する。
論文 参考訳(メタデータ) (2020-02-29T19:49:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。