論文の概要: Effects of width-dependent model hyperparameters and $\ell_2$-regularization on the loss landscape of two-layer ReLU networks
- arxiv url: http://arxiv.org/abs/2607.16720v1
- Date: Sat, 18 Jul 2026 09:17:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.234333
- Title: Effects of width-dependent model hyperparameters and $\ell_2$-regularization on the loss landscape of two-layer ReLU networks
- Title(参考訳): 2層ReLUネットワークの損失景観に及ぼす幅依存性モデルハイパーパラメータと$\ell_2$-regularizationの影響
- Abstract要約: 本稿では,2層ReLUネットワークの理論的性質について考察する。
AdamWをパラメータとして使用すると、学習したパラメータが崩壊するのを防ぐ。
入力次元を1に制限すると、2層ReLUネットワークの大域的最適集合に対する解析解が導出される。
- 参考スコア(独自算出の注目度): 15.466792210118014
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding deep neural networks remains a central challenge in machine learning. In particular, the theoretical properties of even two-layer ReLU networks, especially in the presence of weight decay, remain poorly understood. To this end, we derive a sufficient condition on the hyperparameter settings under which the global minima collapse to the zero solution. Interestingly, our experiments reveal that using AdamW as an optimizer prevents the collapse of the learned parameters, whereas using SGD does not, which may help explain the success of AdamW in deep learning training. In addition, when restricting the input dimension to one, we derive an analytical solution for the globally optimal parameter sets of two-layer ReLU networks and show that $\ell_2$-regularization has a width-invariant effect on connectivity, but its dimensionality-reducing effect becomes stronger as the network width increases. These results provide insight into how width-dependent hyperparameters influence the geometry of regularized loss landscapes.
- Abstract(参考訳): 深層ニューラルネットワークを理解することは、機械学習における中心的な課題である。
特に2層ReLUネットワークの理論的性質は、特に重量減衰の存在下ではよく理解されていない。
この目的のために、大域最小値がゼロ解に崩壊するハイパーパラメータ設定に十分な条件を導出する。
興味深いことに、AdamWをオプティマイザとして使用すると学習パラメータの崩壊を防ぎ、SGDを使用することは、ディープラーニングトレーニングにおけるAdamWの成功を説明するのに役立つかもしれない。
さらに、入力次元を1に制限する場合、2層ReLUネットワークの最適パラメータ集合の解析解を導出し、$\ell_2$-regularizationが接続性に幅不変な効果を持つことを示した。
これらの結果は、幅依存のハイパーパラメータが正規化された損失景観の幾何学にどのように影響するかを洞察する。
関連論文リスト
- ANCRe: Adaptive Neural Connection Reassignment for Efficient Depth Scaling [57.91760520589592]
ネットワークの深度を拡大することは、現代の基礎モデルの成功の背後にある中心的な要因である。
本稿では,ニューラルネットワークの奥行き,すなわち残差接続の既定メカニズムを再考する。
我々は、データから残余接続性をパラメータ化し、学習する原則的かつ軽量なフレームワークである、適応型ニューラルネットワーク再割り当て(ANCRe)を導入する。
論文 参考訳(メタデータ) (2026-02-09T18:54:18Z) - High-Dimensional Analysis of Gradient Flow for Extensive-Width Quadratic Neural Networks [6.3440416106624555]
本研究では,教師-学生設定における2次活性化を伴う浅層ニューラルネットワークの高次元学習ダイナミクスについて検討する。
我々は、力学平均場理論の精神において、勾配流の動的特性を導出する。
論文 参考訳(メタデータ) (2026-01-15T15:05:41Z) - Optimization and generalization analysis for two-layer physics-informed neural networks without over-parametrization [0.6215404942415159]
本研究は、物理インフォームドニューラルネットワーク(PINN)を用いた最小二乗回帰の解法における勾配降下(SGD)の挙動に焦点を当てる。
ネットワーク幅が$epsilon$と問題のみに依存するしきい値を超えると、トレーニング損失と期待損失は$O(epsilon)$以下になる。
論文 参考訳(メタデータ) (2025-07-22T09:24:22Z) - Local Loss Optimization in the Infinite Width: Stable Parameterization of Predictive Coding Networks and Target Propagation [8.35644084613785]
局所目標の2つの代表的設計に対して、無限幅極限における最大更新パラメータ化(mu$P)を導入する。
深層線形ネットワークを解析した結果,PCの勾配は1次勾配とガウス・ニュートン様勾配の間に介在していることが判明した。
我々は、特定の標準設定において、無限幅制限のPCは、一階勾配とよりよく似た振る舞いをすることを示した。
論文 参考訳(メタデータ) (2024-11-04T11:38:27Z) - Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and
Scaling Limit [48.291961660957384]
我々は,畳み込み型ResNetやVision Transformersなどの残余アーキテクチャが,幅と深さにまたがる最適なハイパーパラメータの転送を示すことを示す実験を行った。
ニューラルネットワーク学習力学の動的平均場理論(DMFT)記述の最近の発展から、このResNetsのパラメータ化は、無限幅および無限深度制限で明確に定義された特徴学習を許容することを示す。
論文 参考訳(メタデータ) (2023-09-28T17:20:50Z) - Optimization Guarantees of Unfolded ISTA and ADMM Networks With Smooth
Soft-Thresholding [57.71603937699949]
我々は,学習エポックの数の増加とともに,ほぼゼロに近いトレーニング損失を達成するための最適化保証について検討した。
トレーニングサンプル数に対する閾値は,ネットワーク幅の増加とともに増加することを示す。
論文 参考訳(メタデータ) (2023-09-12T13:03:47Z) - Feature-Learning Networks Are Consistent Across Widths At Realistic
Scales [72.27228085606147]
様々なアーキテクチャやデータセットにわたる特徴学習ニューラルネットワークのダイナミクスに対する幅の影響について検討する。
トレーニングの初期、オンラインデータでトレーニングされた広範なニューラルネットワークは、損失曲線が同じであるだけでなく、トレーニング全体を通じてポイントワイドなテスト予測に一致している。
しかし、より狭いネットワークのアンサンブルは、単一のワイドネットワークよりも性能が劣っている。
論文 参考訳(メタデータ) (2023-05-28T17:09:32Z) - Iterative Soft Shrinkage Learning for Efficient Image Super-Resolution [91.3781512926942]
画像超解像(SR)は、CNNからトランスフォーマーアーキテクチャへの広範なニューラルネットワーク設計を目撃している。
本研究は,市販のネットワーク設計を生かし,基礎となる計算オーバーヘッドを低減するため,超高解像度イテレーションにおけるネットワークプルーニングの可能性について検討する。
本研究では, ランダムネットワークのスパース構造を最適化し, 重要でない重みを小さめに微調整することにより, 反復型軟収縮率(ISS-P)法を提案する。
論文 参考訳(メタデータ) (2023-03-16T21:06:13Z) - Bayesian Interpolation with Deep Linear Networks [92.1721532941863]
ニューラルネットワークの深さ、幅、データセットサイズがモデル品質にどう影響するかを特徴付けることは、ディープラーニング理論における中心的な問題である。
線形ネットワークが無限深度で証明可能な最適予測を行うことを示す。
また、データに依存しない先行法により、広い線形ネットワークにおけるベイズ模型の証拠は無限の深さで最大化されることを示す。
論文 参考訳(メタデータ) (2022-12-29T20:57:46Z) - Nonasymptotic theory for two-layer neural networks: Beyond the
bias-variance trade-off [10.182922771556742]
本稿では,ReLUアクティベーション機能を持つ2層ニューラルネットワークに対する漸近的一般化理論を提案する。
過度にパラメータ化されたランダムな特徴モデルは次元性の呪いに悩まされ、従って準最適であることを示す。
論文 参考訳(メタデータ) (2021-06-09T03:52:18Z) - Overparameterization of deep ResNet: zero loss and mean-field analysis [19.45069138853531]
データに適合するディープニューラルネットワーク(NN)内のパラメータを見つけることは、非最適化問題である。
基礎的な一階述語最適化法(漸進降下法)は,多くの現実的状況に完全に適合した大域的解を求める。
所定の閾値未満の損失を減らすために必要な深さと幅を高い確率で推定する。
論文 参考訳(メタデータ) (2021-05-30T02:46:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。