論文の概要: Learning the identity: a case study of how SGD selects among functional decompositions
- arxiv url: http://arxiv.org/abs/2610.00615v1
- Date: Wed, 30 Sep 2026 19:18:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.728859
- Title: Learning the identity: a case study of how SGD selects among functional decompositions
- Title(参考訳): アイデンティティの学習:SGDが機能的分解の中からどのように選択するかのケーススタディ
- Abstract要約: 本研究では,深い線形残差ネットワークを用いたアイデンティティ学習課題について検討する。
勾配降下が特定の解を再現的に好むことを示す。
また,SGDが同じ入力出力関数の特定の分解を優先する理由を,エントロピー損失レンズが明らかにできることを示す。
- 参考スコア(独自算出の注目度): 22.485745926188585
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: One might think that learning the identity function with a deep linear residual network is trivial - the path along residual connections already implements the identity, and so the network need only drive its weights to zero. However, this zero-weight solution is just one point on an entire manifold of population-loss minimizers, each corresponding to a different decomposition of the identity across the network's layers. Although the population loss does not distinguish among these solutions, stochastic gradient descent (SGD) reproducibly favors particular ones. For instance, under anisotropic label noise, the learned layers exhibit a noise-dependent spectrum; even with weight decay, SGD does not generally recover the zero-weight solution. Changing only the parametrization, while leaving the set of realizable functions unchanged, yields different behavior: factoring each weight matrix as a product of two matrices causes the weights to collapse to zero, even without explicit weight decay. While perhaps mysterious and unintuitive at first, these phenomena can be understood through the lens of entropic loss, which augments the population loss with a term proportional to the expected squared norm of the minibatch gradient (Ziyin et al., 2025). On the identity manifold, the population loss is constant, while the entropic term distinguishes among these decompositions. We characterize its minimizers analytically and use them to derive predictions for the structure of solutions favored by SGD. Networks trained with SGD closely match these predictions. Overall, the identity learning task studied here serves as a clean and simple case study of how the lens of entropic loss can clarify why SGD favors particular decompositions of the same input-output function.
- Abstract(参考訳): 深い線形残差ネットワークでアイデンティティ関数を学習することは自明である - 残差接続に沿ったパスは、すでにアイデンティティを実装しているため、ネットワークはその重みをゼロに抑える必要がある。
しかし、このゼロウェイト解は集団損失最小化の多様体全体の1点に過ぎず、それぞれがネットワークの層をまたいだアイデンティティの異なる分解に対応する。
人口減少はこれらの解を区別しないが、確率勾配降下(SGD)は再現的に特定の解を好む。
例えば、異方性ラベルノイズの下では、学習された層はノイズ依存のスペクトルを示す。
パラメトリゼーションだけを変えると、実現可能な函数の集合は変わらないが、異なる振る舞いをもたらす: 2つの行列の積として各重み行列を分解すると、明示的な重みの崩壊がなくても、重みはゼロに崩壊する。
最初は神秘的で直観的ではないが、これらの現象はエントロピー的損失のレンズを通して理解でき、これはミニバッチ勾配の予想2乗ノルム(Ziyin et al , 2025)に比例して人口減少を増大させる。
恒等多様体では、人口損失は一定であり、エントロピー項はこれらの分解を区別する。
我々は,その最小化器を解析的に特徴付け,SGDが好む解の構造の予測を導出する。
SGDで訓練されたネットワークは、これらの予測と密接に一致している。
全体として、ここで研究されるアイデンティティ学習タスクは、エントロピー損失のレンズがなぜSGDが同じ入力出力関数の特定の分解を好むのかを明らかにするための、クリーンで単純なケーススタディである。
関連論文リスト
- Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability [51.56484100374058]
機械論的解釈可能性プリミティブに対する最初の識別可能性定理を証明した。
スペクトルは、正当性分解ではなく、記述されたエラーバーを持つ識別可能なモデル固有の指紋である。
論文 参考訳(メタデータ) (2026-08-10T19:42:01Z) - Is Spurious Correlation Removal Always Learnable? [56.28155520961125]
不変学習は、構造が統計的に識別可能であっても失敗することがある。
ブラックボックスサンプリング可能な教師付きスパースリカバリプリミティブの下では、実証可能な多次元環境が存在する。
合成および実際のデータセットは、予測されたギャップと遷移を示し、単純な多様性診断を動機付ける。
論文 参考訳(メタデータ) (2026-06-11T05:49:43Z) - Trainability Beyond Linearity in Variational Quantum Objectives [0.0]
目的自体が固定可観測表現を許容しているのは、損失がアフィンであることと、損失がアフィンであることである。
増幅可能な目的はアフィンよりも数桁大きく解決された。
論文 参考訳(メタデータ) (2026-04-20T21:12:10Z) - Escape dynamics and implicit bias of one-pass SGD in overparameterized quadratic networks [3.198538967655537]
2層ニューラルネットワークの1パス勾配勾配勾配ダイナミクスを教師の枠組みで解析する。
本研究では,学生の進化を規定する低次元常微分方程式について考察する。
論文 参考訳(メタデータ) (2026-04-03T14:47:24Z) - An Accelerated Alternating Partial Bregman Algorithm for ReLU-based Matrix Decomposition [0.0]
本稿では,非負行列上に補正されたスパース低ランク特性について検討する。
本稿では,クラスタリングと圧縮タスクに有用な構造を取り入れた新しい正規化項を提案する。
我々は、任意の$Lge 1$に対して常に持つ$L$-smoothプロパティを維持しながら、対応する閉形式解を導出する。
論文 参考訳(メタデータ) (2025-03-04T08:20:34Z) - Simplicity Bias via Global Convergence of Sharpness Minimization [43.658859631741024]
ラベルノイズSGDは、2層ネットワークにおける損失ゼロのモデル多様体のシャープネスを常に最小化することを示す。
また、ゼロ損失多様体上の近似定常点における損失のヘッセンのトレースの新たな性質も見いだす。
論文 参考訳(メタデータ) (2024-10-21T18:10:37Z) - On the Dynamics Under the Unhinged Loss and Beyond [104.49565602940699]
我々は、閉形式力学を解析するための数学的機会を提供する、簡潔な損失関数であるアンヒンジド・ロスを導入する。
アンヒンジされた損失は、時間変化学習率や特徴正規化など、より実践的なテクニックを検討することができる。
論文 参考訳(メタデータ) (2023-12-13T02:11:07Z) - The Implicit Bias of Minima Stability in Multivariate Shallow ReLU
Networks [53.95175206863992]
本研究では,2次損失を持つ1層多変量ReLUネットワークをトレーニングする際に,勾配勾配勾配が収束する解のタイプについて検討する。
我々は、浅いReLUネットワークが普遍近似器であるにもかかわらず、安定した浅層ネットワークは存在しないことを証明した。
論文 参考訳(メタデータ) (2023-06-30T09:17:39Z) - Score-based Causal Representation Learning with Interventions [54.735484409244386]
本稿では,潜在因果変数を間接的に観察する際の因果表現学習問題について検討する。
目的は、 (i) 未知の線形変換(スケーリングまで)を回復し、 (ii) 潜在変数の下の有向非巡回グラフ(DAG)を決定することである。
論文 参考訳(メタデータ) (2023-01-19T18:39:48Z) - Random initialisations performing above chance and how to find them [22.812660025650253]
Entezariらは最近、異なる初期化にもかかわらず、SGDが発見した解は、ニューラルネットワークの置換不変性を考慮して同じ損失谷にあると推測した。
ここでは、そのような置換を見つけるために、単純だが強力なアルゴリズムを用いて、完全に接続されたネットワークにおいて仮説が真であるという直接的な実証的な証拠を得ることができる。
2つのネットワークは、初期化時に既に同じ損失谷に住んでおり、そのランダム性を平均化していますが、適切に置換された初期化は、かなり高い確率で実行されます。
論文 参考訳(メタデータ) (2022-09-15T17:52:54Z) - Mean-field Analysis of Piecewise Linear Solutions for Wide ReLU Networks [83.58049517083138]
勾配勾配勾配を用いた2層ReLUネットワークについて検討する。
SGDは単純な解に偏りがあることが示される。
また,データポイントと異なる場所で結び目が発生するという経験的証拠も提供する。
論文 参考訳(メタデータ) (2021-11-03T15:14:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。