論文の概要: Quantifying Depth Sufficiency in Residual Neural Networks: A First-Order Criterion
- arxiv url: http://arxiv.org/abs/2608.14664v1
- Date: Sat, 01 Aug 2026 04:07:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-23 14:54:39.952174
- Title: Quantifying Depth Sufficiency in Residual Neural Networks: A First-Order Criterion
- Title(参考訳): 残留ニューラルネットワークにおける深さ効率の定量化:1次基準
- Abstract要約: 本研究は,1次残差深度飽和度を許容される挿入毎に局所的に厳密な減少がないこととして定義する。
追加の深さは、条件付きアクティベーション勾配が少なくとも1つの許容可能な残留接空間にゼロでない射影を持つときに正確に1次値を持つ。
ResNets, GPT-2-style model, and continued-pretrained Pythia checkpoints, the maximum activation-gradient norms to the low-signal regime with depth。
- 参考スコア(独自算出の注目度): 16.717939260307087
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How can we determine whether a trained neural network is already deep enough? We study this under a fixed function-preserving residual-growth protocol specifying insertion locations, residual families, zero-output initializations, and zero-state first-order updates. We define first-order residual depth saturation as the absence of a strict local decrease from every admissible insertion. We prove residual non-degeneracy is necessary and sufficient: additional depth has first-order value exactly when conditional activation gradients have a nonzero projection onto at least one admissible residual tangent space. This boundary is shared by descent-compatible zero-state updates and invariant under regular local reparameterizations preserving that tangent space. Under residual-signal realizability, raw activation-gradient vanishing exactly certifies saturation. Across ResNets, GPT-2-style models, and continued-pretrained Pythia checkpoints, the maximum activation-gradient norm decreases toward a low-signal regime with depth. Function-preserving growth also achieves converged performance competitive with training from scratch. These results support activation-gradient magnitude as a conservative diagnostic of the remaining empirical first-order value of residual depth.
- Abstract(参考訳): トレーニング済みのニューラルネットワークがすでに十分に深いかどうかをどうやって判断すればよいのか?
本手法は, 挿入位置, 残余家族, ゼロ出力初期化, ゼロ状態一階更新を規定する固定関数保存残差プロトコルを用いて検討する。
本研究は,1次残差深度飽和を,許容挿入毎の局所的な局所的減少の欠如として定義する。
追加の深さは、条件付きアクティベーション勾配が少なくとも1つの許容可能な残留接空間にゼロでない射影を持つとき、正確に1次値を持つ。
この境界は降下互換のゼロ状態更新によって共有され、その接空間を保存する正規局所パラメータ化の下で不変である。
残留信号実現性の下では、生の活性化段階の消滅は飽和を正確に証明する。
ResNets, GPT-2-style model, and continued-pretrained Pythia checkpoints, the maximum activation-gradient norms to the low-signal regime with depth。
関数保存成長は、スクラッチからのトレーニングと競合する収束したパフォーマンスも達成します。
これらの結果は,残差深度の実験的な1次値の保存的診断として,アクティベーション・グラディエント・マグニチュードを支持した。
関連論文リスト
- Across the Loss Landscape with Progressive Growth [51.366966420881646]
成長を漸進的緩和と見なして、より平坦な地域に向けての訓練戦略がいかに成長・最適化されるかを示す。
制御されたおもちゃの流域や現実的なResNet/CI-100環境でこれらの予測を実証的に検証する。
プログレッシブな部分空間成長は、より平坦な解を確実に生成するが、曲率の低減は、普遍的にテスト性能の向上に変換されず、平坦性一般化接続における微妙さを強調している。
論文 参考訳(メタデータ) (2026-08-25T13:50:48Z) - Exact Network Surgery: Functional Invariance and Gradient Plasticity in Reactive Computational Graphs [0.0]
ライブ計算グラフに残差ブロックを挿入する際の場所を形式化する。
挿入したパラメータは挿入直後にトレーニング可能であることを示す。
フラグ付き予備虫垂は、挿入後ゲートダイナミクスに関する最初の単座観察を報告している。
論文 参考訳(メタデータ) (2026-07-18T00:48:24Z) - Richer Bayesian Last Layers with Subsampled NTK Features [25.566044416945875]
Bayesian Last Layers (BLL) は、ニューラルネットワークにおける不確実性を推定する便利な、計算的に効率的な方法を提供する。
本稿では,最後の層に分散した空間上のニューラル・タンジェント・カーネル(NTK)特徴の投影を利用して,BLLを改善する手法を提案する。
これにより、標準的なBLLの推論の計算コストを低く保ちながら、完全なネットワークの可変性を考慮に入れた後部推論が可能となる。
論文 参考訳(メタデータ) (2026-02-01T15:24:20Z) - Non-Singularity of the Gradient Descent map for Neural Networks with Piecewise Analytic Activations [53.348574336527854]
重みとバイアスの空間上の関数としてのニューラルネットワークマップについて検討する。
我々は、現実的なニューラルネットワークアーキテクチャの損失ランドスケープにおける勾配降下(GD)マップの非特異性を初めて証明した。
論文 参考訳(メタデータ) (2025-10-28T14:34:33Z) - Optimized Weight Initialization on the Stiefel Manifold for Deep ReLU Neural Networks [5.363441578662801]
ReLUネットワークの不適切な重量トレーニングは、ネットワーク深さが増加するにつれて不活性化死ReLUを悪化させ、不安定を悪化させる可能性がある。
我々は、スティーフェル多様体上の最適化問題を導入し、これによりスケールを保ち、プレアクティベーション統計を校正する。
本研究では, 死滅するReLU問題の防止, アクティベーション分散の緩やかな減衰, 勾配消滅の緩和について述べる。
論文 参考訳(メタデータ) (2025-08-30T05:17:31Z) - Description of the Training Process of Neural Networks via Ergodic Theorem : Ghost nodes [3.637162892228131]
本稿では、訓練勾配降下(SGD)による深層ニューラルネットワークの理解と加速のための統一的な枠組みを提案する。
我々は,安定剤に対する真の収束を識別する,最も大きなリャプノフ指数の実用診断,実行推定を導入する。
本稿では,補助的なゴースト出力ノードを付加した標準分類器のゴーストカテゴリ拡張を提案する。
論文 参考訳(メタデータ) (2025-07-01T17:54:35Z) - A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models [6.734175048463699]
正方形損失を学習した2層線形ニューラルネットワークの勾配降下に対する線形収束率を導出した。
我々の収束分析は、事前の結果を改善するだけでなく、ステップサイズに対するより良い選択を示唆している。
論文 参考訳(メタデータ) (2025-05-16T19:57:22Z) - On the Convergence of Gradient Descent for Large Learning Rates [55.33626480243135]
固定ステップサイズを使用すると収束が不可能であることを示す。
正方形損失を持つ線形ニューラルネットワークの場合,これを証明した。
また、勾配に対するリプシッツ連続性のような強い仮定を必要とせず、より一般的な損失に対する収束の不可能性も証明する。
論文 参考訳(メタデータ) (2024-02-20T16:01:42Z) - Implicit Bias of Gradient Descent for Two-layer ReLU and Leaky ReLU
Networks on Nearly-orthogonal Data [66.1211659120882]
好ましい性質を持つ解に対する暗黙の偏見は、勾配に基づく最適化によって訓練されたニューラルネットワークがうまく一般化できる重要な理由であると考えられている。
勾配流の暗黙バイアスは、均質ニューラルネットワーク(ReLUやリークReLUネットワークを含む)に対して広く研究されているが、勾配降下の暗黙バイアスは現在、滑らかなニューラルネットワークに対してのみ理解されている。
論文 参考訳(メタデータ) (2023-10-29T08:47:48Z) - Globally Optimal Training of Neural Networks with Threshold Activation
Functions [63.03759813952481]
しきい値アクティベートを伴うディープニューラルネットワークの重み劣化正規化学習問題について検討した。
ネットワークの特定の層でデータセットを破砕できる場合に、簡易な凸最適化の定式化を導出する。
論文 参考訳(メタデータ) (2023-03-06T18:59:13Z) - Neural Networks with Sparse Activation Induced by Large Bias: Tighter Analysis with Bias-Generalized NTK [86.45209429863858]
ニューラル・タンジェント・カーネル(NTK)における一層ReLUネットワークのトレーニングについて検討した。
我々は、ニューラルネットワークが、テクティトビア一般化NTKと呼ばれる異なる制限カーネルを持っていることを示した。
ニューラルネットの様々な特性をこの新しいカーネルで研究する。
論文 参考訳(メタデータ) (2023-01-01T02:11:39Z) - Implicit Bias in Leaky ReLU Networks Trained on High-Dimensional Data [63.34506218832164]
本研究では,ReLUを活性化した2層完全連結ニューラルネットワークにおける勾配流と勾配降下の暗黙的バイアスについて検討する。
勾配流には、均一なニューラルネットワークに対する暗黙のバイアスに関する最近の研究を活用し、リーク的に勾配流が2つ以上のランクを持つニューラルネットワークを生成することを示す。
勾配降下は, ランダムな分散が十分小さい場合, 勾配降下の1ステップでネットワークのランクが劇的に低下し, トレーニング中もランクが小さくなることを示す。
論文 参考訳(メタデータ) (2022-10-13T15:09:54Z) - Convergence and Implicit Regularization Properties of Gradient Descent
for Deep Residual Networks [7.090165638014331]
一定の層幅とスムーズな活性化関数を持つ深層残留ネットワークのトレーニングにおいて,勾配勾配の線形収束性を大域最小限に証明する。
トレーニングされた重みは、層指数の関数として、ネットワークの深さが無限大になる傾向にあるため、H"古い"スケーリング制限が連続であることを示す。
論文 参考訳(メタデータ) (2022-04-14T22:50:28Z) - When does gradient descent with logistic loss interpolate using deep
networks with smoothed ReLU activations? [51.1848572349154]
固定幅深層ネットワークに適用された勾配勾配がロジスティック損失をゼロにする条件を確立する。
解析はSwishやHuberized ReLUといったReLUのスムーズな近似に適用する。
論文 参考訳(メタデータ) (2021-02-09T18:04:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。