論文の概要: Mechanisms of Width Scaling in Normalized Residual Networks: The Effective Alignment Dimension
- arxiv url: http://arxiv.org/abs/2607.24887v1
- Date: Mon, 27 Jul 2026 12:46:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.570657
- Title: Mechanisms of Width Scaling in Normalized Residual Networks: The Effective Alignment Dimension
- Title(参考訳): 正規化された残留ネットワークにおける幅スケーリングのメカニズム:有効配向次元
- Abstract要約: 本稿では, 有効アライメント次元, アクティベーション勾配の信号雑音幾何を記述する可測量を紹介する。
独立に推定されたトレーニングとテスト勾配の間の内積の正確な平均と分散を導出することにより、不整合確率の有限サンプル上界を得る。
幅制御されたLLaMA型トランスフォーマー、Pythia、ResNet-20による実験では、より広いモデルでは、より大きな有効アライメント次元と低い経験的ミスアライメントが示される。
- 参考スコア(独自算出の注目度): 13.776610961556202
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing theories of neural-network width characterize asymptotic limits, but provide limited guidance on whether an expansion direction identified from finite training data remains beneficial on unseen data. We study this problem for function-preserving residual expansion and introduce the effective alignment dimension, a measurable quantity describing the signal-noise geometry of activation gradients. By deriving the exact mean and variance of the inner product between independently estimated training and test gradients, we obtain a finite-sample upper bound on misalignment probability. The bound depends only on the effective alignment dimension and an effective sample size, requiring finite second moments and a nonzero population gradient, without covariance spectral assumptions or prescribed width-growth rates. We integrate this certificate into the train-test residual-expansion framework, yielding a high-probability condition for test-risk improvement. Experiments across width-controlled LLaMA-style Transformers, Pythia, and ResNet-20 show that wider models exhibit larger effective alignment dimensions and lower empirical misalignment. Direct residual interventions confirm that the alignment statistic predicts the sign and magnitude of held-out loss changes.
- Abstract(参考訳): 既存のニューラルネットワーク幅の理論は、漸近的限界を特徴づけるが、有限トレーニングデータから特定される拡張方向が、目に見えないデータに有益であるかどうかについての限定的なガイダンスを提供する。
本稿では, 関数保存残差拡大問題について検討し, 有効アライメント次元, アクティベーション勾配の信号雑音幾何を記述する可測量について紹介する。
独立に推定されたトレーニングとテスト勾配の間の内積の正確な平均と分散を導出することにより、不整合確率の有限サンプル上界を得る。
境界は有効アライメント次元と有効サンプルサイズにのみ依存し、共分散スペクトル仮定や所定の幅成長速度を伴わずに、有限第二モーメントと非ゼロ集団勾配を必要とする。
我々は、この証明書を列車試験残差拡大フレームワークに統合し、テストリスク改善のための高い確率条件を得る。
LLaMA型トランスフォーマー、Pythia、ResNet-20の幅制御による実験では、より広いモデルでは、より大きな有効アライメント次元と低い経験的ミスアライメントが示される。
直接的な残留介入は、アライメント統計がホールドアウト損失の変化の兆候と大きさを予測することを確認する。
関連論文リスト
- Across the Loss Landscape with Progressive Growth [51.366966420881646]
成長を漸進的緩和と見なして、より平坦な地域に向けての訓練戦略がいかに成長・最適化されるかを示す。
制御されたおもちゃの流域や現実的なResNet/CI-100環境でこれらの予測を実証的に検証する。
プログレッシブな部分空間成長は、より平坦な解を確実に生成するが、曲率の低減は、普遍的にテスト性能の向上に変換されず、平坦性一般化接続における微妙さを強調している。
論文 参考訳(メタデータ) (2026-08-25T13:50:48Z) - Finite-Sample Metric Non-Collapse for Geometrically Supervised Latent World Models in Control [0.0]
非線形決定論系の幾何学的教師付き潜在モデルに対する有限サンプル学習制御理論を確立する。
本稿では,方向分解能と分離状態判別を強制するエンコーダのみの局所的計量ヒンジを提案する。
モジュラー決定論は、学習した証明書を軌跡、有限水平コスト、学習コストヘッド、および論理的保証に転送する一方、検証された有限ネットの結果は、よりシャープなモデル固有の認証を可能にする。
論文 参考訳(メタデータ) (2026-08-07T14:25:33Z) - Quantifying Uncertainty In Wide Two-Layer Neural Networks: On The Law Of The Limiting Fluctuation Process [3.0171175820634826]
ニューラルネットワーク予測における不確かさの定量化は、通常のアプリケーションでは大きな問題である。
提案手法では,PDEの分散情報を用いて不確実性を直接評価することにより,コスト削減を図る。
そこで我々は,勾配降下法により訓練された広帯域2層ニューラルネットワークの平均場限界付近のランダムなゆらぎを記述する制限過程の法則について検討した。
論文 参考訳(メタデータ) (2026-06-04T10:25:23Z) - Trainability Beyond Linearity in Variational Quantum Objectives [0.0]
目的自体が固定可観測表現を許容しているのは、損失がアフィンであることと、損失がアフィンであることである。
増幅可能な目的はアフィンよりも数桁大きく解決された。
論文 参考訳(メタデータ) (2026-04-20T21:12:10Z) - LACE: Loss-Adaptive Capacity Expansion for Continual Learning [0.0]
LACE(Loss-Adaptive Capacity Expansion)は、トレーニング中にモデルの表現能力を拡張するオンラインメカニズムである。
LACEはラベルもリプレイバッファも外部コントローラも必要とせず、リソース制約下でのデバイス上での継続的な学習に適している。
論文 参考訳(メタデータ) (2026-03-30T15:58:33Z) - Leverage-Weighted Conformal Prediction [1.3537117504260623]
分割共形予測は、有限サンプルの限界カバレッジを持つ分布のない予測間隔を提供する。
統計的レバレッジの関数により非整合性のスコアを重み付けするLevanage-Weighted Conformal Predictionを提案する。
論文 参考訳(メタデータ) (2026-02-13T07:49:39Z) - Revisiting Zeroth-Order Optimization: Minimum-Variance Two-Point Estimators and Directionally Aligned Perturbations [57.179679246370114]
乱摂動の分布は, 摂動段差がゼロになる傾向にあるため, 推定子の分散を最小限に抑える。
以上の結果から, 一定の長さを維持するのではなく, 真の勾配に方向を合わせることが可能であることが示唆された。
論文 参考訳(メタデータ) (2025-10-22T19:06:39Z) - Neural Optimal Transport Meets Multivariate Conformal Prediction [58.43397908730771]
条件付きベクトル回帰(CVQR)のためのフレームワークを提案する。
CVQRは、ニューラルネットワークの最適輸送と量子化された最適化を組み合わせて、予測に適用する。
論文 参考訳(メタデータ) (2025-09-29T19:50:19Z) - Modes of Sequence Models and Learning Coefficients [0.6906005491572401]
変換器ネットワークにおける損失ランドスケープの計測可能な特性とデータ中のパターンをリンクするシーケンスモデリングの幾何学的記述を開発する。
局所学習係数の推定値がデータ依存しきい値以下のモードに無関心であることを理論的に示す。
この洞察は、ネットワークパラメータが人口減少の厳格な最小限ではない場合でも、なぜ信頼できるLLC推定値が得られるのかを明らかにする。
論文 参考訳(メタデータ) (2025-04-25T03:38:10Z) - A New Formulation of Lipschitz Constrained With Functional Gradient Learning for GANs [52.55025869932486]
本稿では,大規模データセット上でGAN(Generative Adversarial Networks)のトレーニングを行うための有望な代替手法を提案する。
本稿では,GANの学習を安定させるために,Lipschitz-Constrained Functional Gradient GANs Learning (Li-CFG)法を提案する。
判別器勾配のノルムを増大させることにより、潜在ベクトルの近傍サイズを小さくすることができることを示す。
論文 参考訳(メタデータ) (2025-01-20T02:48:07Z) - Implicit Bias of Gradient Descent for Logistic Regression at the Edge of
Stability [69.01076284478151]
機械学習の最適化において、勾配降下(GD)はしばしば安定性の端(EoS)で動く
本稿では,EoS系における線形分離可能なデータに対するロジスティック回帰のための定数段差GDの収束と暗黙バイアスについて検討する。
論文 参考訳(メタデータ) (2023-05-19T16:24:47Z) - Near-optimal inference in adaptive linear regression [60.08422051718195]
最小二乗法のような単純な方法でさえ、データが適応的に収集されるときの非正規な振る舞いを示すことができる。
我々は,これらの分布異常を少なくとも2乗推定で補正するオンラインデバイアス推定器のファミリーを提案する。
我々は,マルチアームバンディット,自己回帰時系列推定,探索による能動的学習などの応用を通して,我々の理論の有用性を実証する。
論文 参考訳(メタデータ) (2021-07-05T21:05:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。