論文の概要: Neural Collapse Dynamics: Depth, Activation, Regularisation, and Feature Norm Threshold
- arxiv url: http://arxiv.org/abs/2604.00230v1
- Date: Tue, 31 Mar 2026 20:52:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.71847
- Title: Neural Collapse Dynamics: Depth, Activation, Regularisation, and Feature Norm Threshold
- Title(参考訳): 神経崩壊ダイナミクス:深さ、活性化、正規化、特徴ノルム閾値
- Authors: Anamika Paul Rupa,
- Abstract要約: 神経崩壊(英語版) -- 単純な等角的タイトフレームへの有極層の特徴の収束 - は平衡においてよく理解されているが、その開始を規定する力学は、まだ貧弱な特性を保っている。
NCは平均的特徴ノルムがモデルデータセット固有の臨界値 fn* に達すると発生する。
1) 深度は崩壊速度に非単調効果を持ち、(2) アクティベーションは崩壊速度とfn*の両方を共同で決定し、(3) 重量崩壊は3つの相図を定義する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Neural collapse (NC) -- the convergence of penultimate-layer features to a simplex equiangular tight frame -- is well understood at equilibrium, but the dynamics governing its onset remain poorly characterised. We identify a simple and predictive regularity: NC occurs when the mean feature norm reaches a model-dataset-specific critical value, fn*, that is largely invariant to training conditions. This value concentrates tightly within each (model, dataset) pair (CV < 8%); training dynamics primarily affect the rate at which fn approaches fn*, rather than the value itself. In standard training trajectories, the crossing of fn below fn* consistently precedes NC onset, providing a practical predictor with a mean lead time of 62 epochs (MAE 24 epochs). A direct intervention experiment confirms fn* is a stable attractor of the gradient flow -- perturbations to feature scale are self-corrected during training, with convergence to the same value regardless of direction (p>0.2). Completing the (architecture)x(dataset) grid reveals the paper's strongest result: ResNet-20 on MNIST gives fn* = 5.867 -- a +458% architecture effect versus only +68% on CIFAR-10. The grid is strongly non-additive; fn* cannot be decomposed into independent architecture and dataset contributions. Four structural regularities emerge: (1) depth has a non-monotonic effect on collapse speed; (2) activation jointly determines both collapse speed and fn*; (3) weight decay defines a three-regime phase diagram -- too little slows, an optimal range is fastest, and too much prevents collapse; (4) width monotonically accelerates collapse while shifting fn* by at most 13%. These results establish feature-norm dynamics as an actionable diagnostic for predicting NC timing, suggesting that norm-threshold behaviour is a general mechanism underlying delayed representational reorganisation in deep networks.
- Abstract(参考訳): ニューラルネットワークの崩壊(NC) - 単純な等角的強弱フレームへの垂直層の特徴の収束 - は平衡においてよく理解されているが、その開始を規定する力学はいまだに貧弱な特性を保っている。
NCは、平均的特徴ノルムがトレーニング条件にほとんど不変なモデルデータセット固有の臨界値 fn* に達すると発生する。
この値は各(モデル、データセット)ペア(CV < 8%)に強く集中する。
標準的な訓練軌道では、fn の fn* 以下の交差は NC の開始に一貫して先行し、平均リード時間 62 epochs (MAE 24 epochs) の実用的な予測器を提供する。
直接介入実験により、fn* は勾配流の安定な引力であり、特徴スケールへの摂動は、方向に関係なく同じ値に収束する(p>0.2)。
MNIST 上の ResNet-20 は fn* = 5.867 -- アーキテクチャ効果 +458% に対して CIFAR-10 では +68% である。
fn*は独立したアーキテクチャとデータセットのコントリビューションに分解することはできない。
1) 深度は崩壊速度に非単調な効果を持ち、(2) アクティベーションは崩壊速度とfn*の両方を共同で決定し、(3) 重量崩壊は3段階の位相図を定義する。
これらの結果は、NCタイミングを予測するための実用的な診断法として機能ノルム力学を確立し、ノルム閾値挙動がディープネットワークにおける遅延表現再構成の基盤となる一般的なメカニズムであることを示唆している。
関連論文リスト
- Unveiling the Mechanism of Continuous Representation Full-Waveform Inversion: A Wave Based Neural Tangent Kernel Framework [52.632217600064344]
フルウェーブフォーム・インバージョン(FWI)は、限られた測定値から波動方程式の物理パラメータを推定する。
FWI法は初期モデルの精度に対する悪名高い感度によって制限されている。
連続表現 FWI (CR-FWI) の最近の進歩は、暗黙的ニューラル表現 (INR) のような座標ベースニューラルネットワークによるパラメータモデルを表現することで、初期モデルへの依存を緩和できることを実証している。
論文 参考訳(メタデータ) (2026-03-23T03:22:33Z) - K-GMRF: Kinetic Gauss-Markov Random Field for First-Principles Covariance Tracking on Lie Groups [8.489406212619164]
共分散追跡のためのオンライン学習自由フレームワークK-GMRFを提案する。
本手法は, 構造保存型シンプレクティックインテグレータにより伝搬される潜在角速度を駆動するトルクとして観測を解釈する。
理論的には、この2階の力学が一定回転下でゼロ定常誤差を達成することを証明している。
論文 参考訳(メタデータ) (2026-03-20T03:16:36Z) - Alternating Gradient Flow Utility: A Unified Metric for Structural Pruning and Dynamic Routing in Deep Networks [52.153950303594684]
交互勾配流(Alternating Gradient Flow, AGF)に着想を得た非結合型運動パラダイムを提案する。
AGFはネットワークの構造的「運動ユーティリティ」を正確にキャプチャする
我々は、AGFに誘導されるオフライン構造探索を、ゼロコストの物理プリミティブを介してオンライン実行から切り離すハイブリッドルーティングフレームワークを設計する。
論文 参考訳(メタデータ) (2026-03-12T18:19:21Z) - DeNOTS: Stable Deep Neural ODEs for Time Series [0.99450247450967]
CDEは不規則時系列の時間的進化を処理する方法を提供する。
我々は、NFEの増加とモデルの「深化」のために統合時間地平線を拡大することを提案する。
また、負のフィードバックによって動的を安定化する方法を提案する。
論文 参考訳(メタデータ) (2024-08-15T09:49:37Z) - FedNAR: Federated Optimization with Normalized Annealing Regularization [54.42032094044368]
ウェイト崩壊の選択を探索し、ウェイト崩壊値が既存のFLアルゴリズムの収束に有意な影響を及ぼすことを確かめる。
我々は,既存のFLアルゴリズムにシームレスに統合可能なプラグインであるFederated Optimization with Normalized Annealing Regularization (FedNAR)を開発した。
論文 参考訳(メタデータ) (2023-10-04T21:11:40Z) - Intensity Profile Projection: A Framework for Continuous-Time
Representation Learning for Dynamic Networks [50.2033914945157]
本稿では、連続時間動的ネットワークデータのための表現学習フレームワークIntensity Profile Projectionを提案する。
このフレームワークは3つの段階から構成される: 対の強度関数を推定し、強度再構成誤差の概念を最小化する射影を学習する。
さらに、推定軌跡の誤差を厳密に制御する推定理論を開発し、その表現がノイズに敏感な追従解析に利用できることを示す。
論文 参考訳(メタデータ) (2023-06-09T15:38:25Z) - Reliable Graph Neural Networks via Robust Aggregation [1.7188280334580197]
グラフ構造を標的とした摂動はグラフニューラルネットワーク(GNN)の性能低下に極めて有効であることが証明されている。
敵の訓練のような伝統的な防御は、堅牢性を改善することができないように思われる。
この研究は、対向的に注入されたエッジが、ノードの近傍集約関数に追加のサンプルとして、効果的に見ることができるという観察によって動機付けられている。
論文 参考訳(メタデータ) (2020-10-29T14:55:20Z) - Revisiting Initialization of Neural Networks [72.24615341588846]
ヘッセン行列のノルムを近似し, 制御することにより, 層間における重みのグローバルな曲率を厳密に推定する。
Word2Vec と MNIST/CIFAR 画像分類タスクの実験により,Hessian ノルムの追跡が診断ツールとして有用であることが確認された。
論文 参考訳(メタデータ) (2020-04-20T18:12:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。