論文の概要: Spectral Alignment as Predictor of Loss Explosion in Neural Network Training
- arxiv url: http://arxiv.org/abs/2510.04202v1
- Date: Sun, 05 Oct 2025 13:35:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-07 16:52:59.513538
- Title: Spectral Alignment as Predictor of Loss Explosion in Neural Network Training
- Title(参考訳): ニューラルネットワークトレーニングにおける損失爆発予測器としてのスペクトルアライメント
- Abstract要約: ディープニューラルネットワークのトレーニングにおける損失爆発は、数百万ドルのトレーニング実行を無効にする可能性がある。
重み行列の主特異ベクトルと層入力の分布アライメントを監視する新しい計量であるスペクトルアライメントを導入する。
言語モデルに関する実証的な結果は、SA分布の監視が従来のスカラーメトリクスよりもはるかに早く、明確な損失爆発の警告を提供することを示している。
- 参考スコア(独自算出の注目度): 31.831122738372603
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Loss explosions in training deep neural networks can nullify multi-million dollar training runs. Conventional monitoring metrics like weight and gradient norms are often lagging and ambiguous predictors, as their values vary dramatically across different models and even between layers of the same model, making it difficult to establish a unified standard for detecting impending failure. We introduce Spectral Alignment (SA), a novel, theoretically-grounded metric that monitors the distributional alignment between layer inputs and the principal singular vectors of weight matrices. We show that a collapse in the sign diversity of this alignment is a powerful early predictor of representational collapse and training divergence. Empirical results on language models demonstrate that monitoring the SA distribution provides a significantly earlier and clearer warning of loss explosions than traditional scalar metrics. SA's low computational overhead makes it a practical tool for safeguarding model training.
- Abstract(参考訳): ディープニューラルネットワークのトレーニングにおける損失爆発は、数百万ドルのトレーニング実行を無効にする可能性がある。
重みや勾配の基準のような従来の監視指標は、異なるモデルや同じモデルの層の間でも、その値が劇的に変化するため、しばしば遅延し曖昧な予測器となるため、迫り来る障害を検出するための統一された標準を確立することは困難である。
本稿では, 層入力と重み行列の主特異ベクトルとの分布アライメントをモニタする, 理論上の新しい測度であるスペクトルアライメント(SA)を紹介する。
このアライメントの符号の多様性の崩壊は、表現的崩壊と訓練の分岐の強力な早期予測因子であることを示す。
言語モデルに関する実証的な結果は、SA分布の監視が従来のスカラーメトリクスよりもはるかに早く、明確な損失爆発の警告を提供することを示している。
SAの計算オーバーヘッドが低いため、モデルトレーニングを保護するための実用的なツールになります。
関連論文リスト
- Into the ORBIT for Time Series: Training Regimes for Foundation Models [16.359864017246494]
ORBITはトレーニング前のディストリビューションを明確にし、制御可能にするトレーニングパラダイムである。
そこで我々は,後期層表現を停止段階の教師として利用する学習目標であるランクガイド型クロスデプスアライメントを導入する。
GIFT-Evalとfev-benchの評価は、様々な領域と周波数で強いゼロショット予測性能を示す。
論文 参考訳(メタデータ) (2026-08-13T14:00:39Z) - Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability [20.49786007379445]
本研究では,各クリティカルモジュールの機能的役割から内部モニターを導出することにより,トレーニング不安定性のメカニズム駆動検出を行う。
低精度の注意、大規模学習率、複合障害に関する私たちのフォールトインジェクション実験は、これらの信号が異なる障害に対して異なるシグネチャを提供することを示している。
論文 参考訳(メタデータ) (2026-06-26T14:18:22Z) - SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere [90.85001795656633]
ビデオ異常検出(VAD)は、トリミングされていない監視ビデオの通常のパターンから逸脱するイベントを自動的に識別することを目的としている。
SphereVADはトレーニング不要でゼロショットのVADフレームワークで、単位超球面上の準比測地線推定をvon Mises-Fisher (vMF) と再放送する。
論文 参考訳(メタデータ) (2026-05-08T16:57:38Z) - LogitDynamics: Reliable ViT Error Detection from Layerwise Logit Trajectories [1.4610038284393168]
視覚変換器(ViT)の誤差予測に関する研究
大規模言語モデルにおける内信号幻覚検出の動機付けにより、類似の深度信号がViTに存在するかどうかを考察する。
中間層に軽量な線形ヘッドを付加することにより、予測クラスのロジットとトップK競合の両方をキャプチャする最後のL層から特徴を抽出する。
これらの特徴に基づいて訓練された線形プローブは、エラーインジケータを予測する。
論文 参考訳(メタデータ) (2026-04-12T13:43:40Z) - Amortized Predictability-aware Training Framework for Time Series Forecasting and Classification [10.816479922364097]
時系列予測 (TSF) と時系列分類 (TSC) の双方に対して, 一般的なアモータイズ予測可能性を考慮したトレーニングフレームワーク (APTF) を提案する。
APTFは2つの重要な設計を導入し、予測可能性の低いモデルから適切な学習をしながら、モデルが高い予測可能性のサンプルに集中できるようにする。
論文 参考訳(メタデータ) (2026-02-18T06:59:05Z) - Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks [59.552873049024775]
計算最適化モデルでは, 極めて高精度な普遍性を示すことを示す。
学習速度が減衰すると、崩壊は非常に厳しくなり、モデル間の正規化曲線の差はノイズフロアより下になる。
これらの現象は、典型的なニューラルスケーリング法則において、崩壊とパワー・ロー構造を結びつけることによって説明される。
論文 参考訳(メタデータ) (2025-07-02T20:03:34Z) - SINDER: Repairing the Singular Defects of DINOv2 [61.98878352956125]
大規模なデータセットでトレーニングされたビジョントランスフォーマーモデルは、抽出したパッチトークンにアーティファクトを表示することが多い。
本稿では,小さなデータセットのみを用いて構造欠陥を補正するスムーズなスムーズな正規化を提案する。
論文 参考訳(メタデータ) (2024-07-23T20:34:23Z) - QGait: Toward Accurate Quantization for Gait Recognition with Binarized Input [17.017127559393398]
バックプロパゲーション時の円関数の勾配をよりよくシミュレートする,微分可能なソフト量子化器を提案する。
これにより、ネットワークは微妙な入力摂動から学習することができる。
量子化エラーをシミュレートしながら収束を確保するためのトレーニング戦略をさらに洗練する。
論文 参考訳(メタデータ) (2024-05-22T17:34:18Z) - Unsupervised Continual Anomaly Detection with Contrastively-learned
Prompt [80.43623986759691]
UCADと呼ばれる新しい非教師付き連続異常検出フレームワークを提案する。
このフレームワークは、対照的に学習したプロンプトを通じて、UDAに継続的な学習能力を持たせる。
我々は総合的な実験を行い、教師なし連続異常検出とセグメンテーションのベンチマークを設定した。
論文 参考訳(メタデータ) (2024-01-02T03:37:11Z) - GIT: Detecting Uncertainty, Out-Of-Distribution and Adversarial Samples
using Gradients and Invariance Transformations [77.34726150561087]
本稿では,ディープニューラルネットワークにおける一般化誤差検出のための総合的アプローチを提案する。
GITは勾配情報と不変変換の利用を組み合わせる。
本実験は,各種ネットワークアーキテクチャの最先端技術と比較して,GITの優れた性能を示すものである。
論文 参考訳(メタデータ) (2023-07-05T22:04:38Z) - Regularized Vector Quantization for Tokenized Image Synthesis [126.96880843754066]
画像の離散表現への量子化は、統合生成モデリングにおける根本的な問題である。
決定論的量子化は、厳しいコードブックの崩壊と推論段階の誤調整に悩まされ、一方、量子化は、コードブックの利用率の低下と再構築の目的に悩まされる。
本稿では、2つの視点から正規化を適用することにより、上記の問題を効果的に緩和できる正規化ベクトル量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-11T15:20:54Z) - Lossy Compression for Robust Unsupervised Time-Series Anomaly Detection [4.873362301533825]
本稿では,異常検出のためのLossy Causal Temporal Convolutional Neural Network Autoencoderを提案する。
我々のフレームワークは, 速度歪み損失とエントロピーボトルネックを用いて, タスクの圧縮潜在表現を学習する。
論文 参考訳(メタデータ) (2022-12-05T14:29:16Z) - Self-Supervised Training with Autoencoders for Visual Anomaly Detection [61.62861063776813]
我々は, 正規サンプルの分布を低次元多様体で支持する異常検出において, 特定のユースケースに焦点を当てた。
我々は、訓練中に識別情報を活用する自己指導型学習体制に適応するが、通常の例のサブ多様体に焦点をあてる。
製造領域における視覚異常検出のための挑戦的なベンチマークであるMVTec ADデータセットで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2022-06-23T14:16:30Z) - A heteroencoder architecture for prediction of failure locations in
porous metals using variational inference [1.2722697496405462]
多孔質金属張力試験片の故障箇所を予測するために,エンコーダ・デコーダ畳み込みニューラルネットワークを用いた。
故障箇所の予測の目的は、標本中のほとんどの材料が故障しないため、クラス不均衡の極端なケースを示す。
得られた予測分散は、任意の標本において最も失敗する可能性のある位置のランク付けに有効であることを示す。
論文 参考訳(メタデータ) (2022-01-31T20:26:53Z) - Dense Out-of-Distribution Detection by Robust Learning on Synthetic
Negative Data [1.7474352892977458]
道路走行シーンとリモートセンシング画像における分布外異常の検出方法を示す。
我々は,カバレッジ指向学習の目的と異なる解像度でサンプルを生成する能力により,共同で訓練された正規化フローを活用する。
結果として得られたモデルは、道路走行シーンとリモートセンシング画像におけるアウト・オブ・ディストリビューション検出のためのベンチマークに、新たな技術状況を設定した。
論文 参考訳(メタデータ) (2021-12-23T20:35:10Z) - Shaping Deep Feature Space towards Gaussian Mixture for Visual
Classification [74.48695037007306]
視覚分類のためのディープニューラルネットワークのためのガウス混合損失関数(GM)を提案する。
分類マージンと可能性正規化により、GM損失は高い分類性能と特徴分布の正確なモデリングの両方を促進する。
提案したモデルは、追加のトレーニング可能なパラメータを使わずに、簡単かつ効率的に実装できる。
論文 参考訳(メタデータ) (2020-11-18T03:32:27Z) - Asymptotic Behavior of Adversarial Training in Binary Classification [41.7567932118769]
敵の訓練は、敵の攻撃に対する防衛の最先端の方法と考えられている。
実際に成功したにもかかわらず、敵の訓練のパフォーマンスを理解する上でのいくつかの問題は未解決のままである。
2進分類における対角訓練の最小化のための正確な理論的予測を導出する。
論文 参考訳(メタデータ) (2020-10-26T01:44:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。