論文の概要: Spectral Signatures of Data Quality: Eigenvalue Tail Index as a Diagnostic for Label Noise in Neural Networks
- arxiv url: http://arxiv.org/abs/2603.27885v1
- Date: Sun, 29 Mar 2026 21:53:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.15831
- Title: Spectral Signatures of Data Quality: Eigenvalue Tail Index as a Diagnostic for Label Noise in Neural Networks
- Title(参考訳): データ品質のスペクトルシグナチャ:ニューラルネットワークにおけるラベルノイズの診断としての固有値タイル指数
- Authors: Matthew Loftus,
- Abstract要約: ニューラルネットワークの重み行列のスペクトル特性がテスト精度を予測できるかどうかを検討する。
制御されたラベルノイズの下では、ネットワークのボトルネック層における固有値分布のテール指数アルファは、残響R2 = 0.984(21ノイズレベル、3シードレベル)でテスト精度を予測する。
我々は,この署名の軌跡として情報処理ボトルネック層を同定し,ランダム行列モデルにおけるBBP相転移と観測を結びつける。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate whether spectral properties of neural network weight matrices can predict test accuracy. Under controlled label noise variation, the tail index alpha of the eigenvalue distribution at the network's bottleneck layer predicts test accuracy with leave-one-out R^2 = 0.984 (21 noise levels, 3 seeds per level), far exceeding all baselines: the best conventional metric (Frobenius norm of the optimal layer) achieves LOO R^2 = 0.149. This relationship holds across three architectures (MLP, CNN, ResNet-18) and two datasets (MNIST, CIFAR-10). However, under hyperparameter variation at fixed data quality (180 configurations varying width, depth, learning rate, and weight decay), all spectral and conventional measures are weak predictors (R^2 < 0.25), with simple baselines (global L_2 norm, LOO R^2 = 0.219) slightly outperforming spectral measures (tail alpha, LOO R^2 = 0.167). We therefore frame the tail index as a data quality diagnostic: a powerful detector of label corruption and training set degradation, rather than a universal generalization predictor. A noise detector calibrated on synthetic noise successfully identifies real human annotation errors in CIFAR-10N (9% noise detected with 3% error). We identify the information-processing bottleneck layer as the locus of this signature and connect the observations to the BBP phase transition in spiked random matrix models. We also report a negative result: the level spacing ratio <r> is uninformative for weight matrices due to Wishart universality.
- Abstract(参考訳): ニューラルネットワークの重み行列のスペクトル特性がテスト精度を予測できるかどうかを検討する。
制御されたラベルノイズ変動の下では、ネットワークのボトルネック層における固有値分布のテール指数アルファは、残響R^2 = 0.984(21ノイズレベル、3シードレベル)でテスト精度を予測し、全てのベースラインをはるかに超える。
この関係は、3つのアーキテクチャ(MLP、CNN、ResNet-18)と2つのデータセット(MNIST、CIFAR-10)にまたがる。
しかし、固定されたデータ品質におけるハイパーパラメータ変動(幅、深さ、学習速度、重量減衰)では、全てのスペクトルおよび従来の測定基準は弱い予測因子(R^2 < 0.25)であり、単純なベースライン(L_2ノルム、LOO R^2 = 0.219)はスペクトル測度(テールアルファ、LOO R^2 = 0.167)よりわずかに優れていた。
そこで我々は、テールインデックスをデータ品質診断として、普遍的な一般化予測器ではなく、ラベルの破損とトレーニングセットの劣化の強力な検出を行う。
合成ノイズを校正したノイズ検出器は、CIFAR-10N(9%のノイズを3%の誤差で検出)における実際の人間のアノテーションエラーを正常に識別する。
我々は,この署名の軌跡として情報処理ボトルネック層を同定し,この観測結果をスパイクされたランダム行列モデルにおけるBBP相転移に接続する。
また, ウェイシュアートの普遍性による重量行列では, レベルスペーシング比<r>が非形式的であるという否定的な結果も報告した。
関連論文リスト
- Variational Rectification Inference for Learning with Noisy Labels [74.85528327499662]
損失関数の適応的補正を定式化するために, 変分補正推論(VRI)を提案する。
VRIは、補正ベクトルを潜在変数として扱うことによって階層ベイズとして構成される。
VRIで変分項を導入することにより、条件付き後部を正確に推定し、ディラックデルタ関数への崩壊を避ける。
論文 参考訳(メタデータ) (2026-03-18T01:25:08Z) - Zero-Shot Detection of Elastic Transient Morphology Across Physical Systems [0.0]
干渉ひずみの過渡度から学習した表現は、未知のセンサのモルフォロジーに敏感な演算子として機能することを示す。
非ガウス楽器のグリッチを専門に訓練したニューラルエンコーダを用いて、圧延要素の軸受に対して厳密なゼロショット異常解析を行う。
論文 参考訳(メタデータ) (2026-01-16T16:35:07Z) - Why Machine Learning Models Systematically Underestimate Extreme Values II: How to Fix It with LatentNN [0.2700171473617699]
減衰バイアスは、天文学的なデータ駆動モデルに影響を与える。
ニューラルネットワークは同じ減衰バイアスに悩まされていることを示す。
ネットワークパラメータと潜時入力値を協調的に最適化するLatentNNを提案する。
論文 参考訳(メタデータ) (2025-12-29T01:59:10Z) - Reliable Active Learning from Unreliable Labels via Neural Collapse Geometry [5.1511135538176]
アクティブラーニング(AL)は、情報的なサンプルを優先順位付けすることでアノテーションのコストを削減することを約束するが、ラベルがうるさい場合やデータ分散がシフトした場合、その信頼性は低下する。
本稿では,深層ネットワークの創発的幾何学的規則性を活用し,信頼できない監視に対処するフレームワークである能動学習(NCAL-R)を提案する。
論文 参考訳(メタデータ) (2025-10-10T17:50:31Z) - Chirp Localization via Fine-Tuned Transformer Model: A Proof-of-Concept Study [0.23020018305241333]
脳波スペクトログラムのチャープ様パターンは発作ダイナミクスの鍵となるバイオマーカーである。
本研究では、視覚変換器(ViT)モデルとローランド適応(LoRA)を微調整することで、このギャップを埋める。
我々は、チャープパラメータを持つ10万のスペクトログラムを生成し、チャープローカライゼーションのための最初の大規模ベンチマークを作成した。
論文 参考訳(メタデータ) (2025-03-24T14:27:07Z) - How Does Pseudo-Labeling Affect the Generalization Error of the
Semi-Supervised Gibbs Algorithm? [73.80001705134147]
擬似ラベル付き半教師付き学習(SSL)におけるGibsアルゴリズムによる予測一般化誤差(ゲンエラー)を正確に評価する。
ゲンエラーは、出力仮説、擬ラベルデータセット、ラベル付きデータセットの間の対称性付きKL情報によって表現される。
論文 参考訳(メタデータ) (2022-10-15T04:11:56Z) - SLA$^2$P: Self-supervised Anomaly Detection with Adversarial
Perturbation [77.71161225100927]
異常検出は、機械学習の基本的な問題であるが、難しい問題である。
本稿では,非教師付き異常検出のための新しい強力なフレームワークであるSLA$2$Pを提案する。
論文 参考訳(メタデータ) (2021-11-25T03:53:43Z) - Conditioning Trick for Training Stable GANs [70.15099665710336]
本稿では,GANトレーニング中の不安定性問題に対応するため,ジェネレータネットワークに正規性から逸脱する条件付け手法を提案する。
我々は、生成元をシュア分解のスペクトル領域で計算された実サンプルの正規化関数から逸脱するように強制する。
論文 参考訳(メタデータ) (2020-10-12T16:50:22Z) - Deep learning for gravitational-wave data analysis: A resampling
white-box approach [62.997667081978825]
我々は、LIGO検出器からの単一干渉計データを用いて、畳み込みニューラルネットワーク(CNN)を用いて、コンパクトなバイナリコレッセンスにおける重力波(GW)信号を検出する。
CNNはノイズを検出するのに非常に正確だが、GW信号のリコールに十分な感度がないため、CNNはGWトリガの生成よりもノイズ低減に適している。
論文 参考訳(メタデータ) (2020-09-09T03:28:57Z) - Weak Detection in the Spiked Wigner Model with General Rank [13.45821655503426]
我々は,信号+雑音型行列モデルから信号を検出する統計的決定過程を付加的なウィグナー雑音で検討する。
本稿では,信号の分布や雑音に依存しないデータ行列の線形スペクトル統計に基づく仮説テストを提案する。
論文 参考訳(メタデータ) (2020-01-16T06:40:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。