論文の概要: How the Hessian-Spectrum of Neural Networks Depends on Data
- arxiv url: http://arxiv.org/abs/2607.13631v1
- Date: Wed, 15 Jul 2026 09:25:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.718757
- Title: How the Hessian-Spectrum of Neural Networks Depends on Data
- Title(参考訳): ニューラルネットワークのヘシアンスペクトルがデータにどのように依存するか
- Abstract要約: 任意の幅と深さを持つ線形ネットワークのHessianの固有値と、任意の数のサンプル、特徴、ラベルを持つデータセットを導出する。
MSE損失を伴う分類タスクに対して、解の鋭さは、任意のクラスに属するサンプルの最大割合と直接関係していると同定する。
- 参考スコア(独自算出の注目度): 17.586909900082137
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Hessian matrix is an important quantity of interest when it comes to studying the loss landscape and optimization dynamics in deep learning, as well as designing measures of generalization, second-order learning algorithms, etc. Prior works have focused on empirical results or pursued a theoretical treatment under overly simplified settings. In this work, we derive the eigenvalues of the Hessian of linear networks with arbitrary widths and depths, and datasets with an arbitrary number of samples, features, and labels. Importantly, for classification tasks with MSE loss, we identify that the sharpness of the solution is directly related to the maximum proportion of samples belonging to any class. We empirically validate our predictions and systematically analyze the effects of shedding the impractical assumptions one at a time, as well as incorporating nonlinearities. We observe that our predictions are considerably robust in most cases, allowing us to extend our conclusions to more practical learning setups.
- Abstract(参考訳): ヘッセン行列は、深層学習における損失ランドスケープと最適化ダイナミクスの研究、一般化や二階学習アルゴリズムなどの設計方法に関して、重要な関心事である。
以前の研究は経験的な結果に焦点を当てたり、過度に単純化された設定の下で理論的な治療を追求していた。
本研究では,任意の幅と深さを持つ線形ネットワークの Hessian の固有値と,任意の数のサンプル,特徴,ラベルを持つデータセットを導出する。
重要なことは、MSE損失を伴う分類タスクにおいて、解の鋭さが任意のクラスに属するサンプルの最大割合と直接関係していることを明らかにすることである。
我々は,我々の予測を実証的に検証し,非現実的仮定を1回ずつ隠蔽する効果を系統的に分析し,非線形性を取り入れた。
ほとんどの場合、予測は極めて堅牢であり、より実践的な学習環境に結論を拡張できると考えています。
関連論文リスト
- A Theory of How Pretraining Shapes Inductive Bias in Fine-Tuning [51.505728136705564]
我々は, 対角線ネットワークにおけるプレトレーニングファインチューニングパイプラインの解析理論を開発した。
異なる初期化選択により、ネットワークは4つの異なる微調整レジームに分類される。
以前の階層の縮小により、ネットワークは機能の再利用と洗練を両立することができ、より優れた一般化を実現している。
論文 参考訳(メタデータ) (2026-02-23T17:19:33Z) - A Differentiable Adversarial Framework for Task-Aware Data Subsampling [0.5371337604556311]
本稿では,データ削減を識別可能なエンドツーエンド学習問題に再構成する新しいパラダイムとして,ASSS(Antagonistic soft selection subsampling)フレームワークを紹介する。
この研究は、学習可能なコンポーネントとしてタスク認識データサブサンプリングを確立し、大規模なデータ学習を効果的に行うための原則的なソリューションを提供する。
論文 参考訳(メタデータ) (2026-01-05T13:10:09Z) - In-Context Linear Regression Demystified: Training Dynamics and Mechanistic Interpretability of Multi-Head Softmax Attention [52.159541540613915]
本研究では,マルチヘッド型ソフトマックスアテンションモデルを用いて,線形データを用いたコンテキスト内学習を行う方法について検討する。
この結果から,学習内容の学習能力は,そのアーキテクチャと基礎となるデータ分布の集約的効果として,訓練されたトランスフォーマーから出現することが明らかとなった。
論文 参考訳(メタデータ) (2025-03-17T02:00:49Z) - Understanding Forgetting in Continual Learning with Linear Regression [21.8755265936716]
連続的な学習は、複数のタスクを逐次学習することに焦点を当てており、近年大きな注目を集めている。
線形回帰モデルにおいて, 線形回帰モデルをグラディエント・ディッセンス(Gradient Descent)を用いて, 忘れることの一般的な理論的解析を行う。
十分なデータサイズを考慮に入れれば、集団データ共分散行列の固有値が大きいタスクが後で訓練されるようなシーケンス内のタスクの配置は、忘れが増す傾向にあることを実証する。
論文 参考訳(メタデータ) (2024-05-27T18:33:37Z) - Restoring balance: principled under/oversampling of data for optimal classification [0.0]
実世界のデータのクラス不均衡は、機械学習タスクに共通のボトルネックをもたらす。
データのアンダーやオーバーサンプリングといった緩和戦略は、定期的に提案され、実証的にテストされる。
我々は、クラス不均衡、データの第1、第2モーメント、考慮されたパフォーマンスの指標に依存するアンダー/オーバーサンプリング戦略の効果を鋭く予測する。
論文 参考訳(メタデータ) (2024-05-15T17:45:34Z) - On the Trade-off of Intra-/Inter-class Diversity for Supervised
Pre-training [72.8087629914444]
教師付き事前学習データセットのクラス内多様性(クラス毎のサンプル数)とクラス間多様性(クラス数)とのトレードオフの影響について検討した。
トレーニング前のデータセットのサイズが固定された場合、最高のダウンストリームのパフォーマンスは、クラス内/クラス間の多様性のバランスがとれる。
論文 参考訳(メタデータ) (2023-05-20T16:23:50Z) - Uncertainty Estimation by Fisher Information-based Evidential Deep
Learning [61.94125052118442]
不確実性推定は、ディープラーニングを実用アプリケーションで信頼できるものにする鍵となる要素である。
漁業情報に基づくエビデンシャルディープラーニング(mathcalI$-EDL)を提案する。
特に,各サンプルが有する証拠の情報量を測定するためにFisher Information Matrix (FIM)を導入し,目的的損失項を動的に重み付けし,不確実なクラスの表現学習に集中させる。
論文 参考訳(メタデータ) (2023-03-03T16:12:59Z) - Improved Fine-tuning by Leveraging Pre-training Data: Theory and
Practice [52.11183787786718]
対象データに事前学習されたモデルを微調整することは、多くのディープラーニングアプリケーションで広く利用されている。
近年の研究では、スクラッチからのトレーニングが、この事前トレーニング戦略に比較して、最終的なパフォーマンスを示すことが実証されている。
本稿では,対象タスクの一般化を改善するために,事前学習データからサブセットを選択する新しい選択戦略を提案する。
論文 参考訳(メタデータ) (2021-11-24T06:18:32Z) - Measuring Generalization with Optimal Transport [111.29415509046886]
我々は、マージンを最適輸送コストで正規化する、マージンベースの一般化境界を開発する。
我々の境界は、大規模データセット上でトレーニングデータとネットワークパラメータを与えられた一般化誤差を強く予測する。
論文 参考訳(メタデータ) (2021-06-07T03:04:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。