論文の概要: A Data-dependent Early Stopping Rule using Rademacher Complexity with L1-norm
- arxiv url: http://arxiv.org/abs/2608.24210v1
- Date: Tue, 25 Aug 2026 08:19:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.866845
- Title: A Data-dependent Early Stopping Rule using Rademacher Complexity with L1-norm
- Title(参考訳): L1-normを用いたラデマッハ複雑度を用いたデータ依存型早期停止規則
- Abstract要約: トレーニングニューラルネットワークは、トレーニングデータの適合と、目に見えない入力に対する堅牢なパフォーマンスとのトレードオフのバランスを必要とする。
既存のアプローチは通常、一般化誤差を数値的に推定し、勾配降下訓練と早期停止戦略を必要とする。
トレーニングを必要とせずに早期停止の最適時間を推定する分析フレームワークを導入する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training neural networks requires balancing the trade-off between fitting the training data and achieving robust performance on unseen inputs. This ability, commonly referred to as generalizability, is determined by the gap between the empirical risk on the training set (``empirical loss'') and the expected risk over the data distribution (``generalization error''). Existing approaches typically estimate the generalization error numerically, requiring gradient descent training and an ``early stopping'' strategy. In this work, we introduce an analytic framework that estimates the optimal time of early stopping without the need for training. Several works in the literature also give such analytical estimations, but they are generally based on random matrix theory and often make assumptions on the distribution of the data or the eigenvalue distribution of the covariance matrix. In contrast, our work is based on Rademacher complexity (RC) without needing such probabilistic assumptions. For both theoretical and numerical reasons, it is more relevant to express RC with the L1- norm rather than with the L2-norm. We focus on the case of linear models and the problem of linear regression. Thanks to the ``linear probing'' method, our results can, however, be successfully applied to nonlinear neural networks, as illustrated in the classification MNIST example.
- Abstract(参考訳): トレーニングニューラルネットワークは、トレーニングデータの適合と、目に見えない入力に対する堅牢なパフォーマンスとのトレードオフのバランスを必要とする。
この能力は一般に一般化可能性と呼ばれ、トレーニングセット上の経験的リスク(`empirical loss'')とデータ分散に対する期待されるリスク(`` Generalization error'')のギャップによって決定される。
既存のアプローチでは、一般化誤差を数値的に推定し、勾配降下訓練と '早期停止' 戦略を必要とする。
本研究では,学習を必要とせずに早期停止の最適時間を推定する分析フレームワークを提案する。
文献におけるいくつかの研究は、そのような分析的推定も与えているが、それらは概してランダム行列理論に基づいており、しばしばデータの分布や共分散行列の固有値分布について仮定する。
対照的に、我々の研究は、そのような確率論的仮定を必要とせず、Radecher complexity(RC)に基づいている。
理論的および数値的な理由から、L2ノルムよりもL1ノルムでRCを表現することが重要となる。
線形モデルの場合と線形回帰の問題に焦点を当てる。
しかし、'linear probing' 法により、MNIST の分類例に示すように、非線形ニューラルネットワークにうまく適用することができる。
関連論文リスト
- Risk and cross validation in ridge regression with correlated samples [72.59731158970894]
我々は,データポイントが任意の相関関係を持つ場合,リッジ回帰のイン・オブ・サンプルリスクのトレーニング例を提供する。
この設定では、一般化されたクロスバリデーション推定器(GCV)がサンプル外リスクを正確に予測できないことを示す。
さらに、テストポイントがトレーニングセットと非自明な相関を持つ場合、時系列予測でしばしば発生する設定にまで分析を拡張します。
論文 参考訳(メタデータ) (2024-08-08T17:27:29Z) - A Statistical Theory of Regularization-Based Continual Learning [10.899175512941053]
線形回帰タスクの順序に基づく正規化に基づく連続学習の統計的解析を行う。
まず、全てのデータが同時に利用可能であるかのように得られたオラクル推定器の収束率を導出する。
理論解析の副産物は、早期停止と一般化された$ell$-regularizationの等価性である。
論文 参考訳(メタデータ) (2024-06-10T12:25:13Z) - Toward Theoretical Guidance for Two Common Questions in Practical
Cross-Validation based Hyperparameter Selection [72.76113104079678]
クロスバリデーションに基づくハイパーパラメータ選択における2つの一般的な質問に対する最初の理論的治療について述べる。
これらの一般化は、少なくとも、常に再トレーニングを行うか、再トレーニングを行わないかを常に実行可能であることを示す。
論文 参考訳(メタデータ) (2023-01-12T16:37:12Z) - Instance-Dependent Generalization Bounds via Optimal Transport [51.71650746285469]
既存の一般化境界は、現代のニューラルネットワークの一般化を促進する重要な要因を説明することができない。
データ空間における学習予測関数の局所リプシッツ正則性に依存するインスタンス依存の一般化境界を導出する。
ニューラルネットワークに対する一般化境界を実験的に解析し、有界値が有意義であることを示し、トレーニング中の一般的な正規化方法の効果を捉える。
論文 参考訳(メタデータ) (2022-11-02T16:39:42Z) - Towards Data-Algorithm Dependent Generalization: a Case Study on
Overparameterized Linear Regression [19.047997113063147]
本稿では,データ依存学習軌跡全体の一般化挙動を考察したデータ-アルゴリズム整合性の概念を提案する。
我々は、データ依存軌道解析を行い、そのような環境での互換性に十分な条件を導出する。
論文 参考訳(メタデータ) (2022-02-12T12:42:36Z) - Learning to Estimate Without Bias [57.82628598276623]
ガウスの定理は、重み付き最小二乗推定器は線形モデルにおける線形最小分散アンバイアスド推定(MVUE)であると述べている。
本稿では、バイアス制約のあるディープラーニングを用いて、この結果を非線形設定に拡張する第一歩を踏み出す。
BCEの第二の動機は、同じ未知の複数の推定値が平均化されてパフォーマンスが向上するアプリケーションにおいてである。
論文 参考訳(メタデータ) (2021-10-24T10:23:51Z) - Imputation-Free Learning from Incomplete Observations [73.15386629370111]
本稿では,不備な値を含む入力からの推論をインプットなしでトレーニングするIGSGD法の重要性について紹介する。
バックプロパゲーションによるモデルのトレーニングに使用する勾配の調整には強化学習(RL)を用いる。
我々の計算自由予測は、最先端の計算手法を用いて従来の2段階の計算自由予測よりも優れている。
論文 参考訳(メタデータ) (2021-07-05T12:44:39Z) - Implicit Bias of Linear RNNs [27.41989861342218]
リニアリカレントニューラルネットワーク(RNN)は、長期記憶を必要とするタスクではうまく機能しない。
本稿では,線形RNNの特殊な場合において,この性質を厳密に説明する。
近年開発されたカーネル構造解析を用いて,線形RNNは特定の重み付き1次元畳み込みネットワークと機能的に等価であることを示す。
論文 参考訳(メタデータ) (2021-01-19T19:39:28Z) - Binary Classification of Gaussian Mixtures: Abundance of Support
Vectors, Benign Overfitting and Regularization [39.35822033674126]
生成ガウス混合モデルに基づく二項線形分類について検討する。
後者の分類誤差に関する新しい非漸近境界を導出する。
この結果は, 確率が一定である雑音モデルに拡張される。
論文 参考訳(メタデータ) (2020-11-18T07:59:55Z) - Theoretical Analysis of Self-Training with Deep Networks on Unlabeled
Data [48.4779912667317]
自己学習アルゴリズムは、ニューラルネットワークを使ってラベルのないデータで学ぶことに成功している。
この研究は、半教師なし学習、教師なしドメイン適応、教師なし学習のための深層ネットワークによる自己学習の統一的理論的解析を提供する。
論文 参考訳(メタデータ) (2020-10-07T19:43:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。