論文の概要: Benign Overfitting Does Not Occur in Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.02671v1
- Date: Thu, 02 Jul 2026 18:05:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.385714
- Title: Benign Overfitting Does Not Occur in Diffusion Models
- Title(参考訳): 境界オーバーフィッティングは拡散モデルでは発生しない
- Authors: Tyler Farghly, Benjamin Dupuis, Alain Durmus, Umut Simsekli,
- Abstract要約: 拡散モデルは標準的なディープラーニングの機械の多くを共有している。
データ次元に比例してサンプルサイズが指数関数的に増加しない限り、オーバーフィットと良い一般化は同時には起こらないことを示す。
このような過度な適合を防ぐメカニズムとして,スコアの時間平滑化とトレーニング中の早期停止から生じる暗黙の正則化を同定した。
- 参考スコア(独自算出の注目度): 33.8340803958907
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benign overfitting and double descent have come to shape our understanding of generalization in deep learning, establishing that overfitting is not only compatible with good generalization but can actively benefit it. Diffusion models share much of the machinery of standard deep learning, so it is natural to assume that they also exhibit these properties. In this work, we show that this assumption is largely incorrect. We first establish fundamental impossibility results showing that, unless the sample size grows exponentially with the data dimension, overfitting and good generalization cannot occur simultaneously. Consequently, the population loss follows a classical U-shaped curve in model complexity rather than exhibiting double descent. Analyzing a simplified setting, we identify a key difference between regression and score matching: regression benefits from an alignment between the target and the empirical covariance; score matching admits no such alignment, leaving overfitting irreparably harmful. We further identify implicit regularization stemming from time-smoothness of the score and early stopping during training as mechanisms that prevent such overfitting and verify our findings with high-dimensional image generation experiments. Our results reveal that generalization in diffusion models is governed by mechanisms distinct from those of traditional regression, motivating the development of new theory.
- Abstract(参考訳): 良性過剰適合と二重降下は、深層学習における一般化に対する私たちの理解を形作るようになり、過剰適合は良質な一般化と互換性があるだけでなく、その恩恵を積極的に得ることが証明された。
拡散モデルは標準的な深層学習の機械の多くを共有しているため、それらがそれらの性質も示していると仮定するのは当然である。
本研究では,この仮定が大半が誤りであることを示す。
まず, サンプルサイズがデータ次元と指数関数的に大きくなる限り, 過度に適合し, 優れた一般化が同時に起こらないことを示す。
その結果、人口減少は二重降下を示すのではなく、モデル複雑性の古典的なU字型曲線に従う。
簡易な設定を解析することにより、回帰とスコアマッチングの主な違いを識別する: 回帰は目標と経験的共分散の整合性から恩恵を受ける; スコアマッチングはそのような整合性を認めず、過剰適合は不可分に有害である。
さらに,高次元画像生成実験により,スコアの時間平滑化やトレーニングの早期停止から生じる暗黙の正則化を,そのような過度な適合を防止するメカニズムとして同定し,その妥当性を検証した。
この結果から,拡散モデルにおける一般化は,従来の回帰モデルとは異なる機構によって制御され,新たな理論の発展を動機付けていることが明らかとなった。
関連論文リスト
- Evaluating Double Descent in Machine Learning: Insights from Tree-Based Models Applied to a Genomic Prediction Task [0.0]
最近の研究は、いわゆる二重降下現象のしきい値上昇を超えて、テストエラーの第2降下の概念を導入している。
二重降着は、2つの軸をまたいだ複雑さが共同でスケールする場合にのみ、一貫して現れることを示す。
本研究は,一般化行動の解析において,モデル複雑性を多次元構造として扱うことの重要性を強調した。
論文 参考訳(メタデータ) (2025-09-22T16:41:31Z) - A Classical View on Benign Overfitting: The Role of Sample Size [14.36840959836957]
モデルは任意に小さなトレーニングとテストエラーの両方を同時に達成する。
この振舞いはニューラルネットワークの特徴であり、しばしば低い(しかしゼロではない)トレーニングエラーを達成するが、それでもよく一般化される。
論文 参考訳(メタデータ) (2025-05-16T18:37:51Z) - On the Benefits of Over-parameterization for Out-of-Distribution Generalization [28.961538657831788]
本稿では,過度なオーバーフィット条件下でのアウト・オブ・ディストリビューション(OOD)損失を考慮した機械学習モデルの性能について検討する。
モデルパラメータ化のさらなる増大はOOD損失を著しく減少させることを示した。
これらの知見は、モデルアンサンブルによるOOD一般化の実証的な現象を説明する。
論文 参考訳(メタデータ) (2024-03-26T11:01:53Z) - A U-turn on Double Descent: Rethinking Parameter Counting in Statistical
Learning [68.76846801719095]
二重降下がいつどこで起こるのかを正確に示し、その位置が本質的に閾値 p=n に結び付けられていないことを示す。
これは二重降下と統計的直観の間の緊張を解消する。
論文 参考訳(メタデータ) (2023-10-29T12:05:39Z) - Nonparametric Identifiability of Causal Representations from Unknown
Interventions [63.1354734978244]
本研究では, 因果表現学習, 潜伏因果変数を推定するタスク, およびそれらの変数の混合から因果関係を考察する。
我々のゴールは、根底にある真理潜入者とその因果グラフの両方を、介入データから解決不可能なあいまいさの集合まで識別することである。
論文 参考訳(メタデータ) (2023-06-01T10:51:58Z) - Bias in Pruned Vision Models: In-Depth Analysis and Countermeasures [93.17009514112702]
ニューラルネットワークのパラメータのかなりの部分集合をゼロに設定するプルーニングは、モデル圧縮の最も一般的な方法の1つである。
この現象の既存の証拠にもかかわらず、ニューラルネットワークのプルーニングと誘導バイアスの関係はよく理解されていない。
論文 参考訳(メタデータ) (2023-04-25T07:42:06Z) - Monotonicity and Double Descent in Uncertainty Estimation with Gaussian
Processes [52.92110730286403]
限界確率はクロスバリデーションの指標を思い起こさせるべきであり、どちらもより大きな入力次元で劣化すべきである、と一般的に信じられている。
我々は,ハイパーパラメータをチューニングすることにより,入力次元と単調に改善できることを証明した。
また、クロスバリデーションの指標は、二重降下の特徴である質的に異なる挙動を示すことも証明した。
論文 参考訳(メタデータ) (2022-10-14T08:09:33Z) - Ensembling over Classifiers: a Bias-Variance Perspective [13.006468721874372]
Pfau (2013) による偏差分解の拡張の上に構築し, 分類器のアンサンブルの挙動に関する重要な知見を得る。
条件付き推定は必然的に既約誤差を生じさせることを示す。
経験的に、標準的なアンサンブルはバイアスを減少させ、この予期せぬ減少のために、分類器のアンサンブルがうまく機能するかもしれないという仮説を立てる。
論文 参考訳(メタデータ) (2022-06-21T17:46:35Z) - Interpolation can hurt robust generalization even when there is no noise [76.3492338989419]
リッジの正規化による一般化の回避は,ノイズがなくても大幅に一般化できることを示す。
この現象は線形回帰と分類の両方のロバストなリスクを証明し、したがってロバストなオーバーフィッティングに関する最初の理論的結果を与える。
論文 参考訳(メタデータ) (2021-08-05T23:04:15Z) - Understanding Double Descent Requires a Fine-Grained Bias-Variance
Decomposition [34.235007566913396]
ラベルに関連付けられた用語への分散の解釈可能で対称的な分解について述べる。
バイアスはネットワーク幅とともに単調に減少するが、分散項は非単調な振る舞いを示す。
我々はまた、著しく豊かな現象論も分析する。
論文 参考訳(メタデータ) (2020-11-04T21:04:02Z) - Good Classifiers are Abundant in the Interpolating Regime [64.72044662855612]
補間分類器間のテストエラーの完全な分布を正確に計算する手法を開発した。
テストエラーは、最悪の補間モデルのテストエラーから大きく逸脱する、小さな典型的な$varepsilon*$に集中する傾向にある。
以上の結果から,統計的学習理論における通常の解析手法は,実際に観測された優れた一般化性能を捉えるのに十分な粒度にはならない可能性が示唆された。
論文 参考訳(メタデータ) (2020-06-22T21:12:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。