論文の概要: Non-asymptotic Convergence of Stochastic Gradient Descent in Score-based Generative Models
- arxiv url: http://arxiv.org/abs/2607.04775v1
- Date: Mon, 06 Jul 2026 08:07:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.08347
- Title: Non-asymptotic Convergence of Stochastic Gradient Descent in Score-based Generative Models
- Title(参考訳): スコアベース生成モデルにおける確率勾配の非漸近収束
- Abstract要約: スコアベースの生成モデル(SGM)は、幅広いアプリケーションにわたるデータ生成において印象的なパフォーマンスを実現している。
これらのモデルは通常、微分目標を最小化することで訓練されるが、勾配による最適化保証は限定的のままである。
- 参考スコア(独自算出の注目度): 5.501082429793833
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Score-based Generative Models (SGMs) have achieved impressive performance in data generation across a wide range of applications. While the statistical properties of their sampling procedures are increasingly well understood, the optimization dynamics underlying their training remain less explored. SGMs are typically trained by minimizing a weighted denoising scorematching objective, yet optimization guarantees with stochastic gradients remain limited. In this work, we study Stochastic Gradient Descent (SGD) for SGMs, contributing results in two complementary regimes. First, for general score parameterizations, we establish a non-convex convergence rate for SGD on the weighted denoising score-matching objective, with explicit dependence on the schedule-dependent weighting factors. Second, for overparameterized two-layer ReLU networks, we develop a Neural Tangent Kernel analysis tailored to diffusion training with stochastic gradients, yielding score-approximation error bounds along the SGD trajectory. Finally, our analysis quantifies the role of the reweighting factor in the score approximation error, providing theoretical guidance for weighting choices used in practice.
- Abstract(参考訳): スコアベースの生成モデル(SGM)は、幅広いアプリケーションにわたるデータ生成において印象的なパフォーマンスを実現している。
サンプリング手順の統計的性質はますますよく理解されているが、トレーニングの基礎となる最適化のダイナミクスはいまだ研究されていない。
SGMは通常、重み付けされたデノゲーションスコアマッチングの目標を最小化することで訓練されるが、確率勾配による最適化保証は限定的のままである。
本研究では,SGMに対するSGD(Stochastic Gradient Descent)について検討し,2つの相補的体制に寄与した。
まず、一般的なスコアパラメータ化のために、スケジュール依存重み付け因子に明示的に依存した重み付きDenoisingスコアマッチング目的に基づいて、SGDの非凸収束率を確立する。
第2に、過パラメータ化された2層ReLUネットワークに対して、確率勾配による拡散訓練に適したニューラルタンジェントカーネル解析を開発し、SGD軌道に沿ってスコア近似誤差境界を求める。
最後に, スコア近似誤差における再重み付け因子の役割を定量化し, 実際に用いられる選択の重み付けに関する理論的ガイダンスを提供する。
関連論文リスト
- The Role of Gradient Modification in Heavy-Tailed Nonconvex Stochastic Min-Max Optimization [50.59470683896735]
min-max最適化は、現代の機械学習に応用されているため、注目を集めている。
我々は、勾配降下(SGDA)の包括的理論を提供する。
我々は,Stoc-GDAMとStoc-TRmaxという新たなクリッピングフリーアルゴリズムを開発し,グラディエントクリッピングを使わずに,目標精度への最適依存を実現する。
論文 参考訳(メタデータ) (2026-09-05T12:49:28Z) - Stochastic Gradient Optimization with Model-Assisted Sampling [0.0]
本稿では, サーベイサンプリング理論を用いて, ミニバッチ勾配を解釈するモデル支援サンプリングフレームワークを提案する。
本研究の目的は,機械学習の最適化とサンプリング理論の橋渡しであり,サンプルベース推定と分散低減を両立させることである。
論文 参考訳(メタデータ) (2026-06-25T15:39:19Z) - Stein-Rule Shrinkage for Stochastic Gradient Estimation in High Dimensions [0.0]
勾配法は大規模学習の中心であるが、古典的決定理論が高次元において許容できないことを示す非バイアス推定器としてミニバッチ勾配を扱う。
本稿では, 歴史運動量から導かれる安定な推定器に対して, ミニバッチ勾配を適応的に調整する勾配推定器を構築する。
CIFAR10とCIFAR100の実験的評価は、大型バッチ方式におけるAdamよりも一貫した改善を示した。
論文 参考訳(メタデータ) (2026-02-02T08:01:13Z) - A Bootstrap Perspective on Stochastic Gradient Descent [3.6449336503217786]
Emphstochastic gradient descent(SGD)で訓練された機械学習モデルは、決定論的勾配降下(GD)で訓練されたモデルよりも一般化できる
論文 参考訳(メタデータ) (2025-12-08T16:10:56Z) - On the Optimal Construction of Unbiased Gradient Estimators for Zeroth-Order Optimization [57.179679246370114]
既存の手法の潜在的な制限は、ステップサイズが提案されない限り、ほとんどの摂動推定器に固有のバイアスである。
本稿では, 良好な構成を維持しつつ, バイアスを排除した非バイアス勾配スケーリング推定器のファミリーを提案する。
論文 参考訳(メタデータ) (2025-10-22T18:25:43Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - Self-Boost via Optimal Retraining: An Analysis via Approximate Message Passing [58.52119063742121]
独自の予測と潜在的にノイズの多いラベルを使ってモデルをトレーニングすることは、モデルパフォーマンスを改善するためのよく知られた戦略である。
本稿では,モデルの予測と提供ラベルを最適に組み合わせる方法について論じる。
我々の主な貢献は、現在のモデルの予測と与えられたラベルを組み合わせたベイズ最適集約関数の導出である。
論文 参考訳(メタデータ) (2025-05-21T07:16:44Z) - Gradient Normalization Provably Benefits Nonconvex SGD under Heavy-Tailed Noise [60.92029979853314]
重み付き雑音下でのグラディエントDescence(SGD)の収束を確実にする上での勾配正規化とクリッピングの役割について検討する。
我々の研究は、重尾雑音下でのSGDの勾配正規化の利点を示す最初の理論的証拠を提供する。
我々は、勾配正規化とクリッピングを取り入れた加速SGD変種を導入し、さらに重み付き雑音下での収束率を高めた。
論文 参考訳(メタデータ) (2024-10-21T22:40:42Z) - Non-asymptotic Analysis of Biased Adaptive Stochastic Approximation [3.328448170090945]
適応的なステップを持つグラディエントDescent(SGD)は、ディープニューラルネットワークと生成モデルのトレーニングに広く使用されている。
本稿では,勾配関数に対するバイアスの影響を包括的に分析する。
論文 参考訳(メタデータ) (2024-02-05T10:17:36Z) - NAG-GS: Semi-Implicit, Accelerated and Robust Stochastic Optimizer [45.47667026025716]
2つの重要な要素に依存した、新しく、堅牢で、加速された反復を提案する。
NAG-GSと呼ばれる手法の収束と安定性は、まず広範に研究されている。
我々は、NAG-arityが、重量減衰を伴う運動量SGDや機械学習モデルのトレーニングのためのAdamWといった最先端の手法と競合していることを示す。
論文 参考訳(メタデータ) (2022-09-29T16:54:53Z) - Stability and Generalization Analysis of Gradient Methods for Shallow
Neural Networks [59.142826407441106]
本稿では,アルゴリズム安定性の概念を活用して,浅層ニューラルネットワーク(SNN)の一般化挙動について検討する。
我々は、SNNを訓練するために勾配降下(GD)と勾配降下(SGD)を考慮する。
論文 参考訳(メタデータ) (2022-09-19T18:48:00Z) - On the Double Descent of Random Features Models Trained with SGD [78.0918823643911]
勾配降下(SGD)により最適化された高次元におけるランダム特徴(RF)回帰特性について検討する。
本研究では, RF回帰の高精度な非漸近誤差境界を, 定常および適応的なステップサイズSGD設定の下で導出する。
理論的にも経験的にも二重降下現象を観察する。
論文 参考訳(メタデータ) (2021-10-13T17:47:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。