論文の概要: Spectral Prior for Reducing Exposure Bias in Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.22091v1
- Date: Fri, 24 Jul 2026 08:37:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.085659
- Title: Spectral Prior for Reducing Exposure Bias in Diffusion Models
- Title(参考訳): 拡散モデルにおける露光バイアス低減のためのスペクトル優先法
- Abstract要約: 本稿では,中間予測のパワースペクトルを事前計算に校正する,軽量なガイダンスに基づく手法を提案する。
提案手法は,(1)訓練データからのパラメトリックスペクトルモデルのオフライン適用,(2)効率的なFFT勾配による露出推定の2段階からなる。
- 参考スコア(独自算出の注目度): 37.66268273278838
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Diffusion models typically suffer from error accumulation during iterative sampling, commonly referred to as exposure bias. We reveal systematic frequency-dependent discrepancies between training and inference, which can be interpreted as frequency-dependent SNR error. Crucially, the direction of this mismatch varies across models and timesteps, indicating that fixed correction rules do not generalize. We propose Spectral Alignment (SPA), a lightweight, guidance-based method that calibrates the power spectrum of intermediate predictions to a pre-computed prior. Our approach consists of two stages: (1) offline fitting of a parametric spectrum model from training data, and (2) inference-time guidance via efficient FFT-based gradient computation. SPA introduces minimal computational overhead (3-4\%) and is complementary to Classifier-Free Guidance (CFG). We demonstrate consistent improvements across diverse architectures, from pixel-space models (DDPM, ADM) to latent diffusion models (SD2.0, SDXL) and flow-matching models (SD3.5, FLUX). Our implementation is available at https://github.com/SonyResearch/SPA.
- Abstract(参考訳): 拡散モデルは、通常、露光バイアスと呼ばれる反復サンプリング中にエラーの蓄積に悩まされる。
我々は、周波数依存SNR誤差と解釈できる、トレーニングと推論の系統的な周波数依存の相違を明らかにする。
重要なことに、このミスマッチの方向はモデルやタイムステップによって異なり、固定された修正規則が一般化しないことを示している。
本稿では、中間予測のパワースペクトルを事前計算した前者に校正する軽量なガイダンスベース手法であるスペクトルアライメント(SPA)を提案する。
提案手法は,(1)訓練データからのパラメトリックスペクトルモデルのオフライン適用,(2)FFTに基づく効率的な勾配計算による推論時間誘導の2段階からなる。
SPAは最小の計算オーバーヘッド(3-4\%)を導入し、CFG(Classifier-Free Guidance)を補完する。
我々は,画素空間モデル (DDPM, ADM) から潜時拡散モデル (SD2.0, SDXL) ,フローマッチングモデル (SD3.5, FLUX) まで,様々なアーキテクチャで一貫した改善を実証する。
私たちの実装はhttps://github.com/SonyResearch/SPAで公開されています。
関連論文リスト
- You Only Flow Once: Calibrated and Real-Time Radar Pose Estimation with Multi-Hypothesis Normalizing Flows [5.241472125982733]
レーダーポイントの雲は、しばしば複数の可視的な人間のポーズに対応し、決定論的ポーズ推定を根本的に不適切にする。
拡散に基づく代替手段は、多相分布をモデル化できるが、各分布サンプルに対してコストがかかる。
条件付きフローバックボーンを用いて,レーダ点雲からの分布をモデル化したMH-Gを提案する。
論文 参考訳(メタデータ) (2026-08-10T13:15:09Z) - Score Distillation of Flow Matching Models [67.86066177182046]
我々は、Score Identity Distillation (SiD) を事前訓練されたテキスト対画像フローマッチングモデルに拡張する。
SiDは、データフリーとデータアシストの両方の設定で、これらのモデルですぐに使える。
これは、スコア蒸留がテキストと画像のフローマッチングモデルに広く適用されるという最初の体系的な証拠を提供する。
論文 参考訳(メタデータ) (2025-09-29T17:45:48Z) - DS-Diffusion: Data Style-Guided Diffusion Model for Time-Series Generation [3.7098771725459336]
時系列生成タスクのためのデータスタイル誘導拡散モデル(DS-Diffusion)を提案する。
DS-Diffusionは、条件付きガイダンスを導入するためにフレームワーク全体をトレーニングするのを避ける。
生成されたサンプルは、それらが発するデータスタイルを明確に示すことができる。
論文 参考訳(メタデータ) (2025-09-23T03:06:39Z) - Single-Step Reconstruction-Free Anomaly Detection and Segmentation via Diffusion Models [1.1487074612765584]
リアルタイム(RADAR)における注意に基づく拡散モデルを用いた再構成不要な異常検出手法を提案する。
RADARは再構成に基づく異常検出の限界を克服する。
実世界の3Dプリント材料とMVTec-ADデータセット上でRADARを評価する。
論文 参考訳(メタデータ) (2025-08-06T18:56:08Z) - Efficient and Unbiased Sampling from Boltzmann Distributions via Variance-Tuned Diffusion Models [24.911598225979606]
VT-DIS(Variance-Tuned Diffusion Smpling)は、事前学習したスコアベース拡散モデルのステップごとのノイズ共分散に適応する軽量な手法である。
VT-DISはDW-4, LJ-13, アラニン-ジペプチドベンチマークでそれぞれ80%, 35%, 3.5%の有効試料サイズを達成している。
論文 参考訳(メタデータ) (2025-05-27T10:37:48Z) - GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly Detection [60.78684630040313]
拡散モデルは、特定のノイズを付加したテスト画像の通常の画像を再構成する傾向がある。
世界的視点から見ると、異なる異常による画像再構成の難しさは不均一である。
本稿では,非教師付き異常検出のためのグローバルかつ局所的な適応拡散モデル(GLADと略す)を提案する。
論文 参考訳(メタデータ) (2024-06-11T17:27:23Z) - One More Step: A Versatile Plug-and-Play Module for Rectifying Diffusion
Schedule Flaws and Enhancing Low-Frequency Controls [77.42510898755037]
One More Step (OMS) は、推論中に単純だが効果的なステップを付加したコンパクトネットワークである。
OMSは画像の忠実度を高め、トレーニングと推論の二分法を調和させ、元のモデルパラメータを保存する。
トレーニングが完了すると、同じ潜在ドメインを持つ様々な事前訓練された拡散モデルが同じOMSモジュールを共有することができる。
論文 参考訳(メタデータ) (2023-11-27T12:02:42Z) - Diffusion models for probabilistic programming [56.47577824219207]
拡散モデル変分推論(DMVI)は確率型プログラミング言語(PPL)における自動近似推論手法である
DMVIは実装が容易で、例えば正規化フローを用いた変分推論の欠点を伴わずに、PPLでヘイズルフリー推論が可能であり、基礎となるニューラルネットワークモデルに制約を課さない。
論文 参考訳(メタデータ) (2023-11-01T12:17:05Z) - Elucidating the Exposure Bias in Diffusion Models [7.529885833916501]
拡散モデルにおけるトレーニングとサンプリングの入力ミスマッチについて検討する。
露光バイアスを軽減するために,エプシロンスケーリング(Epsilon Scaling)と呼ばれるトレーニング不要の手法を提案する。
エプシロンスケーリングは、トレーニングフェーズで学習したベクトル場に近いサンプリング軌道を明示的に移動させる。
論文 参考訳(メタデータ) (2023-08-29T14:16:09Z) - Reflected Diffusion Models [93.26107023470979]
本稿では,データのサポートに基づいて進化する反射微分方程式を逆転する反射拡散モデルを提案する。
提案手法は,一般化されたスコアマッチング損失を用いてスコア関数を学習し,標準拡散モデルの主要成分を拡張する。
論文 参考訳(メタデータ) (2023-04-10T17:54:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。