論文の概要: Revisiting Spectral Representations in Generative Diffusion Models
- arxiv url: http://arxiv.org/abs/2609.08253v1
- Date: Tue, 08 Sep 2026 04:54:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.582365
- Title: Revisiting Spectral Representations in Generative Diffusion Models
- Title(参考訳): 生成拡散モデルにおけるスペクトル表現の再検討
- Abstract要約: 拡散モデルは多様な生成タスクにおいて顕著な性能を示した。
近年の研究では,拡散ネットワークの隠れ状態に表現アライメントを付与することで,トレーニングの収束とサンプリング品質の向上が図られている。
摂動カーネルの共有視点による自己教師付きスペクトル表現学習と拡散生成モデルの関連性について検討する。
- 参考スコア(独自算出の注目度): 98.43552218868837
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Diffusion models have shown remarkable performance on diverse generation tasks. Recent work finds that imposing representation alignment on the hidden states of diffusion networks can both facilitate training convergence and enhance sampling quality, yet the mechanism driving this synergy remains insufficiently understood. In this paper, we investigate the connection between self-supervised spectral representation learning and diffusion generative models through a shared perspective on perturbation kernels. On the diffusion side, samples (e.g., images, videos) are produced by reversing a stochastic noise-injection process specified by Gaussian kernels; on the spectral representation side, spectral embeddings emerge from contrasting positive and negative relations induced by random perturbation kernels. Motivated by this, we propose a self-supervised spectral representation alignment method to facilitate diffusion model training. In addition, we clarify how joint spectral learning can benefit diffusion training from a geometric perspective. Furthermore, we find that the optimization of the spectral alignment objective is in an equivalent form of diffusion score distillation in the representation space. Building on these findings, we integrate a spectral regularizer into diffusion training objectives to improve the performance of diffusion models on multiple datasets. Experiments across images and 3D point clouds show consistent gains in generation quality. Code is released at https://github.com/yuehaowang/spectral-reg-diffusion.
- Abstract(参考訳): 拡散モデルは多様な生成タスクにおいて顕著な性能を示した。
近年の研究では、拡散ネットワークの隠れ状態に表現アライメントを付与することで、トレーニングの収束とサンプリング品質の向上が図られているが、このシナジーを駆動するメカニズムは十分に理解されていない。
本稿では、摂動カーネルの共有視点による自己教師付きスペクトル表現学習と拡散生成モデルとの関係について検討する。
拡散側では、サンプル(例、画像、ビデオ)は、ガウス核が特定する確率的ノイズ注入過程を反転させることで生成され、スペクトル表現側では、ランダムな摂動カーネルによって誘導される正と負の関係の対比からスペクトル埋め込みが出現する。
そこで本研究では,拡散モデル学習を容易にする自己教師付きスペクトル配向法を提案する。
さらに,共同スペクトル学習が幾何学的視点から拡散訓練にどう役立つかを明らかにする。
さらに, スペクトルアライメント目標の最適化は, 表現空間における拡散スコア蒸留と等価であることがわかった。
これらの結果に基づいて、スペクトル正則化器を拡散訓練の目的に統合し、複数のデータセット上での拡散モデルの性能を向上させる。
画像と3Dポイントクラウドにわたる実験では、生成品質が一貫した向上を示している。
コードはhttps://github.com/yuehaowang/spectral-reg-diffusionで公開されている。
関連論文リスト
- Learning What Matters: Steering Diffusion via Spectrally Anisotropic Forward Noise [43.07594740645669]
Diffusion Probabilistic Models (DPM) は強力な生成性能を達成しているが、その帰納的バイアスは大半が暗黙的である。
本研究では,拡散モデルのトレーニングとサンプリングに帰納的バイアスを組み込むことにより,モデルの目的とするデータ分布をよりよく適応することを目的とする。
異方性前方共分散を周波数対角共分散に置き換えることで、これらのバイアスを形作る異方性雑音演算子を導入する。
論文 参考訳(メタデータ) (2025-10-07T16:08:39Z) - Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing [25.138589492384654]
DiffLI$2$Dという画像デハジングのための拡散遅延インスパイアネットワークを提案する。
まず、事前学習した拡散モデルのセマンティック潜時空間が、画像の内容とヘイズ特性を表現することができることを明らかにした。
異なる時間ステップでの拡散遅延表現を繊細に設計したデハジングネットワークに統合し、画像デハジングの指示を与える。
論文 参考訳(メタデータ) (2025-09-24T13:11:37Z) - Consistent Sampling and Simulation: Molecular Dynamics with Energy-Based Diffusion Models [50.77646970127369]
本稿では,Fokker-Planck由来の正規化項を用いたエネルギーベース拡散モデルを提案する。
高速折りたたみタンパク質を含む複数の生体分子系をサンプリング・シミュレートし,本手法を実証する。
論文 参考訳(メタデータ) (2025-06-20T16:38:29Z) - Merging and Splitting Diffusion Paths for Semantically Coherent Panoramas [33.334956022229846]
本稿では,Merge-Attend-Diffuse演算子を提案する。
具体的には、拡散経路をマージし、自己および横断的意図をプログラムし、集約された潜在空間で操作する。
提案手法は,生成した画像の入力プロンプトと視覚的品質との整合性を維持しつつ,セマンティック・コヒーレンスを増大させる。
論文 参考訳(メタデータ) (2024-08-28T09:22:32Z) - Theoretical Insights for Diffusion Guidance: A Case Study for Gaussian
Mixture Models [59.331993845831946]
拡散モデルは、所望の特性に向けてサンプル生成を操るために、スコア関数にタスク固有の情報を注入することの恩恵を受ける。
本稿では,ガウス混合モデルの文脈における拡散モデルに対する誘導の影響を理解するための最初の理論的研究を提供する。
論文 参考訳(メタデータ) (2024-03-03T23:15:48Z) - Guided Diffusion from Self-Supervised Diffusion Features [49.78673164423208]
ガイダンスは拡散モデルにおいて重要な概念として機能するが、その効果は追加のデータアノテーションや事前学習の必要性によって制限されることが多い。
本稿では,拡散モデルからガイダンスを抽出するフレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-14T11:19:11Z) - Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction [60.52716381465063]
我々は,限られた入力画像のみを用いて,スパースビュー再構成を改善するために,Deceptive-NeRF/3DGSを導入した。
具体的には,少数視点再構成によるノイズ画像から高品質な擬似観測へ変換する,偽拡散モデルを提案する。
本システムでは,拡散生成擬似観測をトレーニング画像集合に徐々に組み込んで,スパース入力観測を5倍から10倍に高めている。
論文 参考訳(メタデータ) (2023-05-24T14:00:32Z) - DiffUCD:Unsupervised Hyperspectral Image Change Detection with Semantic
Correlation Diffusion Model [46.68717345017946]
ハイパースペクトル画像変化検出(HSI-CD)はリモートセンシングにおいて重要な研究領域となっている。
意味相関拡散モデル(DiffUCD)を用いた新しい教師なしHSI-CDを提案する。
提案手法は,多数のサンプルを必要とする完全教師付き手法に匹敵する結果が得られる。
論文 参考訳(メタデータ) (2023-05-21T09:21:41Z) - Unifying Diffusion Models' Latent Space, with Applications to
CycleDiffusion and Guidance [95.12230117950232]
関係領域で独立に訓練された2つの拡散モデルから共通潜時空間が現れることを示す。
テキスト・画像拡散モデルにCycleDiffusionを適用することで、大規模なテキスト・画像拡散モデルがゼロショット画像・画像拡散エディタとして使用できることを示す。
論文 参考訳(メタデータ) (2022-10-11T15:53:52Z) - Diffusion-GAN: Training GANs with Diffusion [135.24433011977874]
GAN(Generative Adversarial Network)は、安定してトレーニングすることが難しい。
フォワード拡散チェーンを利用してインスタンスノイズを生成する新しいGANフレームワークであるDiffusion-GANを提案する。
我々は,Diffusion-GANにより,最先端のGANよりも高い安定性とデータ効率で,よりリアルな画像を生成することができることを示す。
論文 参考訳(メタデータ) (2022-06-05T20:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。