論文の概要: Correcting Guided Diffusion Trajectories with Spectral Alignment
- arxiv url: http://arxiv.org/abs/2610.02753v1
- Date: Fri, 02 Oct 2026 03:30:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.195724
- Title: Correcting Guided Diffusion Trajectories with Spectral Alignment
- Title(参考訳): スペクトルアライメントによる誘導拡散軌道の補正
- Abstract要約: 本稿では,サンプリング中の分析基準スペクトルからの偏差を補正するスペクトル補正ガイダンスを提案する。
実験では、テキスト・ツー・イメージ生成におけるベースライン誘導手法よりも好みベースの指標が一貫した向上を示し、ImageNetよりも生成品質が向上した。
- 参考スコア(独自算出の注目度): 9.67250013590007
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The practical success of conditional image generation hinges on fine-grained differences in condition alignment and visual fidelity. Classifier-free guidance (CFG) is central to this success, but its lack of an explicit criterion makes it difficult to assess whether the guided trajectory is progressing as intended. To address this gap, we show that spectral alignment provides a principled criterion for understanding guidance behavior and improving guided diffusion sampling through adaptive correction. Our analysis identifies the spectra of intermediate states as an indicator of consistency with the expected spectral evolution of the forward process. Based on this observation, we introduce Spectral Correction Guidance, a method that corrects deviations from an analytic reference spectrum during sampling. The proposed method is training-free and applicable across diffusion backbones and conditional generation tasks without modifying the underlying model. Experiments demonstrate consistent gains in preference-based metrics over baseline guidance methods in text-to-image generation and improved generation quality over CFG on ImageNet. These improvements persist across a range of guidance scales and with fewer denoising steps. Our analyses and ablations provide insight into guidance behavior and how the proposed method affects generation quality.
- Abstract(参考訳): 条件画像生成ヒンジの実用的成功は、条件アライメントと視力の微粒化の違いに影響を及ぼす。
分類器フリーガイダンス(CFG)はこの成功の中心であるが、明示的な基準の欠如は、ガイドされた軌道が意図した通りに進行しているかどうかを評価するのが困難である。
このギャップに対処するため、スペクトルアライメントは誘導行動を理解し、適応補正による誘導拡散サンプリングを改善するための原則的基準を提供することを示した。
本分析では, 中間状態のスペクトルを, 前方過程のスペクトル進化の予測値と整合性の指標として同定する。
そこで本研究では,分析基準スペクトルからの偏差を補正するスペクトル補正誘導法を提案する。
提案手法はトレーニング不要で,基礎となるモデルを変更することなく,拡散バックボーンや条件付き生成タスクに適用可能である。
実験では、テキスト・ツー・イメージ生成におけるベースライン誘導法よりも優先基準の指標が一貫した増加を示し、ImageNet上のCFGよりも品質が向上した。
これらの改善は、様々なガイダンススケールにまたがって継続し、より少ないデノイングステップを持つ。
提案手法が生成品質にどのように影響するか, 指導行動に関する知見を提供する。
関連論文リスト
- Probability-Conserving Flow Guidance [49.03107678763765]
Adaptive Manifold Guidance (AdaMaG)はリアリズムを改善し、幻覚を減らし、高誘導下での劣化を制御する。
画像生成ベンチマーク全体で、AdaMaGはリアリズムを改善し、幻覚を減らし、高誘導下での劣化を制御する。
論文 参考訳(メタデータ) (2026-05-19T16:34:01Z) - One step further with Monte-Carlo sampler to guide diffusion better [11.58337125468802]
そこで本研究では,より優れた回折イオンを得るために,後進デノイズ・イングステップとモンテカルロサンプリング(ABMS)を提案する。
我々は様々なタスク設定やデータタイプ、主に入力条件付きオンライン手書き軌跡生成に関する実験を行う。
実験により,本手法は高次サンプリング器で選択的に有効であることが示された。
論文 参考訳(メタデータ) (2026-03-04T05:48:02Z) - Improving Classifier-Free Guidance of Flow Matching via Manifold Projection [3.6087998976768128]
最適化のレンズによるCFGの原理的解釈を提供する。
CFGサンプリングを多様体制約によるホモトピー最適化として再構成する。
提案手法は, トレーニング不要かつ一貫した生成忠実度, 迅速なアライメント, ガイダンス尺度に対するロバスト性である。
論文 参考訳(メタデータ) (2026-01-29T15:49:31Z) - Enhancing Diffusion Model Guidance through Calibration and Regularization [9.22066257345387]
本稿では,この問題に対処するための2つの補完的貢献を紹介する。
まず,Smooth expected Error(Smooth ECE)に基づく微分可能なキャリブレーション目標を提案する。
第2に,再訓練を必要とせず,市販の分類器で動作可能なサンプリング誘導手法を開発した。
論文 参考訳(メタデータ) (2025-11-08T04:23:42Z) - TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling [53.61290359948953]
タンジェンシャル増幅誘導(TAG)は、下層の拡散モデルを変更することなく、軌道信号のみで動作する。
この誘導過程を1次テイラー展開を利用して定式化する。
TAGは、最小限の計算加算で拡散サンプリング忠実度を改善する、プラグアンドプレイのアーキテクチャに依存しないモジュールである。
論文 参考訳(メタデータ) (2025-10-06T06:53:29Z) - Training-Free Stein Diffusion Guidance: Posterior Correction for Sampling Beyond High-Density Regions [46.59494117137471]
自由拡散誘導の訓練は、追加の訓練なしに既成の分類器を活用する柔軟な方法を提供する。
本稿では,SOC を対象とする新たなトレーニングフリーフレームワークである Stein Diffusion Guidance (SDG) を紹介する。
分子低密度サンプリングタスクの実験は、SDGが標準のトレーニングフリーガイダンス手法を一貫して上回っていることを示唆している。
論文 参考訳(メタデータ) (2025-07-07T21:14:27Z) - How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models [57.42800112251644]
我々は、シンプルで普遍的な適応型ガイダンス戦略であるStep AGを提案する。
評価は画像品質と画像テキストアライメントの両方に焦点をあてる。
論文 参考訳(メタデータ) (2025-06-10T02:09:48Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Contrastive CFG: Improving CFG in Diffusion Models by Contrasting Positive and Negative Concepts [55.298031232672734]
As-Free Guidance (CFG) は条件拡散モデルサンプリングに有効であることが証明された。
対照的な損失を用いた負のCFG誘導を強化する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-11-26T03:29:27Z) - Characteristic Guidance: Non-linear Correction for Diffusion Model at Large Guidance Scale [0.0]
そこで本研究では,一元的非線形補正法である特徴ガイダンスを提案する。
実験により,特徴誘導は画像生成におけるプロンプトのセマンティックな特徴と不規則性を高めることが示された。
論文 参考訳(メタデータ) (2023-12-11T02:40:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。