論文の概要: When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions
- arxiv url: http://arxiv.org/abs/2607.04731v1
- Date: Mon, 06 Jul 2026 07:07:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.067046
- Title: When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions
- Title(参考訳): 高CFG拡散インバージョンはいつフェールするのか? プロンプト-ラテント相互作用の制御された研究
- Authors: Yan Zeng, Yusuke Hosoya, Huyen T. T. Tran, Takayuki Okatani,
- Abstract要約: インバージョンは、生成や編集に使用されるものよりも低い自由誘導(CFG)スケールで実行されることが多い。
このミスマッチは経験的に有用であるが、基本的な問題は未解決のままである。
制御された生成--反転--再構成設定でこの問題を考察する。
- 参考スコア(独自算出の注目度): 14.093075778060609
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-guided diffusion inversion is central to image editing, where an image is mapped to an initial latent and then edited by replaying the denoising process under a modified prompt. In practice, however, inversion is often performed with a lower classifier-free guidance(CFG) scale than the one used for generation or editing. This mismatch is empirically useful but leaves a basic question unresolved: when a target image is generated by a high-CFG trajectory, when can that trajectory actually be inverted? We study this question in a controlled generation--inversion--reconstruction setting, where the true initial latent and denoising trajectory are known. Using prompts taken from an existing diffusion-editing benchmark, we generate images under high CFG and reconstruct them with fixed-point inversion using the same prompt and guidance setting. The results reveal three types of prompt-level reconstruction behavior: easy prompts that reconstruct for most initial latents, hard prompts that fail for most initial latents, and intermediate prompts whose success depends on the prompt--latent pairing. To analyze the generation side, we define prompt pressure, a step-wise measure of how strongly CFG moves the denoising update away from the unconditional trajectory. Total pressure correlates with reconstruction quality and separates easy from hard prompts, but it does not explain the success or failure of intermediate prompt--latent pairs. Text-side analyses further show that the main visual subject and wording can change inversion difficulty. Finally, we evaluate a compact trajectory-consistency intervention that relaxes guidance only at locally unstable inverse steps. This diagnostic check improves reconstruction and Prompt-to-Prompt editing in our controlled setting, supporting the view that high-CFG inversion failure requires local, trajectory-aware analysis.
- Abstract(参考訳): テキスト誘導拡散インバージョンは画像編集の中心であり、画像は初期潜伏者にマッピングされ、修正されたプロンプトの下で復調処理を再生することによって編集される。
しかし、実際には、インバージョンは、生成や編集に使用されるものよりも低い分類器フリーガイダンス(CFG)スケールで実行されることが多い。
このミスマッチは経験的に有用だが、基本的な疑問は解決されていない: ターゲット画像が高CFG軌跡によって生成される場合、その軌跡は実際いつ逆転するのか?
制御された生成-反転-再構成設定において、真の初期潜伏軌道と復調軌道が知られている場合、この問題を考察する。
既存の拡散編集ベンチマークから抽出したプロンプトを用いて、高いCFGの下で画像を生成し、同じプロンプトとガイダンス設定を用いて固定点インバージョンで再構成する。
その結果,ほとんどの初期潜伏者に対して容易に再構成できるプロンプト,ほとんどの初期潜伏者に対して失敗するハードプロンプト,そして成功がプロンプト-潜伏ペアリングに依存する中間プロンプトの3つのタイプが明らかになった。
生成側を解析するために,非条件軌跡からデノイング更新をいかに強く移動させるかのステップワイズ尺度であるプロンプトプレッシャーを定義した。
全圧力は復元品質と相関し、ハードプロンプトと容易に分離するが、中間プロンプト-ラテントペアの成功や失敗は説明できない。
テキスト側分析により,主観的主観的主観と発話が逆の難易度を変化させる可能性が示唆された。
最後に,局所不安定な逆ステップのみにガイダンスを緩和する,コンパクトな軌道整合性介入の評価を行った。
この診断チェックは、制御された環境での再構成とPrompt-to-Prompt編集を改善し、高CFG逆転障害は局所的、トラジェクトリ・アウェア・アナリティクスを必要とするという見解をサポートする。
関連論文リスト
- Consistent-Inversion: Reverse Consistency Guidance for Structure-Preserving Visual Editing [41.38183848746174]
Consistent-Inversionは、構造保存ビジュアル編集のためのトレーニング不要の逆整合ガイダンスフレームワークである。
SD3.5プロトコルを統一したプロトコルで、ターゲット・プロンプトアライメントを維持しながら、背景および構造的忠実性を改善する。
論文 参考訳(メタデータ) (2026-06-05T11:00:12Z) - Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Next-Acceleration-Scale Prediction for Autoregressive MRI Reconstruction [52.32112533846212]
MRI再建は本質的に不完全な逆問題である。
この制限は、再構成を離散的なマルチスケールの潜在空間に移動させ、自己回帰的次加速スケールの予測として機能させることによって解決する。
提案手法は,過度のアンサンプ下での多種多様なサンプリングパターンの再構成性能の向上を図っている。
論文 参考訳(メタデータ) (2026-05-19T04:40:50Z) - Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling [12.573852448122716]
テキスト・ツー・イメージ(T2I)拡散モデルは画像合成において顕著な成功を収めているが、大規模データやオープンエコシステムへの依存は深刻なバックドアセキュリティリスクをもたらす。
既存の防御、特に入力レベルメソッドは、より実用的だが、しばしばステルスでセマンティクスを保存するトリガー設計の下で信頼性が低い観測可能な異常に頼っている。
入力レベルのバックドア検出フレームワークであるSETを提案する。これはマルチスケールの摂動下で応答オフセット機能を構築し、小さなクリーンなサンプル集合からコンパクトな良性応答空間を学習する。
論文 参考訳(メタデータ) (2026-04-14T08:31:37Z) - CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs [53.199517625701475]
CoGはDual-Process Theoryにインスパイアされたトレーニング不要のフレームワークで、直観と熟考の相互作用を模倣している。
CoGは精度と効率の両方において最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-01-16T07:27:40Z) - DCI: Dual-Conditional Inversion for Boosting Diffusion-Based Image Editing [73.12011187146481]
Diffusionモデル内のインバージョンは、実または生成された画像の潜時雑音表現を復元することを目的としている。
ほとんどの反転アプローチは、復元精度と編集の柔軟性の間の本質的にのトレードオフに悩まされている。
本稿ではDCI(Dual-Conditional Inversion)について紹介する。
論文 参考訳(メタデータ) (2025-06-03T07:46:44Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Adapt and Diffuse: Sample-adaptive Reconstruction via Latent Diffusion Models [24.5360032541275]
逆問題は、ノイズや(非線形でない)観測からクリーンな信号を回復することが目的である複数のアプリケーションで発生する。
我々のキーとなる観察は、既存の逆問題解決器のほとんどは、再構成作業の難易度に計算力を適応させる能力が欠如していることである。
オートエンコーダの潜時空間における劣化信号の劣化度を推定するために,$textitseverity encoding$という新しい手法を提案する。
論文 参考訳(メタデータ) (2023-09-12T23:41:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。