論文の概要: Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives
- arxiv url: http://arxiv.org/abs/2607.26735v1
- Date: Wed, 29 Jul 2026 10:29:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.62606
- Title: Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives
- Title(参考訳): テキスト・画像拡散モデルのデュアルインバージョン:プロンプトとノイズの両面から
- Authors: Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo,
- Abstract要約: 目的画像の意味的プロンプトと潜時雑音を回復する2段階の手法であるDualinを提案する。
第一段階では、視覚言語モデル、CLIP、大型言語モデルを統合し、忠実で人間解釈可能なハードプロンプトを反転させる。
第2段階では、非条件DDIMインバージョンは、対象画像の正確な潜時ノイズを再構成し、構造情報レベルでの整合性を保証する。
- 参考スコア(独自算出の注目度): 24.71740058679873
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prompt inversion, as a typical reverse engineering technique, enables text-to-image (T2I) diffusion models to generate the desired target images without extensive prompt engineering. However, existing prompt inversion methods suffer from significant limitations: (1) gradient-based methods are unstable and uninterpretable, often resulting in generated images with severe artifacts; (2) gradient-free methods yield human-readable prompts but still fail to preserve visual fidelity due to the lack of fine-grained detail alignment. We contend that the limitations stem from treating prompt inversion as a sufficient condition for reverse engineering, ignoring the critical role of the latent noise that encodes structural information. Consequently, we propose Dualin (Dual inversion), a two-stage method that jointly recovers both the semantic prompt and latent noise of the target image. In the first stage, we integrate vision-language model, CLIP and large language model to invert a faithful, human-interpretable hard prompt. In the second stage, unconditional DDIM inversion reconstructs the exact latent noise of the target image, guaranteeing the consistency at the structural information level. Theoretically, we prove that the inverted noise enables flexible image editing without re-optimization. Extensive experiments on diverse datasets demonstrate that Dualin simultaneously generates high-quality inverted prompts and achieves state-of-the-art image fidelity. Additionally, Dualin can establish a robust foundation for the precise and controllable image editing.
- Abstract(参考訳): Promptインバージョンは、典型的なリバースエンジニアリング技術として、テキスト・トゥ・イメージ(T2I)拡散モデルにより、広範囲なプロンプトエンジニアリングなしで所望のターゲット画像を生成することができる。
しかし、既存のプロンプト逆転法は、(1)勾配に基づく手法は不安定で解釈不能であり、しばしば深刻なアーティファクトを持つ生成画像をもたらす。(2)勾配のない手法は、人間の読みやすいプロンプトを生成するが、細かな細かな詳細アライメントが欠如しているため、視覚的忠実さを保たない。
この制限は、構造情報を符号化する潜時雑音の重要な役割を無視して、逆エンジニアリングの十分な条件としてプロンプト逆転を処理することに由来すると我々は主張する。
そこで本稿では,目的画像のセマンティック・プロンプトと潜時雑音を両立させる2段階の手法であるDual Inversionを提案する。
第一段階では、視覚言語モデル、CLIP、大型言語モデルを統合し、忠実で人間解釈可能なハードプロンプトを反転させる。
第2段階では、非条件DDIMインバージョンは、対象画像の正確な潜時ノイズを再構成し、構造情報レベルでの整合性を保証する。
理論的には、逆ノイズは再最適化せずに柔軟な画像編集を可能にする。
多様なデータセットに関する大規模な実験は、Dualinが同時に高品質な反転プロンプトを生成し、最先端の画像忠実性を達成することを示した。
さらに、Dualinは正確かつ制御可能な画像編集のための堅牢な基盤を確立することができる。
関連論文リスト
- Prompt-Guided Dual Latent Steering for Inversion Problems [16.58915166460579]
劣化した画像を拡散モデルの潜在空間に変換することは困難である。
イメージを1つの潜在ベクトルにエンコードする現在の手法は、構造的忠実度と意味論的精度のバランスをとるのに苦労している。
Prompt-Guided Dual Latent Steering (PDLS) はRectified Flowモデル上に構築された新しいフレームワークで,その安定な反転経路を実現する。
PDLSはインバージョンプロセスを、ソースの整合性を維持する構造経路と、プロンプトによって導かれる意味経路の2つの相補的なストリームに分解する。
論文 参考訳(メタデータ) (2025-09-23T04:11:06Z) - Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score [4.8677910801584385]
大規模テキスト・画像生成モデルは、多彩で高品質な画像を合成する顕著な能力を示している。
本稿では,テキスト・ツー・イメージ拡散モデルのリッチな生成モデルを活用するフレームワークであるDual Contrastive Denoising Scoreを提案する。
本手法は,入力画像と出力画像間のフレキシブルなコンテンツ修正と構造保存,およびゼロショット画像から画像への変換を実現する。
論文 参考訳(メタデータ) (2025-08-18T08:30:07Z) - Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion [15.384896404310645]
制御可能なT2Iモデルにおける制御条件を適切に反映する訓練不要なDual Recursive Feedback(DRF)システムを提案する。
提案手法は高品質でセマンティック・コヒーレントで構造的に一貫した画像を生成する。
論文 参考訳(メタデータ) (2025-08-13T07:46:00Z) - Accurate Latent Inversion for Generative Image Steganography via Rectified Flow [5.404219831398271]
拡散モデルに基づくステレオグラフィーは、高品質な画像を生成し、強靭性を示す能力によって注目されている。
我々は,新しい画像ステガノグラフィー手法である textbfRF-Stego を提案する。
RF-Stegoは, 抽出精度, 画質, 堅牢性, セキュリティ, 生成効率において, 最先端の手法よりも優れていた。
論文 参考訳(メタデータ) (2025-08-01T08:46:32Z) - DCI: Dual-Conditional Inversion for Boosting Diffusion-Based Image Editing [73.12011187146481]
Diffusionモデル内のインバージョンは、実または生成された画像の潜時雑音表現を復元することを目的としている。
ほとんどの反転アプローチは、復元精度と編集の柔軟性の間の本質的にのトレードオフに悩まされている。
本稿ではDCI(Dual-Conditional Inversion)について紹介する。
論文 参考訳(メタデータ) (2025-06-03T07:46:44Z) - NOFT: Test-Time Noise Finetune via Information Bottleneck for Highly Correlated Asset Creation [70.96827354717459]
拡散モデルは、テキスト・ツー・イメージ(T2I)と画像・ツー・イメージ(I2I)を生成する強力なツールを提供する。
本研究では,高相関・多彩な画像を生成するため,安定拡散を用いたノイズファインチューンNOFTモジュールを提案する。
論文 参考訳(メタデータ) (2025-05-18T05:09:47Z) - DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior [70.46245698746874]
DiffBIRは、視覚の異なる画像復元タスクを処理できる一般的な修復パイプラインである。
DiffBIRは, ブラインド画像復元問題を, 1) 劣化除去: 画像に依存しない内容の除去; 2) 情報再生: 失われた画像内容の生成の2段階に分離する。
第1段階では, 修復モジュールを用いて劣化を除去し, 高忠実度復元結果を得る。
第2段階では、潜伏拡散モデルの生成能力を活用して現実的な詳細を生成するIRControlNetを提案する。
論文 参考訳(メタデータ) (2023-08-29T07:11:52Z) - DR2: Diffusion-based Robust Degradation Remover for Blind Face
Restoration [66.01846902242355]
ブラインド顔復元は通常、トレーニングのための事前定義された劣化モデルで劣化した低品質データを合成する。
トレーニングデータに現実のケースをカバーするために、あらゆる種類の劣化を含めることは、高価で実現不可能である。
本稿では、まず、劣化した画像を粗いが劣化不変な予測に変換し、次に、粗い予測を高品質な画像に復元するために拡張モジュールを使用するロバスト劣化再帰法(DR2)を提案する。
論文 参考訳(メタデータ) (2023-03-13T06:05:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。