論文の概要: Few-Shot Image Generation by Conditional Relaxing Diffusion Inversion
- arxiv url: http://arxiv.org/abs/2407.07249v1
- Date: Tue, 9 Jul 2024 21:58:26 GMT
- ステータス: 処理完了
- システム内更新日: 2024-07-11 18:31:06.391505
- Title: Few-Shot Image Generation by Conditional Relaxing Diffusion Inversion
- Title(参考訳): 条件緩和拡散インバージョンによるFew-Shot画像生成
- Authors: Yu Cao, Shaogang Gong,
- Abstract要約: 条件拡散緩和インバージョン(CRDI)は、合成画像生成における分布の多様性を高めるために設計されている。
CRDIはいくつかのサンプルに基づいた微調整を頼りにしていない。
ターゲットの画像インスタンスの再構築と、数ショットの学習による多様性の拡大に重点を置いている。
- 参考スコア(独自算出の注目度): 37.18537753482751
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In the field of Few-Shot Image Generation (FSIG) using Deep Generative Models (DGMs), accurately estimating the distribution of target domain with minimal samples poses a significant challenge. This requires a method that can both capture the broad diversity and the true characteristics of the target domain distribution. We present Conditional Relaxing Diffusion Inversion (CRDI), an innovative `training-free' approach designed to enhance distribution diversity in synthetic image generation. Distinct from conventional methods, CRDI does not rely on fine-tuning based on only a few samples. Instead, it focuses on reconstructing each target image instance and expanding diversity through few-shot learning. The approach initiates by identifying a Sample-wise Guidance Embedding (SGE) for the diffusion model, which serves a purpose analogous to the explicit latent codes in certain Generative Adversarial Network (GAN) models. Subsequently, the method involves a scheduler that progressively introduces perturbations to the SGE, thereby augmenting diversity. Comprehensive experiments demonstrates that our method surpasses GAN-based reconstruction techniques and equals state-of-the-art (SOTA) FSIG methods in performance. Additionally, it effectively mitigates overfitting and catastrophic forgetting, common drawbacks of fine-tuning approaches.
- Abstract(参考訳): 深部生成モデル(DGM)を用いたFew-Shot画像生成(FSIG)の分野では、最小サンプルで対象領域の分布を正確に推定することが大きな課題である。
これは、幅広い多様性と対象領域分布の真の特性の両方をキャプチャできる方法を必要とする。
合成画像生成における分布の多様性を高めるために, 条件緩和拡散インバージョン(CRDI, Conditional Relaxing Diffusion Inversion)を提案する。
従来の方法とは違って、CRDIはごく少数のサンプルに基づいて微調整をしない。
代わりに、ターゲットイメージインスタンスの再構築と、数ショットの学習による多様性の拡大に焦点を当てている。
この手法は拡散モデルに対してサンプル・ワイド・ガイダンス・エンベディング(SGE)を識別することで開始され、これはGAN(Generative Adversarial Network)モデルにおける明示的な潜伏符号に類似した目的を果たす。
その後、SGEに摂動を徐々に導入し、多様性を増大させるスケジューラを含む。
包括的実験により,本手法はGANに基づく再構築手法を超越し,最先端FSIG法に匹敵する性能を示した。
さらに、オーバーフィットと破滅的な忘れ、微調整アプローチの一般的な欠点を効果的に軽減する。
関連論文リスト
- FDS: Feedback-guided Domain Synthesis with Multi-Source Conditional Diffusion Models for Domain Generalization [19.0284321951354]
ドメイン一般化技術は、トレーニング中に新しいデータ分布をシミュレートすることで、モデルロバスト性を高めることを目的としている。
本稿では、拡散モデルを用いて新しい擬似ドメインを合成するFDS、フィードバック誘導ドメイン合成法を提案する。
本手法は, 領域一般化性能のベンチマークを, 様々な課題のあるデータセットに分けて設定することを示す。
論文 参考訳(メタデータ) (2024-07-04T02:45:29Z) - Diffusion Features to Bridge Domain Gap for Semantic Segmentation [2.8616666231199424]
本稿では, 拡散モデルの特徴を効率的に活用するために, サンプリングおよび融合技術を活用するアプローチについて検討する。
テキスト・画像生成能力の強みを生かして、暗黙的に後部知識を学習する新しいトレーニングフレームワークを導入する。
論文 参考訳(メタデータ) (2024-06-02T15:33:46Z) - Conditional Distribution Modelling for Few-Shot Image Synthesis with Diffusion Models [29.821909424996015]
少ないショット画像合成は、いくつかの例画像のみを使用して、斬新なカテゴリの多彩で現実的な画像を生成する。
本研究では,ディフュージョンモデルを利用した条件分布モデル (CDM) を提案する。
論文 参考訳(メタデータ) (2024-04-25T12:11:28Z) - Phasic Content Fusing Diffusion Model with Directional Distribution
Consistency for Few-Shot Model Adaption [73.98706049140098]
本稿では,方向分布の整合性を損なう少数ショット拡散モデルを用いた新しいファシックコンテンツを提案する。
具体的には、ファシックコンテンツ融合を用いたファシックトレーニング戦略を設計し、tが大きければ、モデルがコンテンツやスタイル情報を学ぶのに役立てる。
最後に、ドメイン適応時の構造整合性を高めるクロスドメイン構造ガイダンス戦略を提案する。
論文 参考訳(メタデータ) (2023-09-07T14:14:11Z) - Improving Diversity in Zero-Shot GAN Adaptation with Semantic Variations [61.132408427908175]
0ショットのGAN適応は、よく訓練されたジェネレータを再利用して、目に見えないターゲットドメインの画像を合成することを目的としている。
実際の画像の代わりに1つの代表的テキスト機能しか持たないため、合成された画像は徐々に多様性を損なう。
そこで本研究では,CLIP空間における対象テキストの意味的変化を見つけるための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-08-21T08:12:28Z) - Real-World Image Variation by Aligning Diffusion Inversion Chain [53.772004619296794]
生成した画像と実世界の画像の間にはドメインギャップがあり、これは実世界の画像の高品質なバリエーションを生成する上での課題である。
実世界画像のアライメントによる変化(RIVAL)と呼ばれる新しい推論パイプラインを提案する。
我々のパイプラインは、画像生成プロセスとソース画像の反転チェーンを整列させることにより、画像の変動の生成品質を向上させる。
論文 参考訳(メタデータ) (2023-05-30T04:09:47Z) - Auto-regressive Image Synthesis with Integrated Quantization [55.51231796778219]
本稿では,条件付き画像生成のための多目的フレームワークを提案する。
CNNの帰納バイアスと自己回帰の強力なシーケンスモデリングが組み込まれている。
提案手法は,最先端技術と比較して,優れた多彩な画像生成性能を実現する。
論文 参考訳(メタデータ) (2022-07-21T22:19:17Z) - Deblurring via Stochastic Refinement [85.42730934561101]
条件付き拡散モデルに基づくブラインドデブロアリングのための代替フレームワークを提案する。
提案手法は,PSNRなどの歪み指標の点で競合する。
論文 参考訳(メタデータ) (2021-12-05T04:36:09Z) - Closed-Form Factorization of Latent Semantics in GANs [65.42778970898534]
画像合成のために訓練されたGAN(Generative Adversarial Networks)の潜在空間に、解釈可能な次元の豊富なセットが出現することが示されている。
本研究では,GANが学習した内部表現について検討し,その基礎となる変動要因を教師なしで明らかにする。
本稿では,事前学習した重みを直接分解することで,潜在意味発見のためのクローズドフォーム因数分解アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-07-13T18:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。