論文の概要: Rare Concept Generation via Counterfactual Inference in Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.14765v1
- Date: Thu, 16 Jul 2026 09:49:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.056996
- Title: Rare Concept Generation via Counterfactual Inference in Diffusion Models
- Title(参考訳): 拡散モデルにおける非現実的推論による希少概念生成
- Abstract要約: 希少な概念生成は、異常な属性を持つオブジェクトを記述するテキストプロンプトに条件付けされたカスタマイズされたイメージの合成に焦点を当てている。
以前の作品では生成した画像を稀な概念と整合させることができず、不正確な属性の描画や概念の矛盾した構成に繋がった。
本稿では,CI-Diff と呼ばれる,対実的推論に基づく新しい手法を提案する。
- 参考スコア(独自算出の注目度): 13.309431324124498
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rare concept generation focuses on synthesizing customized images conditioned on text prompts that describe objects with unusual attributes. Previous works failed to align the generated images with rare concepts, resulting in incorrect attribute rendering or inconsistent composition of concepts. Such failures, as we observed, stem from the inherent common knowledge bias in the training stage of diffusion models, where objects are strongly associated with their common attributes, making it difficult to break these associations when generating rare concepts. To address such challenges, in this paper, we propose a novel Counterfactual Inference-based Diffusion approach, dubbed CI-Diff. CI-Diff blocks the interference of the model's inherent common knowledge bias and utilizes the Natural Direct Effect to capture the independent influence of the text prompt of rare concepts on image generation so that decoupling the unusual attributes from the rare concepts. To this end, we reformulate the classifier-free guidance mechanism to highlight the atypical attributes. To the best of our knowledge, we are the first to introduce causal inference into the rare concept generation task. Extensive experiments on the RareBench benchmark validate the superiority of CI-Diff over state-of-the-art diffusion models. Our code can be accessed from https://github.com/200204jzy/CI-Diff.
- Abstract(参考訳): 希少な概念生成は、異常な属性を持つオブジェクトを記述するテキストプロンプトに条件付けされたカスタマイズされたイメージの合成に焦点を当てている。
以前の作品では生成した画像を稀な概念と整合させることができず、不正確な属性のレンダリングや概念の矛盾した構成に繋がった。
このような失敗は、我々が観察したように、オブジェクトが共通の属性と強く結びついている拡散モデルの訓練段階における固有の共通知識バイアスに由来するため、稀な概念を生成する際にこれらの関連を壊すことは困難である。
このような課題に対処するため,我々はCI-Diffと呼ばれる新しい対実的推論に基づく拡散手法を提案する。
CI-Diffは、モデル固有の共通知識バイアスの干渉をブロックし、Natural Direct Effectを利用して、まれな概念のテキストプロンプトのイメージ生成に対する独立的な影響を捉え、珍しい概念から異常な属性を分離する。
この目的のために、非典型的属性を強調するために分類器不要誘導機構を再構成する。
私たちの知識を最大限に活用するために、私たちは、まれな概念生成タスクに因果推論を導入した最初の人物です。
RareBenchベンチマークの大規模な実験は、最先端拡散モデルよりもCI-Diffの方が優れていることを検証している。
私たちのコードはhttps://github.com/200204jzy/CI-Diffからアクセスできます。
関連論文リスト
- Interpreting Object-Dependent Concept Brittleness in Text-to-Image Diffusion Models [105.53190946111586]
我々はこの現象をオブジェクト依存概念の脆さと呼ぶ。
これらの障害を監査し、最小限に修正する、解釈可能性指向のフレームワークを提案する。
複数の拡散バックボーンにまたがるスタイルと属性の故障事例について,提案手法の評価を行った。
論文 参考訳(メタデータ) (2026-09-09T09:07:40Z) - EruDiff: Refactoring Knowledge in Diffusion Models for Advanced Text-to-Image Synthesis [49.883192716595026]
EruDiffは、難解な暗黙のプロンプトの知識分布を、明確に定義された明示的なアンカーの知識分布と整合させることを目指している。
そこで我々はDK-DM (Diffusion Knowledge Distribution Matching) を開発し、暗黙的なプロンプトの知識分布を、明確に定義された明示的なアンカーの知識分布に登録する。
我々は, きめ細かい補正にNO-RL戦略を用いる。
論文 参考訳(メタデータ) (2026-03-21T14:04:08Z) - TRACE: Trajectory-Constrained Concept Erasure in Diffusion Models [0.0]
概念消去は、生成モデルにおいて特定の概念情報を削除または抑制することを目的としている。
Trajectory-Constrained Attentional Concept Erasure (TRACE) は拡散モデルから対象概念を消去する新しい手法である。
TRACEは最先端のパフォーマンスを実現し、ANT、EraseAnything、MACEといった最近の手法よりも、除去効率と出力品質の点で優れています。
論文 参考訳(メタデータ) (2025-05-29T10:15:22Z) - Debiasing Diffusion Model: Enhancing Fairness through Latent Representation Learning in Stable Diffusion Model [0.5999777817331317]
本稿では,学習中の潜伏表現の学習に指標を活用する脱バイアス拡散モデル(DDM)を提案する。
このアプローチは、従来手法で対処されていたシナリオでの有効性を示すだけでなく、事前定義された機密属性を条件として頼らずに公平性を高める。
論文 参考訳(メタデータ) (2025-03-16T15:02:52Z) - Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models [65.82564074712836]
テキストと画像の拡散モデルに光を流す新しいHOI検出器であるDIFfusionHOIを紹介する。
まず、埋め込み空間における人間と物体の関係パターンの表現をインバージョンベースで学習する戦略を考案する。
これらの学習された関係埋め込みはテキストのプロンプトとして機能し、スタイア拡散モデルが特定の相互作用を記述する画像を生成する。
論文 参考訳(メタデータ) (2024-10-26T12:00:33Z) - DiffusionPID: Interpreting Diffusion via Partial Information Decomposition [24.83767778658948]
入力テキストプロンプトを基本成分に分解するために,情報理論の原理を適用した。
個々のトークンとその相互作用が生成した画像をどのように形成するかを分析する。
PIDはテキスト・画像拡散モデルの評価と診断のための強力なツールであることを示す。
論文 参考訳(メタデータ) (2024-06-07T18:17:17Z) - Diffusion Model with Cross Attention as an Inductive Bias for Disentanglement [58.9768112704998]
遠方表現学習は、観測データ内の本質的要因を抽出する試みである。
我々は新しい視点と枠組みを導入し、クロスアテンションを持つ拡散モデルが強力な帰納バイアスとなることを示す。
これは、複雑な設計を必要とせず、クロスアテンションを持つ拡散モデルの強力な解離能力を明らかにする最初の研究である。
論文 参考訳(メタデータ) (2024-02-15T05:07:54Z) - Bridging Generative and Discriminative Models for Unified Visual
Perception with Diffusion Priors [56.82596340418697]
本稿では,豊富な生成前駆体を含む事前学習型安定拡散(SD)モデルと,階層的表現を統合可能な統一型ヘッド(Uヘッド)と,識別前駆体を提供する適応型専門家からなる,シンプルで効果的なフレームワークを提案する。
包括的調査では、異なる時間ステップで潜伏変数に隠された知覚の粒度や様々なU-netステージなど、バーマスの潜在的な特性が明らかになった。
有望な結果は,有望な学習者としての拡散モデルの可能性を示し,情報的かつ堅牢な視覚表現の確立にその意義を定めている。
論文 参考訳(メタデータ) (2024-01-29T10:36:57Z) - Steered Diffusion: A Generalized Framework for Plug-and-Play Conditional
Image Synthesis [62.07413805483241]
Steered Diffusionは、無条件生成のために訓練された拡散モデルを用いたゼロショット条件画像生成のためのフレームワークである。
塗装,着色,テキスト誘導セマンティック編集,画像超解像などのタスクに対して,ステアリング拡散を用いた実験を行った。
論文 参考訳(メタデータ) (2023-09-30T02:03:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。