論文の概要: ELDiff: When Evidential Learning Meets Text-to-Image Diffusion
- arxiv url: http://arxiv.org/abs/2606.20924v1
- Date: Thu, 18 Jun 2026 20:33:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 11:51:28.629348
- Title: ELDiff: When Evidential Learning Meets Text-to-Image Diffusion
- Title(参考訳): ELDiff:Evidential Learningがテキストと画像の拡散に出会ったとき
- Authors: Qingtao Pan, Kai Ye, Zhihao Dou, Bing Ji, Shuo Li,
- Abstract要約: 画像合成には多目的テキスト・トゥ・イメージ(T2I)拡散が不可欠である。
一貫性の制約は拡散モデルのデノナイジング過程において強調されることが多い。
ELDiffは,新しい顕在的学習制御型T2I拡散モデルである。
- 参考スコア(独自算出の注目度): 8.411461785334746
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In multi-object text-to-image (T2I) diffusion, ensuring semantic consistency between textual prompts and generated visual content is crucial for image synthesis. However, such consistency constraint is often underemphasized in the denoising process of diffusion models. Although token supervised diffusion models can mitigate this issue by learning object-wise consistency between the image content and object segmentation maps, it tends to suffer from the problems of segmentation map bias and semantic overlap conflict, especially when involving multiple objects. In this paper, we propose ELDiff, a new evidential learning-supervised T2I diffusion model, which leverages the advantages of uncertainty metric and conflict detection to enhance the fault tolerance of unreliable segmentation maps and suppress semantic conflicts, strengthening object-wise consistency learning. Specifically, a pixel evidence loss is proposed to restrain overconfidence in unreliable labels through evidential regularization, and a token conflict loss is designed to weaken the contradiction between semantics through optimizing a measured conflict factor. Extensive experiments show that our ELDiff outperforms existing training based and train-free based T2I diffusion models on SD v1.4, SD v2.1, SDXL, SD v3.5, and Qwen-Image, without requiring additional inference-time manipulations. Notably, ELDiff can be seamlessly extended to the existing training pipeline of T2I diffusion models. Code can be found at https://github.com/QingtaoPan/ELDiff.
- Abstract(参考訳): マルチオブジェクトテキスト・トゥ・イメージ(T2I)拡散では,テキストプロンプトと生成した視覚的内容とのセマンティックな一貫性が画像合成に不可欠である。
しかし、そのような一貫性の制約は拡散モデルのデノナイジング過程において強調されることが多い。
トークン制御拡散モデルでは、画像の内容とオブジェクトのセグメンテーションマップ間のオブジェクト指向の整合性を学ぶことでこの問題を軽減することができるが、セグメンテーションマップのバイアスやセグメンテーションオーバーラップの競合、特に複数のオブジェクトを巻き込む場合、この問題に悩まされる傾向にある。
本稿では,信頼できないセグメンテーションマップのフォールトトレランスを高め,意味的矛盾を抑え,オブジェクト指向の整合性学習を強化するために,不確実性メトリックとコンフリクト検出の利点を活用した新たな顕在的学習教師付きT2I拡散モデルであるEDDiffを提案する。
具体的には、明らかな正則化を通じて信頼できないラベルの過信を抑制するために画素エビデンス損失を提案し、測定された競合係数を最適化することにより意味論間の矛盾を弱めるようにトークンコンフリクト損失を設計する。
ELDiffはSD v1.4, SD v2.1, SDXL, SD v3.5, Qwen-Imageの既存のトレーニングベースおよび非列車ベースT2I拡散モデルより優れており, 追加の推論時間操作は不要である。
特に、EDDiffは既存のT2I拡散モデルのトレーニングパイプラインにシームレスに拡張できる。
コードはhttps://github.com/QingtaoPan/ELDiffで見ることができる。
関連論文リスト
- Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation [29.96691004865241]
本稿では,統合的かつデータ効率のよいイメージ・ツー・イメージ(I2I)翻訳のためのDDD(Decoupled Residual Denoising Diffusion Model)を提案する。
論文 参考訳(メタデータ) (2026-05-31T06:38:18Z) - Making Training-Free Diffusion Segmentors Scale with the Generative Power [118.72472901404814]
一連の研究は、事前学習された拡散モデルを、それ以上の訓練をせずに意味的セグメンテーションに適応することに焦点を当てている。
本稿では,自動アグリゲーションと画素単位の再スケーリングという2つの手法を提案する。
論文 参考訳(メタデータ) (2026-03-06T11:35:37Z) - InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models [27.206678799411645]
InfSplignは、テキスト・ツー・イメージ・モデルのためのトレーニング不要な推論時間法である。
除音ステップ毎に複合損失によってノイズを調整することで空間アライメントを改善する。
既存の最強の推論時間ベースラインよりもパフォーマンスが大幅に向上する。
論文 参考訳(メタデータ) (2025-12-19T17:52:43Z) - Contrastive Learning with Diffusion Features for Weakly Supervised Medical Image Segmentation [12.530950480385554]
条件拡散モデル (CDM) は, セグメンテーションマスク生成の代替手段として用いられている。
拡散特徴量を用いたコントラスト学習(CLDF)を導入し,凍結したCDMからセグメンテーションのための低次元埋め込み空間へ拡散特徴量をマッピングするために画素デコーダを訓練する。
論文 参考訳(メタデータ) (2025-06-30T01:43:50Z) - Training-Free Layout-to-Image Generation with Marginal Attention Constraints [73.55660250459132]
トレーニング不要なレイアウト・トゥ・イメージ(L2I)アプローチを提案する。
具体的には、テキスト・ビジュアル・クロスアテンション・フィーチャーマップを用いて、生成された画像のレイアウトと提供された命令の不整合を定量化する。
自己アテンション特徴写像の画素間相関を利用して、交差アテンション写像を整列し、境界注意で制約された3つの損失関数を組み合わせ、潜時特徴を更新する。
論文 参考訳(メタデータ) (2024-11-15T05:44:45Z) - Improving Consistency in Diffusion Models for Image Super-Resolution [28.945663118445037]
拡散法における2種類の矛盾を観測する。
セマンティックとトレーニング-推論の組み合わせを扱うために、ConsisSRを導入します。
本手法は,既存拡散モデルにおける最先端性能を示す。
論文 参考訳(メタデータ) (2024-10-17T17:41:52Z) - Fine-grained Image-to-LiDAR Contrastive Distillation with Visual Foundation Models [55.99654128127689]
Visual Foundation Models (VFM) は、弱い教師付きピクセル対ポイントのコントラスト蒸留のためのセマンティックラベルを生成するために使用される。
我々は,空間分布とカテゴリー周波数の不均衡に対応するために,点のサンプリング確率を適応させる。
我々の手法は、下流タスクにおける既存の画像からLiDARへのコントラスト蒸留法を一貫して超越している。
論文 参考訳(メタデータ) (2024-05-23T07:48:19Z) - DiffDis: Empowering Generative Diffusion Model with Cross-Modal
Discrimination Capability [75.9781362556431]
本稿では,拡散過程下での1つのフレームワークに,モダクティブと差別的事前学習を統一するDiffDisを提案する。
DiffDisは画像生成タスクと画像テキスト識別タスクの両方において単一タスクモデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-08-18T05:03:48Z) - Diffusion Visual Counterfactual Explanations [51.077318228247925]
VCE(Visual Counterfactual Explanations)は、画像の決定を理解するための重要なツールである。
VCEの生成に対する現在のアプローチは、逆向きに堅牢なモデルに制限されており、しばしば非現実的なアーティファクトを含んでいる。
本稿では、任意のイメージネット分類器に対して、視覚拡散対実説明(DVCE)を生成することでこれを克服する。
論文 参考訳(メタデータ) (2022-10-21T09:35:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。