論文の概要: When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions
- arxiv url: http://arxiv.org/abs/2608.04820v1
- Date: Wed, 05 Aug 2026 13:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.937493
- Title: When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions
- Title(参考訳): 拡散モデルがあなたを忘れる時--大規模な咬合下での顔の塗布におけるアイデンティティ保存
- Authors: Feng Ding, Shuhuai Xie, Yue Zhou, Yulan Zhang, Guopu Zhu, Mengyao Xiao,
- Abstract要約: ReSem-Faceは、顔の塗布に先立って明示的なアイデンティティ条件のセマンティクスを導入する、カスケード拡散フレームワークである。
提案手法では,複数の参照から代表的特徴を抽出し,欠落した意味領域を再構築する。
CelebAHQ-IDI-5 と VGGFace2 の実験では、ReSem-Face は厳密なセマンティックマスクの下でより信頼性の高いID保存完了をもたらすことを示した。
- 参考スコア(独自算出の注目度): 14.50832575272006
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Face inpainting with diffusion models has recently achieved impressive visual quality, yet preserving identity fidelity under significant occlusion and conflicting text guidance remains a major challenge. To address this issue, we present Reference Semantic Inpainting for Face (ReSem-Face), a cascaded diffusion framework that introduces an explicit identity-conditioned semantic prior for multi-reference face inpainting. Our approach distills representative identity features from multiple references to reconstruct missing semantic regions, which then guide the diffusion process through a multi-stream conditioning architecture. This design provides strong semantic constraints when pixels are absent and stabilizes identity reconstruction while remaining compatible with prompt-driven edits. Experiments on CelebAHQ-IDI-5 and VGGFace2 demonstrate that ReSem-Face yields more reliable identity-preserving completion under severe semantic masks and improves text-controlled editing quality compared with representative baselines.
- Abstract(参考訳): 拡散モデルによる顔の塗り絵は、近年目覚ましい視覚的品質を達成しているが、大きな隠蔽と矛盾するテキストガイダンスの下でアイデンティティの忠実さを保っていることは大きな課題である。
この問題に対処するために,複数参照顔の塗装に先立って,明示的な識別条件のセマンティクスを導入する,ケースケード拡散フレームワークであるReference Semantic Inpainting for Face (ReSem-Face)を提案する。
提案手法では,複数の参照から代表的特徴を抽出し,欠落した意味領域を再構成し,マルチストリーム条件付けアーキテクチャを通じて拡散過程を導出する。
この設計は、画素が存在しない場合に強い意味制約を与え、プロンプト駆動編集との互換性を維持しながら、アイデンティティ再構成を安定化する。
CelebAHQ-IDI-5とVGGFace2の実験では、ReSem-Faceは厳密なセマンティックマスクの下でより信頼性の高いID保存完了をもたらし、代表ベースラインと比較してテキスト制御の編集品質が向上することを示した。
関連論文リスト
- Face inpainting with Identity Preserving Latent Diffusion Models [10.348748950921667]
ID-ControlNetは、潜伏拡散モデルに基づいて構築された、ID保存のフェイスペイントフレームワークである。
我々は、生成した顔とターゲットの識別表現とのアライメントを明確に強制する、アイデンティティ一貫性と三重項損失トレーニング戦略を導入する。
論文 参考訳(メタデータ) (2026-05-15T23:19:43Z) - Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement [54.199726425201895]
大規模モデルのマルチモーダル編集は、様々なタスクにまたがる強力な編集機能を示している。
現在の顔認証保存法は、顔認証と編集済み要素IPの整合性回復に苦慮している。
そこで我々は,頑健なアイデンティティ特異的顔復元のためのアライメント・ディスタングルメント・アンタングルメント・フレームワークであるEditedIDを提案する。
論文 参考訳(メタデータ) (2026-02-21T08:24:42Z) - Robust ID-Specific Face Restoration via Alignment Learning [14.7430941613282]
本稿では,拡散モデルに基づく新しい顔復元フレームワークであるRobust ID-Specific Face Restoration (RIDFR)を提案する。
RIDFRにはアライメント・ラーニング(Alignment Learning)が組み込まれており、複数の参照からの復元結果を同一のアイデンティティと整合させて、ID非関連顔のセマンティクスの干渉を抑制する。
実験により、我々のフレームワークは最先端の手法よりも優れており、高品質なID固有の結果を高いアイデンティティの忠実度で再現し、強靭性を示す。
論文 参考訳(メタデータ) (2025-07-15T03:16:12Z) - OSDFace: One-Step Diffusion Model for Face Restoration [72.5045389847792]
拡散モデルは、顔の修復において顕著な性能を示した。
顔復元のための新しいワンステップ拡散モデルOSDFaceを提案する。
その結果,OSDFaceは現状のSOTA(State-of-the-art)手法を視覚的品質と定量的指標の両方で上回っていることがわかった。
論文 参考訳(メタデータ) (2024-11-26T07:07:48Z) - CLR-Face: Conditional Latent Refinement for Blind Face Restoration Using
Score-Based Diffusion Models [57.9771859175664]
最近の生成優先法は、有望なブラインドフェイス修復性能を示している。
入力に忠実なきめ細かい顔の詳細を生成することは、依然として難しい問題である。
本稿では,VQGANアーキテクチャの内部に拡散型プライマーを導入し,非破壊な潜伏埋め込みにおける分布の学習に重点を置いている。
論文 参考訳(メタデータ) (2024-02-08T23:51:49Z) - Personalized Face Inpainting with Diffusion Models by Parallel Visual
Attention [55.33017432880408]
本稿では,パラレル視覚注意(PVA, Parallel Visual Attention, PVA)と拡散モデルとの併用による塗装結果の改善を提案する。
我々はCelebAHQ-IDIで注目モジュールとIDエンコーダをトレーニングする。
実験により, PVAは顔の塗り絵と顔の塗り絵の両面において, 言語指導タスクと相容れない同一性を持つことが示された。
論文 参考訳(メタデータ) (2023-12-06T15:39:03Z) - When StyleGAN Meets Stable Diffusion: a $\mathscr{W}_+$ Adapter for
Personalized Image Generation [60.305112612629465]
テキストと画像の拡散モデルは、多種多様で高品質でフォトリアリスティックな画像を生成するのに優れている。
本稿では,拡散モデルのための拡張されたアイデンティティ保存とアンタングル化を実現するために,StyleGAN 埋め込み空間 $mathcalW_+$ の新たな利用法を提案する。
提案手法は,即時記述に適合するだけでなく,一般的なスタイルGAN編集方向に対応可能なパーソナライズされたテキスト・ツー・イメージ出力を生成する。
論文 参考訳(メタデータ) (2023-11-29T09:05:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。