論文の概要: Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization
- arxiv url: http://arxiv.org/abs/2607.00766v2
- Date: Thu, 02 Jul 2026 03:21:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.510142
- Title: Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization
- Title(参考訳): デカップリング誘導:テキスト・画像のパーソナライズにおける主題と文脈の分離
- Authors: Seongmin Kim, Kyucheol Shin, Heesun Jung, Jinseo Kim, Sungyong Baik,
- Abstract要約: テキスト・ツー・イメージのパーソナライゼーションは、テキストによって記述された斬新なシーンにおいて、ユーザが提供する主題を生成することを目的としている。
既存のほとんどのメソッドは、同じ条件付け経路を通して主観的アイデンティティ(忠実さ)とコンテキスト(食用性)を符号化している。
DeGu(Decoupled Guidance)は、2つの独立したガイダンスストリームを通して、主題のアイデンティティとシーンコンテキストをルーティングするフレームワークである。
- 参考スコア(独自算出の注目度): 13.554566178862745
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image personalization aims to generate a user-provided subject in novel scenes described by text. However, most existing methods encode subject identity (fidelity) and context (editability) through the same conditioning pathway, forcing the two to compete for attention-map resources. We refer to this phenomenon as conditioning entanglement and show that it induces a fidelity-editability trade-off. We further provide causal evidence by replacing the target subject token with a generic subject token, which produces shifts in attention allocation and corresponding changes in context adherence. To this end, we propose Decoupled Guidance (DeGu), a plug-and-play framework that routes subject identity and scene context through two independent guidance streams. We further introduce a spatial mixing mechanism that dynamically fuses these streams, ensuring each operates within its semantically relevant region without interference. Furthermore, DeGu can be readily applied to existing personalization methods without modifying the underlying backbone models, consistently improving the overall personalization performance while enabling inference-time control over the fidelity-editability balance, across diverse methods and backbones, including flow-matching Diffusion Transformers (DiTs).
- Abstract(参考訳): テキスト・ツー・イメージのパーソナライゼーションは、テキストによって記述された斬新なシーンにおいて、ユーザが提供する主題を生成することを目的としている。
しかし、既存のほとんどの手法は、同じ条件付け経路を通じて主題のアイデンティティ(忠実さ)とコンテキスト(親和性)を符号化しており、両者は注意マップのリソースと競合せざるを得なかった。
我々は、この現象を条件付き絡み合いと呼び、フィデリティ・アドミタビリティのトレードオフを引き起こすことを示す。
さらに,対象物件トークンを汎用物件トークンに置き換えて因果的証拠を提供する。
この目的のために,2つの独立したガイダンスストリームを通じて主題のアイデンティティとシーンコンテキストをルーティングするプラグイン・アンド・プレイ・フレームワークであるデカップリング・ガイダンス(DeGu)を提案する。
さらに、これらのストリームを動的に融合させる空間混合機構を導入し、それぞれが干渉することなく意味的に関連する領域内で動作することを保証する。
さらに、DeGuは、基礎となるバックボーンモデルを変更することなく、既存のパーソナライズ手法に容易に適用でき、フローマッチング拡散変換器(DiTs)を含む様々な方法やバックボーンに対して、フィデリティ・ディジタビリティバランスの推論時間制御を可能にしながら、全体的なパーソナライズ性能を一貫して改善することができる。
関連論文リスト
- Redirecting the Flow: Image Customization through Attention Distribution Shift [18.601789249339014]
被験者主導のイメージカスタマイズは、テキストによる指示に従う画像を生成し、与えられた参照対象のアイデンティティを保持することを目的としている。
既存のアプローチは、限られた効率性、抽出された参照特徴と生成過程の相違、無関係情報からの干渉に悩まされている。
安定拡散3に基づくデュアルブランチアーキテクチャであるCustomShiftを提案する。
DreamBooth と Custom101 ベンチマークの実験は、我々の手法が常に最先端のアプローチより優れていることを示した。
論文 参考訳(メタデータ) (2026-06-15T15:44:14Z) - Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework [52.477407591581176]
マスクのないビデオオブジェクト挿入は、ソースビデオへの参照オブジェクトの調和を要する、困難なタスクとして登場した。
ビデオ挿入と画像スタイル転送を同時に行う,エンドツーエンドのtextbfDual-Stream フレームワークである textittextbfSmart-Insertion-V を提案する。
論文 参考訳(メタデータ) (2026-05-22T17:54:54Z) - A Unified Conditional Flow for Motion Generation, Editing, and Intra-Structural Retargeting [26.68081874066983]
両タスクを単一の生成フレームワーク内で条件付き移動のインスタンスとしてキャストする統一的な視点を示す。
我々はこのビジョンを、整流運動モデルと目標骨格構造を併用して実装する。
SnapMoGenとマルチキャラクタのMixamoサブセットの実験は、単一のトレーニングされたモデルがテキスト・ツー・モーション生成、ゼロショット編集、ゼロショット・イン・ストラクチャをサポートすることを示している。
論文 参考訳(メタデータ) (2026-04-15T02:53:07Z) - Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers [49.08465459791972]
テキスト・画像生成における領域命令によるレイアウト制御は非常に実用的だが、既存の手法は制限に悩まされている。
地域生成を異なるレイヤとしてモデル化し、生成中にそれらを結合することにより、LayerBindを提案する。
論文 参考訳(メタデータ) (2026-03-06T00:09:49Z) - Shifting the Breaking Point of Flow Matching for Multi-Instance Editing [47.32746672482526]
本稿では,共同注意操作を分割し,インスタンス固有のテキスト命令と空間領域間の結合を強制する機構であるインスタンス・ディスタングル・アテンションを紹介する。
提案手法は,グローバルな出力コヒーレンスを保ちながら,編集のゆがみと局所性を促進し,単一パスのインスタンスレベルの編集を可能にする。
論文 参考訳(メタデータ) (2026-02-09T14:52:45Z) - Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model [60.82962950960996]
拡散遅延最適化を行うチューニング不要なUnifyEditを導入する。
本研究では, 自己注意保持制約(SA)と相互注意アライメント制約(CA)の2つを開発し, テキストアライメントの強化を図る。
提案手法は,様々な編集作業における構造保存とテキストアライメントのバランスを保ち,他の最先端手法よりも優れている。
論文 参考訳(メタデータ) (2025-04-08T01:02:50Z) - Unlocking the Potential of Text-to-Image Diffusion with PAC-Bayesian Theory [33.78620829249978]
テキスト・ツー・イメージ(T2I)拡散モデルは、高忠実で多彩で視覚的にリアルな画像を生成することによって、生成モデルに革命をもたらした。
最近の注目度に基づく手法は、オブジェクトの包摂性や言語的バインディングを改善してきたが、それでも属性のミスバインディングのような課題に直面している。
そこで,ベイズ的手法を用いて,所望のプロパティを強制するために,注意分布を優先したカスタムプライドを設計する手法を提案する。
本手法では,アテンション機構を解釈可能なコンポーネントとして扱い,微粒化制御と属性オブジェクトアライメントの改善を実現している。
論文 参考訳(メタデータ) (2024-11-25T10:57:48Z) - Learning to Manipulate Individual Objects in an Image [71.55005356240761]
本稿では,独立性および局所性を有する潜在因子を用いた生成モデルを学習する手法について述べる。
これは、潜伏変数の摂動が、オブジェクトに対応する合成画像の局所領域のみに影響を与えることを意味する。
他の教師なし生成モデルとは異なり、オブジェクトレベルのアノテーションを必要とせず、オブジェクト中心の操作を可能にする。
論文 参考訳(メタデータ) (2020-04-11T21:50:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。