論文の概要: Stage-Aware Adaptation and Distribution Calibration for Subject-Driven Personalized Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2607.07173v1
- Date: Wed, 08 Jul 2026 09:07:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.328001
- Title: Stage-Aware Adaptation and Distribution Calibration for Subject-Driven Personalized Text-to-Image Generation
- Title(参考訳): 主観的パーソナライズされたテキスト・ツー・イメージ生成のためのステージ・アウェア適応と分布校正
- Authors: Wenyan Xu, Alizer Wong,
- Abstract要約: 主観駆動型パーソナライズされたテキスト・ツー・イメージ生成のためのフレームワークを提案する。
均一な低ランク制約や均一なアダプタ強度は、異なる遅延ステージのキャパシティ要求を明確に区別することはできない。
タイムステップに依存したスケーリングは低ランクアダプタの有効等級を制御し,IDバイアスのある候補選択は選択した特徴の半径を制限することを示した。
- 参考スコア(独自算出の注目度): 1.2891210250935148
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Subject-driven personalized text-to-image generation requires a pretrained diffusion model to acquire a specific subject from a few reference images while preserving subject identity, following novel text prompts, and maintaining sample diversity. Existing optimization-based methods instantiate subject adaptation through full fine-tuning, textual embedding optimization, or low-rank parameter updates; PaRa further constrains personalization from the perspective of parameter rank reduction. However, a uniform low-rank constraint or a uniform adapter strength cannot explicitly distinguish the capacity requirements of different denoising stages. Moreover, inference-time candidate selection driven mainly by identity similarity may compress the selected samples in the visual representation space. We decompose the problem into two complementary components: SPaRa denotes training-side stage-aware low-rank adaptation, DCAL denotes inference-side distribution-calibrated candidate selection, and SPaRa-DCAL denotes the combined framework. Theoretical analysis shows that timestep-dependent scaling controls the effective perturbation magnitude of a low-rank adapter, while identity-biased candidate selection restricts the radius of selected features around the reference center under explicit conditions. Auditable experiments under the SDXL and DreamBooth 30-subject protocol show that DCAL improves 1-LPIPS, CLIP-I, DINO-I, and CLIP-T on a fixed LoRA candidate pool, while revealing a clear trade-off with CLIP/DINO pairwise diversity and pairwise LPIPS. These results indicate that personalized generation should be evaluated through identity consistency, text alignment, and representation diversity rather than identity metrics alone.
- Abstract(参考訳): 主題駆動型パーソナライズされたテキスト・ツー・イメージ生成では、対象のアイデンティティを保持しつつ、新しいテキストプロンプトに従い、サンプルの多様性を維持しながら、いくつかの参照画像から特定の対象を取得するための事前訓練された拡散モデルが必要である。
既存の最適化ベースの手法は、完全な微調整、テキスト埋め込み最適化、低ランクパラメータ更新を通じて対象適応をインスタンス化し、PaRaはパラメータランクの削減の観点からパーソナライズをさらに制約する。
しかし、均一な低ランク制約や均一なアダプタ強度は、異なる段階のキャパシティ要求を明確に区別することはできない。
さらに、主にアイデンティティ類似性によって駆動される推測時間候補選択は、視覚表現空間において選択されたサンプルを圧縮することができる。
SPaRaはトレーニングサイドのステージ対応低ランク適応,DCALは推論サイドの分布校正候補選択,SPaRa-DCALは統合フレームワークを示す。
理論的解析によると、時間ステップに依存したスケーリングは、低ランクアダプタの効果的な摂動大小を制御し、一方、IDバイアス付き候補選択は、明示的な条件下で基準中心周辺で選択された特徴の半径を制限する。
SDXLおよびDreamBooth 30-subjectプロトコルの下での聴取実験により、DCALは固定されたLoRA候補プール上で1-LPIPS、CLIP-I、DINO-I、CLIP-Tを改善し、CLIP/DINOの相互多様性とペアLPIPSとの明確なトレードオフを明らかにした。
これらの結果は、アイデンティティメトリクスのみではなく、アイデンティティ整合性、テキストアライメント、表現多様性を通じてパーソナライズされた生成を評価するべきであることを示唆している。
関連論文リスト
- REAR: Test-time Preference Realignment through Reward Decomposition [68.09214603569744]
本稿では,タスクを階層化問題としてモデル化する新しいフレームワークを提案する。
これら2つの報酬項の比率を選択的に再スケールするREAR(Realignment Reward)を導出する。
我々は,REARをトークンレベルのポリシログ確率の線形結合として定式化することができ,様々なTSアルゴリズムと容易に統合できることを示す。
論文 参考訳(メタデータ) (2026-06-29T14:17:53Z) - HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection [52.11418741192251]
本稿では,カテゴリ中心を微粒な画像の手がかりと整合させて調整する非対称なプロンプトフレームワークを提案する。
具体的には、一貫した代表パターンをキャプチャする一組のプロンプトを導入し、実際のコンテンツの統一アンカーとして機能する。
2)偽のカテゴリでは,サンプル適応型プロンプトを構築し,異なるサンプルから多様な手がかりを抽出し,偽画像の変動を適応的にモデル化する。
論文 参考訳(メタデータ) (2026-05-26T01:20:18Z) - PERL: Parameter Efficient Reasoning in CLIP Latent Space [11.607257085664727]
PERLは、凍結したCLIPモデルを拡張し、コンパクトな共用推論モジュールを繰り返し適用する軽量適応フレームワークである。
PerLは、高速適応数ショット設定で比較した手法の中で最高のパラメータ性能トレードオフを達成する。
以上の結果から,反復潜在推論は,ディスクネイティブな視覚言語モデルにおけるパラメータスケーリングに相補的適応機構を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-05-18T14:25:25Z) - EXACT: Explicit Attribute-Guided Decoding-Time Personalization [11.035465374731563]
EXACTは新しいデコード時のパーソナライゼーションで、生成とペアの好みのフィードバックを限定的に調整する。
EXACTは、好みのモデリング精度やパーソナライズされた生成品質など、強いベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-06T14:53:37Z) - Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning [51.99383151474742]
デュアルプロンプトチューニングに基づくアクティブCLIP適応のためのロバストな不確実性モデリングフレームワークを提案する。
提案手法は,同一のアノテーション予算の下で,既存のアクティブラーニング手法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-02-04T09:01:55Z) - Parallel Rescaling: Rebalancing Consistency Guidance for Personalized Diffusion Models [3.1964044595140217]
パーソナライズされた拡散モデルのための並列再スケーリング手法を提案する。
従来のパーソナライズ手法とは異なり、我々の手法では追加のトレーニングデータや高価なアノテーションを必要としない。
論文 参考訳(メタデータ) (2025-05-31T15:36:36Z) - Benchmarking Unified Face Attack Detection via Hierarchical Prompt Tuning [58.16354555208417]
PADとFFDはそれぞれ物理メディアベースのプレゼンテーションアタックとデジタル編集ベースのDeepFakeから顔データを保護するために提案されている。
これら2つのカテゴリの攻撃を同時に処理する統一顔攻撃検出モデルがないことは、主に2つの要因に起因する。
本稿では,異なる意味空間から複数の分類基準を適応的に探索する,視覚言語モデルに基づく階層型プロンプトチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T16:35:45Z) - Improving Diversity in Zero-Shot GAN Adaptation with Semantic Variations [61.132408427908175]
0ショットのGAN適応は、よく訓練されたジェネレータを再利用して、目に見えないターゲットドメインの画像を合成することを目的としている。
実際の画像の代わりに1つの代表的テキスト機能しか持たないため、合成された画像は徐々に多様性を損なう。
そこで本研究では,CLIP空間における対象テキストの意味的変化を見つけるための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-08-21T08:12:28Z) - Fine-grained Retrieval Prompt Tuning [149.9071858259279]
微粒な検索プロンプトチューニングは, サンプルプロンプトと特徴適応の観点から, きめの細かい検索タスクを実行するために, 凍結した事前学習モデルを操る。
学習可能なパラメータが少ないFRPTは、広く使われている3つの細粒度データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2022-07-29T04:10:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。