論文の概要: LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.04801v1
- Date: Mon, 06 Jul 2026 08:33:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.088451
- Title: LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models
- Title(参考訳): LILAC:拡散モデルの多概念カスタマイズのための層幅独立ロラとカスケード条件
- Abstract要約: 共有重み空間において独立に訓練された概念アダプタを融合させる方法は、アイデンティティの混乱とスタイルの出血に悩まされる。
LILACは、独立に訓練された低ランクアダプタを推論時に構成するフレームワークである。
LILACは、ジョイントトレーニングなしでアダプタを構成し、概念の数を線形にスケールし、バックボーンに依存しない。
- 参考スコア(独自算出の注目度): 4.220963314690644
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Personalizing text-to-image diffusion models to render several specific subjects in a coherent image remains challenging: the model must preserve each subject's identity while keeping the scene spatially and visually coherent. Methods that fuse independently trained concept adapters in a shared weight space (via federated averaging, gradient fusion, or orthogonality constraints) suffer from identity confusion and style bleeding and require joint retraining. In this work, we show that composing concepts as separate image layers, instead of merging their adapters in a shared weight space, avoids parameter-level interference. We introduce LILAC, a framework that composes independently trained low-rank adapters at inference time: each subject is conditioned on the frozen composite of previously placed subjects, with exactly one adapter active at a time, therefore identities never interfere at the parameter level. LILAC composes the adapters without any joint training, scales linearly with the number of concepts, and is backbone-agnostic. Under the Orthogonal Adaptation protocol, LILAC applied on Qwen-Image-Edit reaches an ArcFace detection rate of 0.861, while Orthogonal Adaptation reports 0.745 in its original setting. Adaptation reports 0.745 in its original setting. Code is available at https://github.com/marianlupascu/LILAC.
- Abstract(参考訳): テキストと画像の拡散モデルをパーソナライズして、複数の特定の被写体をコヒーレントなイメージで表現することは、依然として困難である: モデルは、シーンを空間的に、視覚的にコヒーレントに保つ一方で、各被写体のアイデンティティを保存しなければならない。
共有重み空間において独立に訓練された概念アダプタを融合させる方法(平均化、勾配融合、直交性制約など)は、アイデンティティの混乱とスタイルの出血に悩まされ、関節再訓練を必要とする。
本研究では,共用重み空間にアダプタをマージする代わりに,イメージ層を分離して構成することで,パラメータレベルの干渉を回避することを提案する。
LILACは, 個別に訓練された低ランクアダプタを推論時に構成するフレームワークである。各被験者は, 予め配置された被験者の凍結した複合材に条件付きであり, 正確に1つのアダプタが同時にアクティブであるため, パラメータレベルでの同一性は決して干渉しない。
LILACは、ジョイントトレーニングなしでアダプタを構成し、概念の数を線形にスケールし、バックボーンに依存しない。
Orthogonal Adaptation プロトコルでは、Qwen-Image-Edit で適用された LILAC は ArcFace 検出率 0.861 に達し、Orthogonal Adaptation は 0.745 である。
適応性はオリジナルの設定で0.745である。
コードはhttps://github.com/marianlupascu/LILACで入手できる。
関連論文リスト
- Spiking Local Interaction and Adaptive Complementary Fusion for Spiking Transformer [19.12698354620558]
スパイキング・トランスフォーマーは、主にスパイキング・セルフアテンション(SSA)を介してトークン相互作用をモデル化する
Spiking Local Interaction (SLI) と Adaptive Complementary Fusion (ACF) を紹介する。
ACFはSSAとSLIを、異なるネットワーク深さでのコントリビューションを適応的にバランスする層特異的なチャネルワイド係数を通じて統合する。
論文 参考訳(メタデータ) (2026-08-11T14:23:26Z) - UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation [65.53694602893042]
VLMエンコーディングの前にVTとVAE機能を融合した統合ビジュアルコンディショニングフレームワークを提案する。
2つのマルチ参照生成ベンチマークの実験により、UniCustomは主題の一貫性、命令従順、構成の忠実さを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-05-12T13:10:05Z) - FREE-Switch: Frequency-based Dynamic LoRA Switch for Style Transfer [9.620935385956885]
オープンソースアダプタは、さまざまなシーンやオブジェクトに対して、同じ拡散バックボーンでトレーニングされる。
我々のフレームワークは、異なるオブジェクトやスタイルのアダプタを効率的に組み合わせ、高品質なカスタマイズ生成のトレーニングコストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-11T04:32:59Z) - Diffusion-Guided Mask-Consistent Paired Mixing for Endoscopic Image Segmentation [57.37991748282666]
本稿では, 試料混合と拡散合成の強度を融合した拡散誘導型パラダイムを提案する。
各実画像について、合成対を同じマスクの下で生成し、その対をマスク一貫性ペアドミキシング(MCPMix)の制御可能な入力として使用する。
これは、共有幾何学の下で合成および実際の外観を円滑にブリッジする中間サンプルの連続的な族を生成する。
論文 参考訳(メタデータ) (2025-11-05T06:14:19Z) - DyME: Dynamic Multi-Concept Erasure in Diffusion Models with Bi-Level Orthogonal LoRA Adaptation [11.480659591569308]
テキストから画像への拡散モデルは、著作権のあるスタイルを不注意に再現し、視覚的概念を保護し、法的および倫理的懸念を提起する。
概念消去は、微調整によってそのような概念を選択的に抑制することを目的とした安全保護として登場した。
我々は、軽量でコンセプト固有のLoRAアダプタを訓練し、推論に必要なものだけを動的に構成するオンデマンド消去フレームワークDyMEを提案する。
論文 参考訳(メタデータ) (2025-09-25T15:16:17Z) - AdaRing: Towards Ultra-Light Vision-Language Adaptation via Cross-Layer Tensor Ring Decomposition [41.654675205772485]
本稿では,多層テンソルリング分解(TRD)に基づく視覚言語微調整フレームワークAdaRingを提案する。
実験の結果,提案したAdaRingは,平均トレーニングパラメータを90%削減しつつ,最先端の性能を実現していることがわかった。
論文 参考訳(メタデータ) (2025-08-16T01:56:27Z) - Appearance Matching Adapter for Exemplar-based Semantic Image Synthesis in-the-Wild [29.23745176017559]
例題ベースセマンティック画像合成は、例題の外観を保ちながら意味内容と整合した画像を生成する。
最近のチューニングフリーアプローチでは、暗黙のクロスイメージマッチングを通じて局所的な外観を転送することでこの問題に対処している。
そこで本稿では,AM-Adapterを用いて,先進的なセマンティック画像合成手法を提案する。
論文 参考訳(メタデータ) (2024-12-04T09:17:47Z) - Decoupled Data Augmentation for Improving Image Classification [37.50690945158849]
Decoupled Data Augmentation (De-DA)を導入する。
生成モデルを用いて、制御条件下での実際のCDPの修正を行い、セマンティック一貫性を保つ。
また、画像のCIPをクラス間変種に置き換え、多様なCDP-CIPの組み合わせを作成します。
論文 参考訳(メタデータ) (2024-10-29T06:27:09Z) - Towards Optimal Aggregation of Varying Range Dependencies in Haze Removal [17.29370328189668]
既存の手法は、局所的な詳細を保存するための短距離依存関係や、グローバルなコンテキストを捉えるための長距離依存関係を専門にすることで、顕著な成功を収めている。
DehazeMaticを提案する。これは、デュアルストリーム設計により、短距離および長距離の両方の依存関係を同時に、かつ明示的にキャプチャする。
論文 参考訳(メタデータ) (2024-08-22T11:51:50Z) - Refign: Align and Refine for Adaptation of Semantic Segmentation to
Adverse Conditions [78.71745819446176]
Refignは、ドメイン間の通信を利用する自己学習ベースのUDAメソッドへの汎用的な拡張である。
Refign は,(1) 不確実性を認識した高密度マッチングネットワークを用いて,正常条件画像と対応する悪条件画像とを整列させ,(2) 適応ラベル補正機構を用いて正常予測で悪条件予測を精査する。
このアプローチでは、追加のトレーニングパラメータや、トレーニングのみの計算オーバーヘッドの最小化は導入されず、任意の自己学習ベースのUDAメソッドを改善するためにドロップイン拡張として使用することができる。
論文 参考訳(メタデータ) (2022-07-14T11:30:38Z) - Decoupled Multi-task Learning with Cyclical Self-Regulation for Face
Parsing [71.19528222206088]
顔解析のための周期的自己統制型デカップリング型マルチタスク学習を提案する。
具体的には、DML-CSRは、顔解析、バイナリエッジ、カテゴリエッジ検出を含むマルチタスクモデルを設計する。
提案手法は,Helen,CelebA-HQ,LapaMaskのデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2022-03-28T02:12:30Z) - Locally Masked Convolution for Autoregressive Models [107.4635841204146]
LMConvは標準的な2Dコンボリューションの簡単な修正であり、任意のマスクを画像の各位置の重みに適用することができる。
我々は,パラメータを共有するが生成順序が異なる分布推定器のアンサンブルを学習し,全画像密度推定の性能を向上させる。
論文 参考訳(メタデータ) (2020-06-22T17:59:07Z) - High-Order Information Matters: Learning Relation and Topology for
Occluded Person Re-Identification [84.43394420267794]
本稿では,高次関係とトポロジ情報を識別的特徴とロバストなアライメントのために学習し,新しい枠組みを提案する。
我々のフレームワークはOccluded-Dukeデータセットで最先端の6.5%mAPスコアを大幅に上回っている。
論文 参考訳(メタデータ) (2020-03-18T12:18:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。