論文の概要: Abstract-LoRA: Unlocking Single-Image Style Transfer through Targeted U-Net Block Training
- arxiv url: http://arxiv.org/abs/2609.13239v1
- Date: Thu, 03 Sep 2026 07:00:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 16:32:15.666562
- Title: Abstract-LoRA: Unlocking Single-Image Style Transfer through Targeted U-Net Block Training
- Title(参考訳): Abstract-LoRA: ターゲットU-Netブロックトレーニングによるシングルイメージスタイル転送のアンロック
- Abstract要約: シングルイメージスタイルの転送手法は、コンテンツ保存の不十分さや不適切なスタイルの忠実さに悩まされることが多い。
本稿では,特定のU-Netブロック上での軽量なLoRAトレーニングを通じて,単一イメージスタイル転送の境界を押し上げる方法であるAbstract-LoRAを提案する。
B-LoRAは,特定のU-Netブロックをトレーニングすることで,基本的なスタイル内容のゆがみを実現する方式である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion models represent one of the most advanced paradigms in generative modeling. Leveraging their development, a growing number of style transfer methods based on diffusion models have been proposed. However, among these methods, multi-image style transfer approaches that require at least five to ten style examples tend to achieve more satisfactory results. Single-image methods, by contrast, often struggle with either insufficient content preservation or inadequate style fidelity. This greatly limits style extraction from scarce artworks and undermines their artistic value. To address this, we propose Abstract-LoRA, a method that pushes the boundaries of single-image style transfer through lightweight LoRA training on specific U-Net blocks in diffusion models. Specifically, our work is inspired by B-LoRA, a style transfer method that achieves basic style-content disentanglement by training specific U-Net blocks. However, it suffers from a critical limitation: the inability to capture complex backgrounds. Building upon B-LoRA, our method conducts a more refined analysis of U-Net blocks, employing additional U-Net blocks and clustering-based abstraction of style images to better disentangle and balance style and content. Extensive experiments demonstrate that our proposed method not only generates visually more harmonious and satisfying artistic images but also quantitatively improves the preservation of both style and content in the final outputs.
- Abstract(参考訳): 拡散モデルは、生成モデリングにおける最も先進的なパラダイムの1つである。
それらの発展を生かして、拡散モデルに基づく多くのスタイル伝達法が提案されている。
しかし、これらの手法の中で、少なくとも5~10種類の例を必要とするマルチイメージスタイルの転送アプローチは、より良好な結果が得られる傾向にある。
対照的に、シングルイメージの手法は、コンテンツ保存の不十分さや、不適切なスタイルの忠実さに悩まされることが多い。
これにより、希少な美術品からのスタイルの抽出が大幅に制限され、その芸術的価値を損なうことになる。
そこで本研究では,分散モデルにおける特定のU-Netブロック上での軽量LoRAトレーニングを通じて,単一イメージスタイル転送の境界を押し上げる手法であるAbstract-LoRAを提案する。
具体的には,特定のU-Netブロックをトレーニングすることで,基本的なスタイル内容の絡み合いを実現するスタイル転送手法であるB-LoRAに着想を得た。
しかしそれは、複雑なバックグラウンドをキャプチャできないという、重大な制限に悩まされている。
提案手法は,B-LoRAをベースとしたU-Netブロックのより洗練された解析を行い,U-Netブロックの追加とクラスタリングによるスタイルイメージの抽象化により,スタイルとコンテンツの整合性とバランスを向上する。
広汎な実験により,提案手法は視覚的により調和し,満足な芸術的イメージを生成するだけでなく,最終出力におけるスタイルと内容の保存を定量的に改善することを示した。
関連論文リスト
- One-shot Embroidery Customization via Contrastive LoRA Modulation [20.463441212598273]
本稿では,単一参照画像で微細なスタイルとコンテンツ特徴を分離する,新しいコントラスト学習フレームワークを提案する。
細粒度スタイル転送の手法を評価するため,刺青カスタマイズのためのベンチマークを構築した。
論文 参考訳(メタデータ) (2025-09-23T12:58:15Z) - Less is More: Masking Elements in Image Condition Features Avoids Content Leakages in Style Transfer Diffusion Models [44.4106999443933]
スタイル参照画像からコンテンツとスタイルを効率的に分離するマスキング方式を提案する。
スタイル参照のイメージ特徴の特定の要素を単にマスキングすることで、批判的だが未調査の原則を明らかにする。
論文 参考訳(メタデータ) (2025-02-11T11:17:39Z) - DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer [13.588643982359413]
スタイル転送は、スタイル画像の芸術的表現をコンテンツ画像の構造情報と融合させることを目的としている。
既存の方法は特定のネットワークを訓練したり、事前訓練されたモデルを使ってコンテンツやスタイルの特徴を学習する。
本稿では,テキスト埋め込みと空間的特徴を組み合わせた,新しい学習不要なスタイル伝達手法を提案する。
論文 参考訳(メタデータ) (2024-10-19T06:42:43Z) - ZePo: Zero-Shot Portrait Stylization with Faster Sampling [61.14140480095604]
本稿では,4つのサンプリングステップでコンテンツとスタイルの融合を実現する拡散モデルに基づく,インバージョンフリーなポートレートスタイリングフレームワークを提案する。
本稿では,一貫性機能における冗長な特徴をマージする機能統合戦略を提案し,注意制御の計算負荷を低減させる。
論文 参考訳(メタデータ) (2024-08-10T08:53:41Z) - DiffStyler: Diffusion-based Localized Image Style Transfer [0.0]
画像スタイル転送は、色、ブラシストローク、形状など、スタイルターゲットの特徴的な特性を持つデジタルイメージを埋め込むことを目的としている。
任意のスタイル転送手法の進歩にもかかわらず、コンテンツセマンティクスとスタイル属性の微妙な均衡は依然として大きな課題である。
本稿ではDiffStylerについて紹介する。DiffStylerは、任意の画像スタイルの効率的な転送を容易にする新しいアプローチである。
論文 参考訳(メタデータ) (2024-03-27T11:19:34Z) - Implicit Style-Content Separation using B-LoRA [61.664293840163865]
一つの画像のスタイルとコンテンツコンポーネントを暗黙的に分離する手法であるB-LoRAを紹介する。
SDXLのアーキテクチャをLoRAと組み合わせて解析することにより、2つのブロックのLoRA重みを共同で学習することで、スタイル・コンテント分離を実現する。
論文 参考訳(メタデータ) (2024-03-21T17:20:21Z) - Ablating Concepts in Text-to-Image Diffusion Models [57.9371041022838]
大規模テキスト・画像拡散モデルでは、強力な構成能力を持つ高忠実度画像を生成することができる。
これらのモデルは典型的には膨大な量のインターネットデータに基づいて訓練されており、しばしば著作権のある資料、ライセンスされた画像、個人写真を含んでいる。
本稿では,事前訓練されたモデルにおいて,目標概念の生成を防止し,効率的に概念を宣言する手法を提案する。
論文 参考訳(メタデータ) (2023-03-23T17:59:42Z) - Domain Enhanced Arbitrary Image Style Transfer via Contrastive Learning [84.8813842101747]
Contrastive Arbitrary Style Transfer (CAST) は、新しいスタイル表現学習法である。
本フレームワークは,スタイルコード符号化のための多層スタイルプロジェクタ,スタイル分布を効果的に学習するためのドメイン拡張モジュール,画像スタイル転送のための生成ネットワークという,3つのキーコンポーネントから構成される。
論文 参考訳(メタデータ) (2022-05-19T13:11:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。