論文の概要: CLeaR: A Unified Framework for Resolving the Leakage-Degradation Dilemma in Style Transfer
- arxiv url: http://arxiv.org/abs/2609.38136v1
- Date: Tue, 29 Sep 2026 17:54:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.816273
- Title: CLeaR: A Unified Framework for Resolving the Leakage-Degradation Dilemma in Style Transfer
- Title(参考訳): CLeaR:スタイル転送における漏洩劣化ジレンマの解消のための統一フレームワーク
- Abstract要約: CLeaRは、コンテンツリード型スタイル転送のためのトレーニング不要のフレームワークである。
CLeaRはスタイルアライメントを改善し、コンテンツのリークを低減し、LCM-as-Judge評価を改善する。
- 参考スコア(独自算出の注目度): 1.8257640621825584
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Style transfer aims to render target content in the style of a reference image, but existing methods often suffer from content leakage, where objects, layouts, or semantics from the style reference appear in the generated output. Although prior data-driven and training-free methods can reduce leakage, they often face a leakage-degradation dilemma: stronger content suppression may weaken style fidelity, while richer style preservation may reintroduce unwanted reference content. We identify this dilemma across the full style-transfer pipeline, including feature separation, feature-space grounding, and diffusion generation. To address these issues, we propose CLeaR, a training-free framework for content-leakage-resistant style transfer. CLeaR first uses Orthogonal Subspace Projection to define content-reduced style targets in each vision foundation model (VFM) feature space. It then performs Ensemble Inversion, which optimizes a shared pixel-space style anchor satisfying style constraints across multiple VFMs. Finally, Energy-Guided Calibration maintains style alignment during diffusion sampling by steering the denoising trajectory toward the ensemble-defined style manifold. We further provide a theoretical analysis showing that the style-anchor estimation error decreases with the number of VFMs. Experiments on StyleBench demonstrate that CLeaR improves style alignment, reduces content leakage, and achieves better LLM-as-Judge evaluation compared with existing methods. The code is available at \href{https://github.com/0606zt/CLeaR}{https://github.com/0606zt/CLeaR}.
- Abstract(参考訳): スタイル転送は、対象のコンテンツを参照イメージのスタイルでレンダリングすることを目的としているが、既存のメソッドは、オブジェクト、レイアウト、あるいは、スタイル参照からのセマンティクスが生成された出力に現れるコンテンツリークに悩まされることが多い。
より強いコンテンツ抑制はスタイルの忠実性を弱め、よりリッチなスタイル保存は不要な参照コンテンツを再導入する。
我々は,このジレンマを,特徴分離,特徴空間の接地,拡散生成を含む全スタイル転送パイプラインで識別する。
これらの問題に対処するため、コンテンツに耐性のあるスタイル転送のためのトレーニングフリーフレームワークであるCLeaRを提案する。
CLeaRは、まずOrthogonal Subspace Projectionを使用して、各ビジョンファウンデーションモデル(VFM)の機能空間において、コンテンツ再生スタイルのターゲットを定義する。
次に、複数のVFM間のスタイル制約を満たす共有ピクセル空間スタイルアンカーを最適化するEnsemble Inversionを実行する。
最後に、Energy-Guided Calibrationは、拡散サンプリング中のスタイルアライメントを維持する。
さらに,VFM数に応じてスタイル・アンカー推定誤差が減少することを示す理論的解析を行った。
StyleBenchの実験では、CLeaRはスタイルアライメントを改善し、コンテンツのリークを低減し、既存の手法と比較してLCM-as-Judgeの評価が優れていることが示されている。
コードは \href{https://github.com/0606zt/CLeaR}{https://github.com/0606zt/CLeaR} で公開されている。
関連論文リスト
- Scale-Separated Conditioning for Style-Encoder-Free Diffusion Stylization [12.40744753451573]
拡散トランスのためのスタイルエンコーダフリーコンディショニングフレームワークを提案する。
スタイルエンコーダフリースチル化(SEFS)は、単一の訓練画像の低解像度の作物からスタイルトークンを形成する。
芸術的スタイリゼーションベンチマークでは、SEFSはコンテンツの一貫性とリーク診断を改善している。
論文 参考訳(メタデータ) (2026-08-20T07:17:22Z) - FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining [42.06209840326987]
スタイルコンテンツ二重参照生成は、異なるスタイル参照のスタイルを採用しながら、コンテンツ参照の構造とセマンティクスを保存するイメージを合成することを目的としている。
主なボトルネックは、クリーンなコンテンツスタイルの分離と広いロングテールスタイルのカバレッジを備えた大規模トリプルデータがないことだ。
コミュニティLoRAマイニングに基づくスケーラブルなデュアル参照生成フレームワークであるFreeStyleを提案する。
論文 参考訳(メタデータ) (2026-06-18T17:24:27Z) - CleanStyle: Plug-and-Play Style Conditioning Purification for Text-to-Image Stylization [5.300721419484575]
CleanStyleはプラグイン・アンド・プレイのフレームワークで、コンテンツ関連のノイズをリトレーニングすることなく、スタイルの埋め込みからフィルタリングする。
CleanStyleSVDは、タイムアウェアな指数スケジュールを使用して、テールコンポーネントを動的に抑制する。
SS-CFGはテールコンポーネントを再利用し、スタイル対応の無条件入力を構築する。
論文 参考訳(メタデータ) (2026-02-24T09:33:05Z) - Structure-Level Disentangled Diffusion for Few-Shot Chinese Font Generation [18.601789249339014]
中国のフォント生成は、少数の参照画像のみを使用して、ターゲットスタイルで新しい文字を合成することを目的としている。
既存のアプローチは機能レベルのアンタングルのみを達成するため、ジェネレータはこれらの機能を再アンタングルすることができる。
本研究では,2つのチャンネルからコンテンツとスタイル情報を受信する構造レベル分散拡散モデルを提案する。
論文 参考訳(メタデータ) (2026-02-21T15:41:06Z) - Only-Style: Stylistic Consistency in Image Generation without Content Leakage [21.68241134664501]
Only-Styleは、スタイリスティックな一貫性を維持しつつ、セマンティックなコヒーレントな方法でコンテンツの漏洩を軽減するために設計された方法である。
Only-Styleは、推論中にコンテンツのリークをローカライズすることで、スタイルアライメントプロセスを制御するパラメータの適応的なチューニングを可能にする。
提案手法は,多種多様なインスタンスにまたがる広範囲な評価により,最先端の手法よりも大幅に改善されたことを示す。
論文 参考訳(メタデータ) (2025-06-11T16:33:09Z) - UniVST: A Unified Framework for Training-free Localized Video Style Transfer [102.52552893495475]
本稿では拡散モデルに基づく局所化ビデオスタイル転送のための統一フレームワークUniVSTを提案する。
トレーニングを必要とせずに動作し、ビデオ全体にわたってスタイルを転送する既存の拡散方法に対して、明確なアドバンテージを提供する。
論文 参考訳(メタデータ) (2024-10-26T05:28:02Z) - CCPL: Contrastive Coherence Preserving Loss for Versatile Style Transfer [58.020470877242865]
我々は,芸術的,写真的,映像的スタイルのトランスファーを共同で行うことができる汎用的なスタイルトランスファー手法を考案した。
我々は,グローバル不整合が局所的不整合に支配されているという軽度かつ合理的な仮定を定め,局所的パッチに適用した汎用的コントラストコヒーレンス保存損失(CCPL)を考案する。
CCPLは、スタイル化を低下させることなく、スタイル転送中のコンテンツソースのコヒーレンスを保存することができる。
論文 参考訳(メタデータ) (2022-07-11T12:09:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。