論文の概要: Through Van Gogh's Eyes: Global Style Transfer with Diffusion Model
- arxiv url: http://arxiv.org/abs/2608.11546v2
- Date: Thu, 13 Aug 2026 01:03:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.764146
- Title: Through Van Gogh's Eyes: Global Style Transfer with Diffusion Model
- Title(参考訳): ヴァン・ゴッホの眼を通して:拡散モデルによるグローバルスタイルの移動
- Authors: Jeongha Lee, Yujin Kim, Ghazanfar Ali, Suhyun Kim, Jae-In Hwang,
- Abstract要約: グローバル・スタイル・トランスファー(GST)は、ターゲットアーティストから複数のアート作品を集約し、共有されたグローバル・スタイルを単一のコンテンツ・イメージに転送する芸術的画像合成パラダイムである。
固定プロンプトの下で拡散モデルの中間特徴空間(h-space)における残差グローバルスタイルオフセットを学習するグローバルスタイルガイダンス(GSG)を提案する。
また,コンテンツイメージの意味的構造を保存するトレーニング不要な知覚誘導機構であるContent Alignment Guidance (CAG)を提案する。
- 参考スコア(独自算出の注目度): 11.65457603687309
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Artistic image synthesis aims to recreate the expressive visual identity of a target artist, yet existing methods often fail to capture an artist's global style. Conventional style transfer methods transfer the style of one or a few reference artworks to a content image in a One-to-One manner, making them effective for artwork-level stylization but limited in representing the broader stylistic distribution of an artist. Text-to-image diffusion models conditioned on artist names, such as '~ in Van Gogh style', offer greater flexibility, but they often suffer from text-induced bias and reproduce patterns from only a few iconic works. To address these limitations, we introduce Global Style Transfer (GST), an artistic image synthesis paradigm, in a Many-to-One manner, that aggregates multiple artworks from a target artist and transfers their shared global style to a single content image. For GST, we propose Global Style Guidance (GSG), which learns a residual global style offset in the intermediate feature space, or h-space, of a diffusion model under a fixed prompt. By learning artist-level style semantics purely from visual statistics, GSG mitigates text-dependent artistic bias. We further propose Content Alignment Guidance (CAG), a training-free perceptual guidance mechanism that preserves the semantic structure of the content image while allowing artist-specific geometric deformation. Experiments on WikiArt demonstrate that GST achieves superior stylistic fidelity, content preservation, and output diversity compared to existing style transfer and diffusion-based artistic synthesis methods.
- Abstract(参考訳): アーティスト画像合成は、ターゲットアーティストの表現力のある視覚的アイデンティティを再現することを目的としているが、既存の方法ではアーティストのグローバルなスタイルを捉えることができないことが多い。
従来型のスタイル転送手法では,1つないし少数の参照アートワークのスタイルを1対1でコンテンツイメージに転送することで,アートレベルのスタイリゼーションに有効だが,より広いスタイリスティックなアーティストの分布を表現できる。
ファン・ゴッホ風」のようなアーティスト名に条件付けされたテキスト・ツー・イメージの拡散モデルは、より柔軟性を提供するが、しばしばテキストによる偏見に悩まされ、いくつかの象徴的な作品からパターンを再現する。
これらの制約に対処するために,対象アーティストから複数のアート作品を集約し,その共有したグローバルなスタイルを単一のコンテンツイメージに転送する,芸術的な画像合成パラダイムであるGST(Global Style Transfer)を導入する。
GSTでは,中間特徴空間(h-space)における残差グローバルスタイルのオフセットを一定プロンプトの下で学習するグローバルスタイルガイダンス(GSG)を提案する。
アーティストレベルのセマンティクスを視覚統計から純粋に学習することで、GSGはテキスト依存の芸術的偏見を緩和する。
さらに、アーティスト固有の幾何学的変形を許容しつつ、コンテンツ画像の意味的構造を保存するトレーニング不要な知覚誘導機構であるContent Alignment Guidance (CAG)を提案する。
WikiArtの実験は、GSTが既存のスタイル転送や拡散に基づく芸術的合成法と比較して、優れたスタイル的忠実度、コンテンツ保存、出力多様性を達成することを示した。
関連論文リスト
- Learning Artistic Signatures: Symmetry Discovery and Style Transfer [8.288443063900825]
芸術様式の明確な定義はない。
スタイルは、局所的なテクスチャの配置を規定するグローバルな対称性のセットと考えるべきである。
局所的特徴とグローバル的特徴の両方を考慮し、リージェネレータと従来のテクスチャ尺度の両方を用いて、どちらの特徴セットよりもアーティスト間のスタイル的類似性を定量的に捉えることができることを示す。
論文 参考訳(メタデータ) (2024-12-05T18:56:23Z) - CreativeSynth: Cross-Art-Attention for Artistic Image Synthesis with Multimodal Diffusion [73.08710648258985]
レイアウト、視点、形状、意味といった重要な絵の属性は、しばしばスタイル転送によって伝達され、表現されない。
大規模な事前訓練された画像生成モデルは、大量の高品質な画像を合成できることを実証している。
我々の主要なアイデアは、スタイルを現実の世界に移すのではなく、多モーダルな意味情報を合成ガイドとしてアートに組み込むことである。
論文 参考訳(メタデータ) (2024-01-25T10:42:09Z) - ALADIN-NST: Self-supervised disentangled representation learning of
artistic style through Neural Style Transfer [60.6863849241972]
我々は、画像に描かれた意味的内容から、より強く絡み合った視覚芸術スタイルの表現を学習する。
スタイルと内容の絡み合いに強く対処することで、スタイル固有のメトリクスが大きく向上することを示します。
論文 参考訳(メタデータ) (2023-04-12T10:33:18Z) - StylerDALLE: Language-Guided Style Transfer Using a Vector-Quantized
Tokenizer of a Large-Scale Generative Model [64.26721402514957]
本論文では,自然言語を用いて抽象芸術スタイルを記述するスタイル転送手法であるStylerDALLEを提案する。
具体的には、非自己回帰的なトークンシーケンス変換として、言語誘導型転送タスクを定式化する。
スタイル情報を組み込むために,CLIPに基づく言語指導による強化学習戦略を提案する。
論文 参考訳(メタデータ) (2023-03-16T12:44:44Z) - QuantArt: Quantizing Image Style Transfer Towards High Visual Fidelity [94.5479418998225]
視覚的忠実度の高いスタイリングのためのQuantArtと呼ばれる新しいスタイル転送フレームワークを提案する。
本フレームワークは,既存のスタイル転送方式と比較して,視覚的忠実度を著しく向上させる。
論文 参考訳(メタデータ) (2022-12-20T17:09:53Z) - Inversion-Based Style Transfer with Diffusion Models [78.93863016223858]
以前の任意の例として誘導された芸術的画像生成法は、しばしば形状変化の制御や要素の伝達に失敗する。
画像のキー情報を効率よく正確に学習できるインバージョンベースのスタイル転送手法(InST)を提案する。
論文 参考訳(メタデータ) (2022-11-23T18:44:25Z) - AesUST: Towards Aesthetic-Enhanced Universal Style Transfer [15.078430702469886]
AesUSTは、新しいユニバーサルスタイルトランスファーアプローチである。
本研究では, 芸術作品の大規模なコーパスから, 普遍的な美的特徴を学習するための美的差別化手法を提案する。
また,モデルをより効果的にトレーニングするために,2つの審美規則を組み込んだ新しい2段階移動訓練戦略を開発した。
論文 参考訳(メタデータ) (2022-08-27T13:51:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。