論文の概要: Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation
- arxiv url: http://arxiv.org/abs/2608.06751v1
- Date: Fri, 07 Aug 2026 03:17:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.336996
- Title: Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation
- Title(参考訳): スターリーナイトを超えて - アーティストを囲むテキストから画像生成のためのショートカット対応制御状態プランニング
- Abstract要約: Atelierは、アーティストによる画像生成のためのショートカット対応の制御状態計画フレームワークである。
ArtIntentBenchは、Van Gogh氏とQi Baishi氏による、アートの再レンダリング、周期/スタイル制御世代をカバーするベンチマークである。
- 参考スコア(独自算出の注目度): 35.53038441504792
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Artist-grounded image generation requires more than appending an artist name to a prompt. Image models often respond to artist names through canonical shortcuts, such as recurring motifs, generic palettes, or overrepresented period signatures, rather than preserving the user's intended scene. We introduce Atelier, a shortcut-aware control-state planning framework for artist-grounded image generation. Atelier translates underspecified artistic intent into an explicit control state that separates scene anchors, preserve/transform decisions, style-regime hypotheses, role-bound artist evidence, and shortcut-avoidance constraints. It grounds this state using artist-level knowledge and local patch references, compiles backend-aware generation plans, and iteratively refines candidates through global and local authenticity feedback. We further introduce ArtIntentBench, a benchmark covering Van Gogh and Qi Baishi across artwork re-rendering, period/style-controlled generation, historically unseen subjects, shortcut auditing, and human preference evaluation. Across open-weight and closed-source generators, Atelier improves artist-level style fidelity, preserves source structure more faithfully, and substantially reduces shortcut substitution compared with prompt-engineered, retrieval-augmented, and general-purpose agent baselines. These results suggest that artist-grounded generation is bottlenecked not only by image synthesis, but by the upstream inference of explicit, evidence-grounded artistic controls.
- Abstract(参考訳): アーティストによる画像生成には、アーティスト名をプロンプトに付加する以上のものが必要だ。
イメージモデルは、しばしば、ユーザの意図したシーンを保存するのではなく、繰り返しモチーフ、ジェネリックパレット、あるいは過剰に表現された周期シグネチャといった、標準的なショートカットを通じてアーティスト名に応答する。
本稿では,アーティストグラウンド画像生成のための近距離対応制御状態計画フレームワークであるAtelierを紹介する。
アテリエは、特定されていない芸術的意図を、シーンアンカーを分離し、決定を保存/変換する明示的な制御状態、スタイル登録仮説、ロールバウンドなアーティストエビデンス、ショートカット回避制約に翻訳する。
アーティストレベルの知識とローカルパッチ参照を使用し、バックエンド対応生成計画をコンパイルし、グローバルおよびローカルな認証フィードバックを通じて候補を反復的に洗練する。
さらに,Van GoghとQi Baishiを対象とするベンチマークであるArtIntentBenchを紹介する。
オープンウェイトおよびクローズドソースジェネレータ全体で、Atelierはアーティストレベルの忠実さを改善し、ソース構造をより忠実に保存し、プロンプトエンジニアリング、検索強化、汎用エージェントベースラインと比較して、ショートカット置換を大幅に削減する。
これらの結果は, 画像合成だけでなく, 明示的, 証拠的, 芸術的制御による上流の推測によって, アーティストグラウンド生成がボトルネックとなることを示唆している。
関連論文リスト
- MythraGen: Two-Stage Retrieval Augmented Art Generation Framework [11.27056623462154]
本手法は,アーティスト固有のスタイルとコンテンツを組み合わせることで,大規模アートデータセットから特徴を抽出し,生成プロセスを最適化する。
提案手法は,ユーザの入力と密に一致したアートワークを生成できる。
論文 参考訳(メタデータ) (2026-06-22T07:02:33Z) - The Name-Free Gap: Policy-Aware Stylistic Control in Music Generation [4.654067937895813]
そこで本研究では,軽量で可読性の高い記述子が,文体制御の代替手段となるか検討する。
我々は、ビリー・アイリッシュ(ボーカルポップ)とルドヴィコ・アイナウディ(インストラクタルピアノ)の2人のアーティストを評価する。
その結果、アーティスト名は両アーティストの中で最も強いコントロールシグナルであり、名前のない記述者がこの効果の多くを回復していることがわかった。
論文 参考訳(メタデータ) (2025-08-31T01:27:16Z) - Identifying Prompted Artist Names from Generated Images [59.34482128911978]
テキスト・ツー・イメージの一般的な使用法は、アーティストを明示的に命名することで画像を生成することである。
本稿では,プロンプトアーティスト認識のためのベンチマークを紹介する。
データセットには110人のアーティストをカバーする195万の画像が含まれている。
論文 参考訳(メタデータ) (2025-07-24T17:59:44Z) - ArtistAuditor: Auditing Artist Style Pirate in Text-to-Image Generation Models [61.55816738318699]
本稿では,テキスト・画像生成モデルにおける新しいデータ利用監査手法を提案する。
ArtistAuditorは、多彩なスタイルの表現を得るためにスタイル抽出器を使用し、アートワークをアーティストのスタイルのサンプリングとして扱う。
6つのモデルとデータセットの組み合わせによる実験結果は、ArtistAuditorが高いAUC値を達成可能であることを示している。
論文 参考訳(メタデータ) (2025-04-17T16:15:38Z) - Rethinking Artistic Copyright Infringements in the Era of Text-to-Image Generative Models [47.19481598385283]
ArtSavantは、ウィキアートの作品の参照データセットと比較することで、アーティストのユニークなスタイルを決定するツールである。
そこで我々は,3つの人気テキスト・画像生成モデルにまたがる芸術的スタイルの複製の頻度を定量的に把握するために,大規模な実証的研究を行った。
論文 参考訳(メタデータ) (2024-04-11T17:59:43Z) - Learning Subject-Aware Cropping by Outpainting Professional Photos [69.0772948657867]
本稿では,高品質な主観的作物を生産する要因を,プロのストックイメージから学習するための弱教師付きアプローチを提案する。
私たちの洞察は、ストックイメージのライブラリと、最新のトレーニング済みのテキスト-画像拡散モデルを組み合わせることです。
我々は、収穫された無作為のトレーニングペアの大規模なデータセットを自動的に生成して、収穫モデルをトレーニングすることができる。
論文 参考訳(メタデータ) (2023-12-19T11:57:54Z) - LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image
Generation [121.45667242282721]
レイアウト計画と画像生成を実現するための粗大なパラダイムを提案する。
提案手法は,フォトリアリスティックなレイアウトと画像生成の観点から,最先端のモデルよりも優れている。
論文 参考訳(メタデータ) (2023-08-09T17:45:04Z) - QuantArt: Quantizing Image Style Transfer Towards High Visual Fidelity [94.5479418998225]
視覚的忠実度の高いスタイリングのためのQuantArtと呼ばれる新しいスタイル転送フレームワークを提案する。
本フレームワークは,既存のスタイル転送方式と比較して,視覚的忠実度を著しく向上させる。
論文 参考訳(メタデータ) (2022-12-20T17:09:53Z) - Continuation of Famous Art with AI: A Conditional Adversarial Network
Inpainting Approach [1.713291434132985]
本研究は,画像インペインティングを応用して,有名な美術品を継続し,コンディショナルGANで生成芸術を制作するものである。
塗装GANは、対向的・絶対的な差分損失を最小化して、中心作物から原像を復元する学習を行う。
画像はトリミングではなくリサイズされ、ジェネレータへの入力として提示される。
学習プロセスの後、ジェネレータは元の部品の端から連続して新しい画像を生成する。
論文 参考訳(メタデータ) (2021-10-18T10:39:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。