論文の概要: High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control
- arxiv url: http://arxiv.org/abs/2607.06162v1
- Date: Tue, 07 Jul 2026 11:36:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.503825
- Title: High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control
- Title(参考訳): グローバルブループリント誘導とレイアウト制御による高分解能アートワーク露光
- Abstract要約: 高解像度の露光は、特にアートワークのシナリオにおいて、固定されたソースイメージを中心に一般的に行われる。
既存のアプローチは、まだ3つの重要な制限に悩まされている。
レイアウト制御可能な高分解能露光のためのグローバルブループリント誘導2段階拡散フレームワークを提案する。
- 参考スコア(独自算出の注目度): 14.148969715339996
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Image outpainting extends an image beyond its original borders, requiring seamless style integration and globally coherent scene completion. Building on the success of diffusion models, recent methods have achieved substantial improvements in visual quality. In practice, however, high-resolution outpainting is commonly performed via progressive expansion around a fixed source image, particularly in artwork scenarios. Despite this progress, existing approaches still suffer from three key limitations: (i) the absence of a reliable global planning mechanism, which leads to structural instability and error accumulation at high resolutions; (ii) limited spatial controllability beyond text prompts, making it difficult to place objects at user-specified locations; and (iii) high inference latency caused by inherently sequential patch generation. To address these issues, we propose a global blueprint-guided two-stage diffusion framework for layout-controllable high-resolution outpainting with efficient parallel synthesis. In Stage 1, we generate a low-resolution global blueprint using a layout adapter that injects bounding-box conditions into a Stable Diffusion inpainting backbone, producing a globally consistent structural plan while extracting global guidance features. In Stage 2, we synthesize high-resolution local patches in parallel by injecting the blueprint-derived global guidance and initializing each patch from the blueprint using the low-frequency preservation property of forward diffusion. This design eliminates sequential dependency while maintaining global coherence. Extensive experiments on large-scale artwork datasets demonstrate improved visual fidelity, stronger semantic consistency, and substantially reduced inference time compared to prior baselines, while uniquely supporting explicit layout control for artwork outpainting.
- Abstract(参考訳): 画像の描画は、元の境界を越えて画像を拡大し、シームレスなスタイルの統合とグローバルな一貫性のあるシーン補完を必要とします。
拡散モデルの成功に基づいて、近年の手法は視覚的品質を大幅に改善した。
しかし、実際には、特にアート作品のシナリオにおいて、高解像度の露光は、固定されたソースイメージの周囲のプログレッシブ展開によって行われるのが一般的である。
この進歩にもかかわらず、既存のアプローチは以下の3つの重要な制限に悩まされている。
(i)高解像度での構造不安定性及びエラー蓄積につながる信頼性のあるグローバルプランニング機構が存在しないこと。
(ii)テキストプロンプト以外の空間制御性に制限があり、ユーザが指定した場所にオブジェクトを置くことが困難になる。
第三に、本質的にシーケンシャルなパッチ生成による高い推論遅延。
これらの問題に対処するため,レイアウト制御可能な高分解能露光のためのグローバルなブループリント誘導2段階拡散フレームワークを提案する。
ステージ1では,安定拡散塗装バックボーンにバウンディングボックス条件を注入するレイアウトアダプタを用いて,低解像度のグローバルブループリントを生成し,グローバル誘導機能を抽出しながら,一貫した構造計画を生成する。
ステージ2では、青写真由来のグローバルガイダンスを注入し、フォワード拡散の低周波保存特性を用いて青写真から各パッチを初期化することにより、高分解能局所パッチを並列に合成する。
この設計は、グローバルコヒーレンスを維持しながらシーケンシャルな依存を取り除く。
大規模なアートワークデータセットに対する大規模な実験は、視覚的忠実性の向上、より強力なセマンティック一貫性、事前のベースラインに比べて推論時間を大幅に短縮する一方で、アートワークの描画に対する明示的なレイアウト制御を独自にサポートしている。
関連論文リスト
- Structure-Semantic Decoupled Modulation of Global Geospatial Embeddings for High-Resolution Remote Sensing Mapping [4.025673425380818]
微細な高解像度リモートセンシングマッピングは通常、局所的な視覚的特徴に依存している。
本稿では,グローバルな表現をモーダル・インジェクション・パスに分離する構造意味分離変調フレームワークを提案する。
本手法は,既存の相互拡散法と比較して最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-04-21T15:42:34Z) - Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers [49.08465459791972]
テキスト・画像生成における領域命令によるレイアウト制御は非常に実用的だが、既存の手法は制限に悩まされている。
地域生成を異なるレイヤとしてモデル化し、生成中にそれらを結合することにより、LayerBindを提案する。
論文 参考訳(メタデータ) (2026-03-06T00:09:49Z) - Scale-DiT: Ultra-High-Resolution Image Generation with Hierarchical Local Attention [50.391914489898774]
Scale-DiTは、階層的な局所的注意を低解像度のグローバルガイダンスで導入する新しい拡散フレームワークである。
軽量なLoRA適応は、デノナイズ中のグローバルパスとローカルパスをブリッジし、構造と詳細の整合性を確保する。
実験によると、Scale-DiTは2ドル以上の高速な推論とメモリ使用量の削減を実現している。
論文 参考訳(メタデータ) (2025-10-18T03:15:26Z) - Ultra High-Resolution Image Inpainting with Patch-Based Content Consistency Adapter [47.512192547392026]
Patch-Adapterは高解像度テキスト誘導画像の描画に有効なフレームワークである。
提案手法は,正確な内容の整合性を維持しつつ4K以上の分解能を達成し,迅速なアライメントを実現する。
実験によると、Patch-Adapterは、大規模な塗布に共通するアーティファクトを解決するだけでなく、最先端のパフォーマンスも達成している。
論文 参考訳(メタデータ) (2025-10-15T11:18:24Z) - Local-Global Context-Aware and Structure-Preserving Image Super-Resolution [23.87231269881077]
安定拡散(Stable Diffusion)のような事前訓練されたテキスト・ツー・イメージモデルは、リアルな画像コンテンツを合成する強力な能力を示した。
本稿では,局所的およびグローバルな画素関係を効果的に維持する,文脈的に正確な画像超解像フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-11T07:17:31Z) - From Missing Pieces to Masterpieces: Image Completion with Context-Adaptive Diffusion [98.31811240195324]
ConFillは、各拡散ステップで生成された画像とオリジナル画像の差を小さくする新しいフレームワークである。
現行の手法より優れており、画像補完の新しいベンチマークが設定されている。
論文 参考訳(メタデータ) (2025-04-19T13:40:46Z) - HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance [70.69373563281324]
HiFlowはトレーニング不要でモデルに依存しないフレームワークで、事前トレーニングされたフローモデルの解像度ポテンシャルを解放する。
HiFlowはT2Iモデルの高解像度画像合成の品質を大幅に向上させる。
論文 参考訳(メタデータ) (2025-04-08T17:30:40Z) - Multi-Scale Diffusion: Enhancing Spatial Layout in High-Resolution Panoramic Image Generation [12.588962705218103]
本稿では,パノラマ画像生成フレームワークを複数の解像度レベルまで拡張する最適化フレームワークであるMulti-Scale Diffusion(MSD)を紹介する。
本手法は勾配降下法を利用して低解像度画像の構造情報を高解像度出力に組み込む。
論文 参考訳(メタデータ) (2024-10-24T15:18:51Z) - InfinityGAN: Towards Infinite-Resolution Image Synthesis [92.40782797030977]
任意の解像度画像を生成するinfinityganを提案する。
少ない計算資源でパッチバイパッチをシームレスに訓練し、推論する方法を示す。
論文 参考訳(メタデータ) (2021-04-08T17:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。