論文の概要: Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing
- arxiv url: http://arxiv.org/abs/2607.06136v1
- Date: Tue, 07 Jul 2026 10:52:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.498304
- Title: Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing
- Title(参考訳): 超高分解能画像編集のための調整不要潜時拡散モデル
- Authors: Wanglong Lu, Lingming Su, Kaijie Shi, Minglun Gong, Xiaogang Jin, Hanli Zhao, Xianta Jiang,
- Abstract要約: 本稿では,遅延拡散モデル(LDM)を超高解像度に拡張する,チューニング不要な画像編集フレームワークであるUltraDiffEditを紹介する。
我々は、潜在空間内の編集された視覚的詳細と未編集の視覚的詳細の両方を保存するためにマルチパッチ符号化を用いる。
また,局所的,中間的,グローバルな特徴を抽出し,セマンティック・コヒーレンスを確保し,デノナイジング時の詳細性を向上するパッチベースのハイブリッドサンプリング手法を導入する。
- 参考スコア(独自算出の注目度): 11.862248587214951
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent diffusion-based generative models have shown impressive performance in image generation and editing. However, due to memory limitations and the high cost of collecting high-resolution training images, existing methods are typically restricted to inputs with linear resolutions below 1K. In contrast, photos captured by modern mobile devices often reach linear resolutions up to 8K, revealing a significant gap between current capabilities and real-world demands. Simply upscaling low-resolution edited results often results in visually enlarged but blurry images that lack fine details. This paper introduces UltraDiffEdit, a novel, tuning-free image editing framework that extends off-the-shelf latent diffusion models (LDMs) to ultrahigh resolutions. UltraDiffEdit employs a multi-scale progressive editing strategy, iteratively blending high-resolution edited content with unedited areas in a coarse-to-fine manner. We employ multi-patch encoding to preserve both edited and unedited visual details within the latent space. To mitigate editing artifacts, our global-local consistency denoising technique consistently integrates edited and unedited latent features, ensuring smooth transition at editing boundaries from the latent representation to the final image. We also introduce a patch-based hybrid sampling approach that captures local, intermediate, and global features, ensuring semantic coherence and enhancing fine detail during denoising. We conduct extensive experiments demonstrating UltraDiffEdit's superior editing quality and flexibility: it can handle image resolutions up to 8K using only a single NVIDIA GeForce RTX 3090 GPU. The source code is publicly available at https://github.com/LonglongaaaGo/UltraDiffEdit.
- Abstract(参考訳): 近年の拡散型生成モデルは画像生成や編集において顕著な性能を示した。
しかし、メモリ制限と高解像度のトレーニング画像の収集コストのため、既存の手法は通常1K以下の線形解像度の入力に制限される。
対照的に、現代のモバイルデバイスで撮影された写真は、しばしば8Kまでのリニア解像度に達し、現在の能力と現実世界の需要の間に大きなギャップがあることが示される。
低解像度の編集結果を単純にアップスケールすると、細かな詳細を欠いた視覚的に拡大されるがぼやけた画像が生じる。
本稿では,LDM(オフザシェルフ潜時拡散モデル)を超高解像度に拡張する,新しいチューニング不要な画像編集フレームワークであるUltraDiffEditを紹介する。
UltraDiffEditはマルチスケールのプログレッシブな編集戦略を採用しており、未編集領域と高解像度の編集コンテンツを粗い方法で反復的にブレンドする。
我々は、潜在空間内の編集された視覚的詳細と未編集の視覚的詳細の両方を保存するためにマルチパッチ符号化を用いる。
編集アーティファクトを緩和するために、我々のグローバルな局所的整合化手法は、編集および未編集の潜在特徴を一貫して統合し、潜在表現から最終画像への編集バウンダリのスムーズな遷移を保証する。
また,局所的,中間的,グローバルな特徴を抽出し,セマンティック・コヒーレンスを確保し,デノナイジング時の詳細性を向上するパッチベースのハイブリッドサンプリング手法を導入する。
NVIDIA GeForce RTX 3090 GPUのみを使用して、画像解像度を最大8Kまで処理できる。
ソースコードはhttps://github.com/LonglongaaaGo/UltraDiffEditで公開されている。
関連論文リスト
- HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing [83.1290629939693]
プロやクリエイティブなアプリケーションには高解像度の画像編集が不可欠である。
現在のアプローチでは、イメージキャンバス全体を冗長に処理するか、大規模な高解像度データセットに依存している。
高速かつスケーラブルな高解像度画像編集のための領域対応階層拡散フレームワークであるHierEditを紹介する。
論文 参考訳(メタデータ) (2026-05-17T07:14:15Z) - EditCrafter: Tuning-free High-Resolution Image Editing via Pretrained Diffusion Model [15.14106323055504]
本研究では,チューニングなしで動作可能な高解像度画像編集手法であるEditCrafterを提案する。
我々は、事前訓練されたテキスト・ツー・イメージ(T2I)拡散モデルを利用して、トレーニング中に使用した画像よりもはるかに高い解像度で画像を処理する。
論文 参考訳(メタデータ) (2026-04-11T16:12:27Z) - Inverse-and-Edit: Effective and Fast Image Editing by Cycle Consistency Models [1.9389881806157316]
本研究では,一貫性モデルを用いた画像のインバージョンを改善する新しいフレームワークを提案する。
本手法では,再設計精度を大幅に向上するサイクル一貫性最適化手法を提案する。
さまざまな画像編集タスクやデータセットに対して,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-06-23T20:34:43Z) - Taming Rectified Flow for Inversion and Editing [57.3742655030493]
FLUXやOpenSoraのような定流拡散変換器は、画像生成やビデオ生成の分野で優れた性能を発揮している。
その堅牢な生成能力にもかかわらず、これらのモデルは不正確さに悩まされることが多い。
本研究では,修正流の逆流過程における誤差を軽減し,インバージョン精度を効果的に向上する訓練自由サンプリング器RF-rを提案する。
論文 参考訳(メタデータ) (2024-11-07T14:29:02Z) - TurboEdit: Text-Based Image Editing Using Few-Step Diffusion Models [53.757752110493215]
テキストベースの一般的な編集フレームワーク – 編集フレンドリーなDDPM-noiseインバージョンアプローチ – に注目します。
高速サンプリング法への適用を解析し、その失敗を視覚的アーティファクトの出現と編集強度の不足という2つのクラスに分類する。
そこで我々は,新しいアーティファクトを導入することなく,効率よく編集の規模を拡大する疑似誘導手法を提案する。
論文 参考訳(メタデータ) (2024-08-01T17:27:28Z) - FreeDiff: Progressive Frequency Truncation for Image Editing with Diffusion Models [44.26371926512843]
我々は、プログレッシブな$textbfFre$qu$textbfe$ncy truncationを用いて、ユニバーサル編集タスクのための$textbfDiff$usionモデルのガイダンスを洗練するために、新しいフリーアプローチを導入する。
本手法は,様々な編集タスクや多様な画像に対して,最先端の手法で比較結果を得る。
論文 参考訳(メタデータ) (2024-04-18T04:47:28Z) - DiffEditor: Boosting Accuracy and Flexibility on Diffusion-based Image
Editing [66.43179841884098]
大規模テキスト・ツー・イメージ(T2I)拡散モデルは、ここ数年で画像生成に革命をもたらした。
既存の拡散型画像編集における2つの弱点を正すためにDiffEditorを提案する。
本手法は,様々な精細な画像編集タスクにおいて,最先端の性能を効率的に達成することができる。
論文 参考訳(メタデータ) (2024-02-04T18:50:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。