論文の概要: Multi-History-Step SDE Inversion for Image Editing with Superior Regional Awareness
- arxiv url: http://arxiv.org/abs/2609.06602v1
- Date: Sun, 06 Sep 2026 13:37:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 05:12:20.819111
- Title: Multi-History-Step SDE Inversion for Image Editing with Superior Regional Awareness
- Title(参考訳): 画像編集におけるマルチヒストリーステップSDEインバージョン
- Abstract要約: MIEditは、SDEインバージョンに基づくトレーニング不要の編集フレームワークである。
MIEditは、より少ないステップでより優れた編集品質を達成するための予測器-相関型マルチヒストリー・ステップ・スキームを導入している。
- 参考スコア(独自算出の注目度): 48.14550823309452
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In recent years, diffusion stochastic differential equation (SDE) inversion and inversion-free methods have become prevalent for training-free image editing, as they can achieve faithful reconstruction without tuning. However, existing approaches remain inefficient, exhibit limited plasticity, and struggle to accurately preserve unedited regions. To address these issues, we propose MIEdit, a training-free editing framework based on SDE inversion. MIEdit introduces a predictor-corrector multi-history-step scheme to achieve superior editing quality with fewer steps. We further mitigate heterogeneity and conflict between the multi-conditioned noise residuals and gradient terms during sampling, improving stability and editing plasticity under large edits. MIEdit also includes Inversion-Time Automatic Semantic Angle Masking (IASM); it leverages classifier-free guidance to automatically generate semantic angle masks during inversion and applies them throughout the sampling process for regional constraints, without extra user inputs. We additionally construct EditEval++ (30 fine-grained tasks, 1,000+ image-text-mask triplets) for comprehensive evaluation; experiments show that MIEdit outperforms state-of-the-art techniques. Project page: https://whywwwzzzg.github.io/MIEdit/.
- Abstract(参考訳): 近年、拡散確率微分方程式(SDE)の逆変換と逆変換のない手法が、トレーニング不要な画像編集において普及し、チューニングなしで忠実な再構成が達成されている。
しかし、既存のアプローチは非効率であり、可塑性が限られており、未処理の領域を正確に保存するのに苦労している。
これらの問題に対処するために、SDEインバージョンに基づくトレーニング不要の編集フレームワークMIEditを提案する。
MIEditは、より少ないステップでより優れた編集品質を達成するための予測器-相関型マルチヒストリー・ステップ・スキームを導入している。
我々はさらに,多条件ノイズ残差とサンプリング中の勾配項との相違を緩和し,安定性を改善し,大規模な編集で可塑性を編集する。
MIEditには、Inversion-Time Automatic Semantic Angle Masking (IASM)も含まれており、Inversion中にセマンティックアングルマスクを自動的に生成し、追加のユーザ入力なしでサンプリングプロセス全体に適用する。
さらに、総合的な評価のためにEditEval++(30のきめ細かいタスク、1,000以上の画像-テキスト-マスク三つ子)を構築し、MIEditが最先端技術より優れていることを示す実験を行った。
プロジェクトページ:https://whywwwzzzg.github.io/MIEdit/。
関連論文リスト
- DirectEdit: Step-Level Accurate Inversion for Flow-Based Image Editing [51.56484100374058]
我々は、事前訓練されたテキスト・ツー・イメージ(T2I)モデルのトレーニング不要な編集方法であるDirectEditを提案する。
DirectEditは、追加の神経機能評価(NFE)を導入することなく、固有の再構成エラーを除去する
実験により、DirectEditは効率よく正確な画像編集を実現し、最先端の手法よりも優れたパフォーマンスを提供することが示された。
論文 参考訳(メタデータ) (2026-05-04T10:09:18Z) - SpotEdit: Selective Region Editing in Diffusion Transformers [66.44912649206553]
SpotEditは、修正されたリージョンのみを選択的に更新する、トレーニング不要な拡散編集フレームワークである。
不要な計算を削減し、未修正領域で高い忠実性を維持することにより、SpotEditは効率よく正確な画像編集を実現する。
論文 参考訳(メタデータ) (2025-12-26T14:59:41Z) - O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing [88.93410369258203]
O-DisCo-Editは、新しいオブジェクト歪み制御(O-DisCo)を組み込んだ統合フレームワークである
この信号はランダムノイズと適応ノイズに基づいて、単一の表現内に幅広い編集キューを柔軟にカプセル化する。
O-DisCo-Editは、効果的なトレーニングパラダイムによる効率的な高忠実な編集を可能にする。
論文 参考訳(メタデータ) (2025-09-01T16:29:39Z) - Visual Autoregressive Modeling for Instruction-Guided Image Editing [97.04821896251681]
画像編集を次世代の予測問題として再編成する視覚的自己回帰フレームワークを提案する。
VarEditは、正確な編集を実現するために、マルチスケールのターゲット機能を生成する。
1.2秒で512times512$編集を完了し、同じサイズのUltraEditよりも2.2$times$高速になった。
論文 参考訳(メタデータ) (2025-08-21T17:59:32Z) - Resolving UnderEdit & OverEdit with Iterative & Neighbor-Assisted Model Editing [10.54738347540608]
大規模言語モデル(LLM)は下流のタスクに広くデプロイされているが、リトレーニングや微調整によって知識を最新に保つことは、しばしば計算コストがかかる。
モデル編集は、ターゲットとするパラメータのサブセットを更新することで、より効率的な代替手段を提供する。
本稿では,UnderEditを緩和するために連続的な編集を行う反復的モデル編集法と,OverEditの削減のために,編集中に近隣の知識を取り入れた近隣モデル編集法との2つの補完手法を提案する。
論文 参考訳(メタデータ) (2025-03-14T21:53:12Z) - FACEMUG: A Multimodal Generative and Fusion Framework for Local Facial Editing [10.123066253648307]
グローバル一貫性のある局所顔編集(FACEMUG)のための新しい枠組みを提案する。
幅広い入力モダリティを処理でき、未編集の部分をそのまま残しながら細粒度で意味的な操作を可能にする。
顔の特徴の整合性を改善するために,新しい自己教師付き潜時整合アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-12-26T00:53:54Z) - Task-Oriented Diffusion Inversion for High-Fidelity Text-based Editing [60.730661748555214]
textbfTask-textbfOriented textbfDiffusion textbfInversion (textbfTODInv) は、特定の編集タスクに適した実際の画像を反転して編集する新しいフレームワークである。
ToDInvは相互最適化によってインバージョンと編集をシームレスに統合し、高い忠実さと正確な編集性を保証する。
論文 参考訳(メタデータ) (2024-08-23T22:16:34Z) - Tuning-Free Inversion-Enhanced Control for Consistent Image Editing [44.311286151669464]
我々は、チューニング不要なインバージョン強化制御(TIC)と呼ばれる新しいアプローチを提案する。
TICは、インバージョンプロセスとサンプリングプロセスの特徴を相関付け、DDIM再構成の不整合を軽減する。
また、インバージョンと単純なDDIM編集プロセスの両方の内容を組み合わせたマスク誘導型アテンション結合戦略を提案する。
論文 参考訳(メタデータ) (2023-12-22T11:13:22Z) - LIME: Localized Image Editing via Attention Regularization in Diffusion Models [69.33072075580483]
本稿では拡散モデルにおける局所化画像編集のためのLIMEを提案する。
LIMEは、ユーザが指定した関心領域(RoI)や追加のテキスト入力を必要としない。
そこで本研究では,RoIにおける非関係なクロスアテンションスコアをデノナイジングステップ中にペナライズし,局所的な編集を確実にする新しいクロスアテンション正規化手法を提案する。
論文 参考訳(メタデータ) (2023-12-14T18:59:59Z) - Inversion-Free Image Editing with Natural Language [18.373145158518135]
InfEdit(Inversion-free editing)は、厳密な意味的変化と非厳密な意味的変化の両面において、一貫性と忠実な編集を可能にする。
InfEditは、様々な編集タスクで強力なパフォーマンスを示し、また、1つのA40で3秒以内のシームレスなワークフローを維持し、リアルタイムアプリケーションの可能性を示している。
論文 参考訳(メタデータ) (2023-12-07T18:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。