論文の概要: RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing
- arxiv url: http://arxiv.org/abs/2608.03059v1
- Date: Tue, 04 Aug 2026 03:20:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.006264
- Title: RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing
- Title(参考訳): RIDGE: 画像編集のための内部動的ガイダンスによる再通知
- Abstract要約: インバージョンフリーなフローベース画像編集は遅延インバージョンを回避するが、編集ステップ毎にターゲット側状態が必要である。
Ridgeは、非利用可能なクリーンターゲット状態に対する進化的な近似として、編集された状態を維持する、インバージョンフリーでトレーニング不要な方法である。
2つのバックボーン(SD3 MediumとFLUX.1-dev)を使用した2つのベンチマークの実験では、RIDGEがソース保存、ターゲットアライメント、知覚品質のトレードオフを好適に提供していることが示されている。
- 参考スコア(独自算出の注目度): 11.37302017486576
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Inversion-free flow-based image editing avoids latent inversion, but still requires a target-side state at every editing step. The widely used equal-displacement construction keeps the displacement between the noisy source state and the target-side state unchanged across noise levels. This is inconsistent with noising, under which the displacement between two clean states noised with the same noise level and noise sample should contract as the noise level increases. Thus, it can lead to overly aggressive updates at high noise levels. We introduce RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing, an inversion-free and training-free method that maintains the edited state as an evolving approximation to the unavailable clean target state. RIDGE re-noises this approximation using the same noise level and noise sample as the clean source state, allowing their noisy displacement to decrease naturally with increasing noise. Since the edited state initially contains limited target semantics, RIDGE further applies internal dynamic guidance during the early high-noise steps. A clean target state prediction guides the provisional edited state through a soft dynamic mask derived internally from the model, focusing guidance on regions that require modification without external segmentation or detection models. Experiments on two benchmarks using two backbones, SD3 Medium and FLUX.1-dev, show that RIDGE offers a favorable aggregate trade-off among source preservation, target alignment, and perceptual quality.
- Abstract(参考訳): インバージョンフリーなフローベース画像編集は遅延インバージョンを回避するが、編集ステップ毎にターゲット側状態が必要である。
広く使われている等変位構造は、ノイズレベルによってノイズ源状態とターゲット側状態との間の変位を一定に保っている。
これはノイズレベルが増加するにつれて、ノイズレベルとノイズサンプルが収縮する2つのクリーンな状態の間の変位が収縮するというノイズ発生と矛盾する。
したがって、高騒音レベルにおける過度に攻撃的な更新につながる可能性がある。
RIDGE:Re-Noising with Internal Dynamic Guidance for Image Editing, a inversion-free and training-free method that maintain the edit state as a evolution approximation to the un available clean target state。
RIDGEは、この近似をクリーンソース状態と同じノイズレベルとノイズサンプルを用いて再雑音化し、ノイズの増加とともにノイズの変位が自然に減少する。
編集された状態は、当初は限定的なターゲットセマンティクスを含むため、RIDGEは初期のハイノイズステップで内部動的ガイダンスを適用する。
クリーンターゲット状態予測は、モデルから内部的に派生したソフトダイナミックマスクを通じて仮編集状態を誘導し、外部セグメンテーションや検出モデルなしで修正を必要とする領域に焦点を絞る。
2つのバックボーン(SD3 MediumとFLUX.1-dev)を使用した2つのベンチマークの実験では、RIDGEがソース保存、ターゲットアライメント、知覚品質のトレードオフを好適に提供していることが示されている。
関連論文リスト
- FiRe: Fixed-Noise Refinement for Visual Counterfactual Explanations [9.955401099290096]
本稿では,視覚的対実的説明のための固定ノイズ補充フレームワークFiReを提案する。
FiReは入力を固定ノイズレベルにマッピングし、そのレベルのノイズ状態を反復的に洗練する。
FiReは約3$times$高速オンライン推論と8$times$より少ないFLOPを実現し、同等または最先端の対物品質を得る。
論文 参考訳(メタデータ) (2026-08-09T12:15:37Z) - Interleaved Noise Injection Improves Clean, Corrupted, and OOD Performance [1.6567880228735357]
本稿では, ノイズ注入の理論解析を行い, インパルスノイズによる劣化がヤコビ正規化に近似していることを確認する。
本研究は, インダクティブバイアスによる障害モードのペナルティ化が, インターリーブドノイズ注入の効果に起因していることを示す。
したがって、インターリーブノイズ注入は、本質的に計算コストゼロで、クリーンでノイズの多い、およびアウト・オブ・ディストリビューションデータのテスト性能を向上させる効果的なツールである。
論文 参考訳(メタデータ) (2026-07-16T01:25:44Z) - DirectEdit: Step-Level Accurate Inversion for Flow-Based Image Editing [51.56484100374058]
我々は、事前訓練されたテキスト・ツー・イメージ(T2I)モデルのトレーニング不要な編集方法であるDirectEditを提案する。
DirectEditは、追加の神経機能評価(NFE)を導入することなく、固有の再構成エラーを除去する
実験により、DirectEditは効率よく正確な画像編集を実現し、最先端の手法よりも優れたパフォーマンスを提供することが示された。
論文 参考訳(メタデータ) (2026-05-04T10:09:18Z) - BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation [48.679227622825806]
BiFM(Bidirectional Flow Matching)は、単一のモデル内で生成と反転を共同で学習する統合フレームワークである。
BiFMは既存の数ステップのアプローチを一貫して上回り、優れたパフォーマンスと編集性を実現している。
論文 参考訳(メタデータ) (2026-03-26T02:16:54Z) - Teacher-Guided Causal Interventions for Image Denoising: Orthogonal Content-Noise Disentanglement in Vision Transformers [8.989774165042542]
従来の画像復調モデルは, 環境要因とノイズパターンの急激な相関関係を不注意に学習する。
本稿ではTCD-Net(Teacher-Guided Causal Disentanglement Network)を提案する。
大規模な実験により、TCD-Netは、複数のベンチマークにおいて、忠実さと効率の両方で、メインストリームのメソッドよりも優れていることが示された。
論文 参考訳(メタデータ) (2026-03-01T15:04:37Z) - SNR-Edit: Structure-Aware Noise Rectification for Inversion-Free Flow-Based Editing [18.5465888954825]
フローベース生成モデルを用いたインバージョンフリー画像編集は、一般的なインバージョンベースパイプラインに挑戦する。
適応雑音制御による忠実な潜在軌道補正を実現するためのトレーニングフリーフレームワークであるSNR-Editを紹介する。
論文 参考訳(メタデータ) (2026-01-27T04:24:21Z) - Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance [54.88271057438763]
ノイズアウェアネスガイダンス (NAG) は、事前に定義された騒音スケジュールと整合性を保つために、サンプリング軌道を明示的に制御する補正手法である。
NAGは一貫してノイズシフトを緩和し、主流拡散モデルの生成品質を大幅に改善する。
論文 参考訳(メタデータ) (2025-10-14T13:31:34Z) - Latent Class-Conditional Noise Model [54.56899309997246]
本稿では,ベイズ的枠組みの下での雑音遷移をパラメータ化するためのLatent Class-Conditional Noise Model (LCCN)を提案する。
次に、Gibs sampler を用いて遅延真のラベルを効率的に推測できる LCCN の動的ラベル回帰法を導出する。
提案手法は,サンプルのミニバッチから事前の任意チューニングを回避するため,ノイズ遷移の安定な更新を保護している。
論文 参考訳(メタデータ) (2023-02-19T15:24:37Z) - EDICT: Exact Diffusion Inversion via Coupled Transformations [13.996171129586731]
拡散過程(反転と呼ばれる)に入力画像を生成する初期ノイズベクトルを見つけることは重要な問題である。
本稿では,アフィン結合層からインスピレーションを得るための逆変換法であるEDICT(Exact Diffusion Inversion)を提案する。
EDICTは、2つの結合ノイズベクトルを維持することにより、実画像とモデル生成画像の数学的に正確な逆変換を可能にする。
論文 参考訳(メタデータ) (2022-11-22T18:02:49Z) - Dual Adversarial Network: Toward Real-world Noise Removal and Noise
Generation [52.75909685172843]
実世界の画像ノイズ除去は、コンピュータビジョンにおける長年の課題である。
本稿では,ノイズ除去およびノイズ発生タスクに対処する新しい統合フレームワークを提案する。
本手法はクリーンノイズ画像対の連成分布を学習する。
論文 参考訳(メタデータ) (2020-07-12T09:16:06Z) - Flexible Image Denoising with Multi-layer Conditional Feature Modulation [56.018132592622706]
条件付き特徴変調(CFM)モジュールを備えたU-Netバックボーンを備えることにより,新しいフレキシブル画像符号化ネットワーク(CFMNet)を提案する。
CFMNetは、第1層のみのチャネルワイドシフトと比較して、複数のCFM層を配置することでノイズレベル情報をよりよく利用することができる。
我々のCFMNetは、フレキシブルな非盲検のためのノイズレベル情報を利用するのに有効であり、定量的メトリクスと視覚的品質の両方の観点から、既存の深部画像復調法に対して好適に機能する。
論文 参考訳(メタデータ) (2020-06-24T06:00:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。