論文の概要: Compression Asymmetry and Trajectory Binding in Noise-Anchored Diffusion Inversion
- arxiv url: http://arxiv.org/abs/2607.09784v1
- Date: Wed, 08 Jul 2026 13:30:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.192367
- Title: Compression Asymmetry and Trajectory Binding in Noise-Anchored Diffusion Inversion
- Title(参考訳): ノイズアンコール拡散インバージョンにおける圧縮非対称性と軌道結合
- Abstract要約: リアルタイム拡散インバージョンは、計算、ストレージ、イメージごとの最適化にコストがかかる、厳密な品質とコストのトレードオフによって管理される。
本研究では,拡散軌跡を規定する前方ノイズアンカーを用いて,このトレードオフについて検討し,効果的なストアネーズ反転の背後にある2つのメカニズムを分離する。
- 参考スコア(独自算出の注目度): 1.534847923698733
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-image diffusion inversion is governed by a tight quality-cost trade-off, with costs incurred in computation, storage, or per-image optimization. We study this trade-off through the forward Gaussian noise anchor that defines a diffusion trajectory and isolate two mechanisms behind effective stored-noise inversion. First, diffusion noise exhibits an element-wise compression asymmetry: int8 full-dimensional anchors preserve reconstruction, whereas low-dimensional subspace summaries are much less reliable, often collapsing even at comparable or smaller payloads; the element-wise over subspace ordering persists across five stored-noise inversion methods. Second, inversion is trajectory-bound and score-prior coupled: the matched forward anchor and a trained score network are both necessary, arguing against a purely algebraic-identity explanation. Together, these findings specify what to store and how to use it. They lead to Noise-Anchored Reverse Correction (NARC), a training-free inversion primitive that stores a single int8 latent anchor and reuses it with a fixed, noise-level-dependent anchor-weight schedule: strong anchoring when the reverse trajectory is noise-dominated, then relaxed anchoring as image detail emerges. On PIE-Bench++ with Stable Diffusion 1.5, NARC outperforms five modern non-exact baselines and improves PSNR by +3.24 dB over PnP DirectInv while using about 400x less inversion storage than PnP DirectInv. The compression asymmetry, anchor specificity, and editing plug-in also transfer to SDXL 1024^2.
- Abstract(参考訳): リアルタイム拡散インバージョンは、計算、ストレージ、イメージごとの最適化にコストがかかる、厳密な品質とコストのトレードオフによって管理される。
本研究では,拡散軌跡を規定するガウス雑音アンカーを用いて,このトレードオフについて検討し,有効保存ノイズインバージョンの背後にある2つのメカニズムを分離する。
まず、拡散ノイズは要素の圧縮非対称性を示す: int8 のフル次元アンカーは再構成を保ち、一方低次元のサブスペースサマリーはより信頼性が低く、しばしば同等のペイロードや小さなペイロードでも崩壊する。
第二に、インバージョンはトラジェクトリバウンドでスコア優先結合であり、マッチしたフォワードアンカーとトレーニングされたスコアネットワークはどちらも必要であり、純粋に代数的同一性の説明に反対する。
これらの発見は、どのように保存するか、どのように使用するかを示す。
NARC(Noss-Anchored Reverse Correction)は、トレーニング不要のインバージョンプリミティブで、単一のint8潜伏アンカーを格納し、固定されたノイズレベル依存アンカーウェイトスケジュールで再利用する。
安定拡散1.5のPIE-Bench++では、NARCはPnP DirectInvよりも400倍少ないインバージョンストレージを使用しながら、5つのモダンな非コンパクトベースラインを上回り、PSNRを+3.24dB改善している。
圧縮非対称性、アンカー特異性、および編集プラグインもSDXL 1024^2に転送される。
関連論文リスト
- RAIN: Region-Aware Inversion Network for Semantic Watermark Extraction [0.0]
終端回復を画像のようなアンカーとノイズ指向残差に分解する軽量なプロンプトフリー抽出器を提案する。
ノイズ抽出の計算コストはOSIとFARIのどちらよりも低い。
論文 参考訳(メタデータ) (2026-09-14T00:07:17Z) - DRIFT: Removing Diffusion Watermarks by Deflecting the Generative Trajectory [9.706332101916248]
拡散透かしは、検証可能な信号を生成過程に埋め込む。
我々は,部分的な前方拡散と逆再サンプリングを組み合わせたブラックボックス攻撃であるDRIFTを提案する。
3つのパラダイムにまたがる9つの透かしのうち、DRIFTは98-100%の攻撃成功と最高の画質を達成する。
論文 参考訳(メタデータ) (2026-09-08T03:54:17Z) - FARI: Robust One-Step Inversion for Watermarking in Diffusion Models [89.29541056113442]
インバージョンベースの透かしは拡散生成画像の認証に有望なアプローチである。
既存のアプローチは内部トランケーションエラーを過度に最適化する。
textbfFARIは、透かし抽出のためのデノイザの軽量対向LoRA微調整と組み合わせたワンステップ逆変換フレームワークである。
論文 参考訳(メタデータ) (2026-07-29T10:13:55Z) - The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models [18.625239232550932]
5つのインジェクション設計において、ゲートパラメータが信号の30-45%を名目で通過する場合でも、全てのゲート経路は動作が閉じる。
本稿では、この抑制現象を、画像由来の信号のキャプション不変性によって形式化された致命的な体制と、補助信号が損失を積極的に傷つける負の効用体制の2つに分類する。
論文 参考訳(メタデータ) (2026-07-25T19:14:34Z) - WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation [69.37452950816122]
WaveZipは、効率的なビデオ推論のための共同信号周波数領域フレームワークである。
長いビデオ理解ベンチマークの実験では、WaveZipは完全なパフォーマンスの99.6%を維持している。
論文 参考訳(メタデータ) (2026-07-25T16:05:22Z) - Drift-Aware RL-based Wavelet Denoising for Network-Traffic Anomaly Detection [1.5469452301122173]
ネットワーク監視のための交通利用測定は、付加雑音と統計的ドリフトによって損なわれる。
2つのタスクに最適化された前処理層として適応ウェーブレットをデノナイズするドリフト対応フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-22T10:52:05Z) - Intrinsic-Noise Consolidation: A Doob-Barrier-Conditioned Diffusion Turns Analog Device Noise into a Continual-Learning Resource [0.0]
アナログニューロモルフィックハードウェアでは、固有のデバイスノイズは通常精度税である。
シングルヘッドのスプリット-MNIST (8シード)ルールでは、最適な内部で保持率10.9ポイントを上昇させる。
実際のBrainScaleS-2(オンチップ平均化による追加的、トライアル・ツー・トライアル・インディペンデント、チューナブル)の固有ノイズを測定し、トレーニングループのノイズでチップ上でルールを実行する。
論文 参考訳(メタデータ) (2026-07-08T02:38:02Z) - SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending [55.764018145256216]
本稿では,補助予測器を介してデノナイジングプロセスを開始する数ステップのパラダイムであるSATB-VRを提案する。
我々は,SATB-VRが,合成,実世界,AIGCベンチマークにおける既存のアプローチに対して良好に動作することを示す。
論文 参考訳(メタデータ) (2026-06-27T01:32:16Z) - Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion [46.51681899437508]
本稿では,パラメータフリーで時間条件付き2D-DCTローパス演算子であるSpectral Forcingを導入する。
その遮断は拡散時間とともに単調に膨張し、データエンドポイントのアイデンティティとなる。
JiT-700M/32のImageNet-256では、Spectral Forcingは、異なるトレーニングエポック間で、FIDとInception Scoreの両方を一貫して改善している。
論文 参考訳(メタデータ) (2026-06-13T10:29:11Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Geometry-Correct Diffusion Posterior Sampling with Denoiser-Pullback Curvature Guidance and Manifold-Aligned Damping [2.9985000712079426]
我々は、スカラー誘導をノイズレベルごとの減衰ガウスに置き換える。-拡散状態座標で計算されたニュートン補正。
競合するPSNR/SSIM/LPIPSを実現し、比較したベースラインのほとんどよりも大幅に高速である。
論文 参考訳(メタデータ) (2026-05-27T05:29:35Z) - The Malignant Tail: Spectral Segregation of Label Noise in Over-Parameterized Networks [0.0]
ネットワークが機能的に信号とノイズを分離する障害モードであるMorignant Tailを実験的に分離する。
トレーニングされていないネットワークは、ノイズを積極的に分離し、ノイズに支配されたサブスペースを外科的にプルークするポストホックスペクトルトラニケーションを実現する。
以上の結果から,ラベルノイズ下では,余剰スペクトル容量は無害な冗長性ではなく,構造的負債が潜んでいることが示唆された。
論文 参考訳(メタデータ) (2026-03-02T16:39:42Z) - QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification [67.15451442018258]
拡散変換器は素晴らしいビデオ生成能力を示すが、その計算とメモリの禁止コストは実際の展開を妨げる。
モデル量子化とアテンションスパシフィケーションは圧縮に有望な2つの方向であるが、それぞれがアグレッシブ圧縮の下で深刻な性能劣化を被っている。
モデル量子化と注意散布を統合した統合フレームワークである textbfQuantSparse を提案する。
論文 参考訳(メタデータ) (2025-09-28T06:49:44Z) - Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think [63.25744258438214]
REPAとその変種は、事前訓練されたモデルから外部の視覚表現を取り入れることで、拡散モデルのトレーニング課題を効果的に軽減する。
偏見推論過程全体において欠落している外部アライメントは、識別的表現の可能性を完全に活用するに足らないと我々は主張する。
本稿では,事前学習した基礎モデルから,低レベル画像ラテントを1つの高レベルクラストークンで絡み合わせるRepresentation Entanglement for Generation (REG)を提案する。
論文 参考訳(メタデータ) (2025-07-02T08:29:18Z) - RDEIC: Accelerating Diffusion-Based Extreme Image Compression with Relay Residual Diffusion [29.277211609920155]
Relay Residual Diffusion Extreme Image Compression (RDEIC)を提案する。
まず, 純雑音ではなく, 付加雑音を付加した画像の圧縮潜時特徴を出発点として, 復調過程の不要な初期段階を除去する。
RDEICは、最先端の視覚的品質を実現し、既存の拡散に基づく極端画像圧縮手法よりも忠実さと効率性が優れている。
論文 参考訳(メタデータ) (2024-10-03T16:24:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。