論文の概要: Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space
- arxiv url: http://arxiv.org/abs/2605.08250v1
- Date: Thu, 07 May 2026 16:33:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.498333
- Title: Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space
- Title(参考訳): DiTエディターがドリフトする理由 : VAE遅延空間におけるプラグアンドプレイ低周波アライメント
- Authors: Xiaoce Wang, Sifan Zhou, Kaifei Wang, Leli Xu, Xuerui Qiu, Tao He, Ming Li,
- Abstract要約: マルチターン編集は、しばしばプログレッシブなセマンティックドリフトと品質劣化をもたらす。
本稿では,VAE-LFA(Low Frequency Alignment)を提案する。
VAE-LFAは、低域通過フィルタリングにより編集ラウンド間の遅延不一致を分解し、低周波数統計を前ラウンドの指数移動平均に整合させる。
- 参考スコア(独自算出の注目度): 21.703861987254587
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in diffusion transformers (DiTs) have enabled promising single-turn image editing capabilities. However, multi-turn editing often leads to progressive semantic drift and quality degradation.In this work, we study this problem from a latent-space frequency perspective by decomposing the editing process into two functional components: VAE and DiT. Through systematic analysis in the VAE latent space, we uncover that the DiT introduces dominant low-frequency drift that accumulates as semantic misalignment across editing rounds, while the VAE contributes comparatively stable reconstruction bias.Based on this insight, we propose VAE-LFA (Low Frequency Alignment), a training-free, plug-and-play method that performs alignment in VAE latent space. VAE-LFA decomposes latent discrepancies across editing rounds via low-pass filtering, and aligns low-frequency statistics to an exponential moving average of previous rounds, effectively suppressing accumulated semantic drift while preserving high-frequency details.Our method requires no retraining, ground-truth priors, or access to diffusion parameters, making it applicable to both white-box and black-box DiT editors. For white-box models, VAE-LFA is seamlessly integrated into the editing pipeline by eliminating redundant VAE round trips; for black-box models, it operates via an off-the-shelf VAE to perform inter-round latent alignment.Extensive experiments demonstrate that VAE-LFA improves semantic consistency and visual fidelity across diverse multi-turn editing scenarios, including both controlled and in-the-wild images.
- Abstract(参考訳): 拡散変圧器(DiT)の最近の進歩により、期待できる1ターン画像編集機能を実現している。
しかし, マルチターン編集は, 進行的セマンティックドリフトと品質劣化をもたらすことが多く, 編集過程をVAEとDiTという2つの機能成分に分解することで, 遅延空間周波数の観点からこの問題を考察する。
本稿では,VAEラテント空間の系統的解析を通じて,VAEが編集ラウンド全体にわたって意味的不整合として蓄積する支配的な低周波ドリフトを導入し,VAEが比較的安定した再構成バイアスに寄与することを明らかにする。この知見に基づいて,VAEラテント空間のアライメントを行う訓練不要なプラグアンドプレイ手法であるVAE-LFA(Low Frequency Alignment)を提案する。
VAE-LFAは、低域通過フィルタリングによる編集ラウンド間の遅延不一致を分解し、低周波統計を前回ラウンドの指数移動平均に整合させ、高頻度の詳細を保存しながら蓄積したセマンティックドリフトを効果的に抑制する。
ホワイトボックスモデルでは、VAE-LFAは冗長なVAEラウンドトリップを排除し、編集パイプラインにシームレスに統合され、ブラックボックスモデルでは、オフザシェルのVAEを介してラウンドラテントアライメントを実行する。
関連論文リスト
- SoLAR: Error-Resilient Streamable Long-Horizon Free-Viewpoint Video Reconstruction with Anchor Activation and Latent Recalibration [57.159190580279585]
ビット割り当て理論により、速度歪み最適化フレームワーク内で動的アンカーベースのボリュームビデオ表現を解析する。
我々は,長いシーケンスの復元品質を安定的に維持する,エラー回復性の最初のFVVフレームワークである textbfSoLAR を提案する。
論文 参考訳(メタデータ) (2026-05-08T06:48:59Z) - GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing [30.230365555184193]
GIDE(Grounded Inversion forDLLM Image Editing)は,連続拡散モデルと学習不要の画像編集のギャップを埋める統合フレームワークである。
GIDEには、離散トークン空間内の遅延ノイズパターンを正確にキャプチャする新しい離散ノイズ反転機構が組み込まれている。
既存の単一ステップ評価プロトコルの限界を克服するために, GIDE-Benchを導入する。
論文 参考訳(メタデータ) (2026-03-22T11:33:30Z) - Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection [52.5174167737992]
ビデオ異常検出(VAD)は、ビデオ内の異常事象を特定することを目的としている。
本稿では,MLLMに基づくVADを受動的に読み上げから内部表現を積極的に操り,修正するSteerVADを提案する。
本手法は、トレーニングデータの1%しか必要としないチューニングフリーアプローチにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-27T13:48:50Z) - Subspace Alignment for Vision-Language Model Test-time Adaptation [82.83192844597593]
視覚言語モデル(VLM)は分布シフトに対して脆弱である。
既存のテスト時間適応法は、自己学習のための擬似ラベルとしてゼロショット予測に依存している。
両モードのセマンティック部分空間を整列させてゼロショット予測を強化するSubTTAを提案する。
論文 参考訳(メタデータ) (2026-01-13T02:02:41Z) - Diffusion-DRF: Differentiable Reward Flow for Video Diffusion Fine-Tuning [72.16213872139748]
Diffusion-DRFは、微調整ビデオ拡散モデルのための微分可能な報酬フローである。
拡散縮退鎖を介してVLMフィードバックをバックプロパゲートする。
ビデオの品質とセマンティックアライメントを改善し、報酬のハッキングと崩壊を緩和する。
論文 参考訳(メタデータ) (2026-01-07T18:05:08Z) - VALA: Learning Latent Anchors for Training-Free and Temporally Consistent [29.516179213427694]
本稿では,キーフレームを適応的に選択し,その潜在機能をセマンティックアンカーに圧縮し,一貫したビデオ編集を行う変分アライメントモジュールであるVALAを提案する。
本手法はトレーニング不要なテキスト・画像ベースのビデオ編集モデルに完全に統合することができる。
論文 参考訳(メタデータ) (2025-10-27T03:44:11Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - CVT-xRF: Contrastive In-Voxel Transformer for 3D Consistent Radiance Fields from Sparse Inputs [65.80187860906115]
スパース入力によるNeRFの性能向上のための新しい手法を提案する。
まず, サンプル線が, 3次元空間内の特定のボクセルと交差することを保証するために, ボクセルを用いた放射線サンプリング戦略を採用する。
次に、ボクセル内の追加点をランダムにサンプリングし、トランスフォーマーを適用して各線上の他の点の特性を推測し、ボリュームレンダリングに組み込む。
論文 参考訳(メタデータ) (2024-03-25T15:56:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。