論文の概要: Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2602.18022v1
- Date: Fri, 20 Feb 2026 06:24:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-23 18:01:41.250908
- Title: Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers
- Title(参考訳): 拡散変換器の学習自由画像編集制御のためのデュアルチャネル注意誘導
- Abstract要約: 既存のアテンション操作手法は、アテンションルーティングを変調するキー空間のみにフォーカスする。
本稿では,キーチャネルとバリューチャネルの両方を同時に操作するためのDual-Channel Attention Guidance (DCAG)を提案する。
DCAGは、すべての忠実度指標でキーのみのガイダンスを一貫して上回る。
- 参考スコア(独自算出の注目度): 10.474377498273205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training-free control over editing intensity is a critical requirement for diffusion-based image editing models built on the Diffusion Transformer (DiT) architecture. Existing attention manipulation methods focus exclusively on the Key space to modulate attention routing, leaving the Value space -- which governs feature aggregation -- entirely unexploited. In this paper, we first reveal that both Key and Value projections in DiT's multi-modal attention layers exhibit a pronounced bias-delta structure, where token embeddings cluster tightly around a layer-specific bias vector. Building on this observation, we propose Dual-Channel Attention Guidance (DCAG), a training-free framework that simultaneously manipulates both the Key channel (controlling where to attend) and the Value channel (controlling what to aggregate). We provide a theoretical analysis showing that the Key channel operates through the nonlinear softmax function, acting as a coarse control knob, while the Value channel operates through linear weighted summation, serving as a fine-grained complement. Together, the two-dimensional parameter space $(δ_k, δ_v)$ enables more precise editing-fidelity trade-offs than any single-channel method. Extensive experiments on the PIE-Bench benchmark (700 images, 10 editing categories) demonstrate that DCAG consistently outperforms Key-only guidance across all fidelity metrics, with the most significant improvements observed in localized editing tasks such as object deletion (4.9% LPIPS reduction) and object addition (3.2% LPIPS reduction).
- Abstract(参考訳): ディフュージョントランスフォーマ(Diffusion Transformer, DiT)アーキテクチャ上に構築された拡散ベースの画像編集モデルにおいて, 編集強度に対するトレーニング不要な制御が重要な要件である。
既存のアテンション操作メソッドは、アテンションルーティングを変調するキースペースのみに重点を置いており、バリュースペース -- フィーチャーアグリゲーションを管理する -- は完全に公開されていない。
本稿では,DiTのマルチモーダルアテンション層におけるキーとバリューのプロジェクションが明らかにバイアスデルタ構造を示し,トークンの埋め込みは層固有のバイアスベクトルの周囲に密着することを示した。
この観測に基づいて、キーチャネル(出席先を制御する)とバリューチャネル(集約先を制御する)を同時に操作するトレーニングフリーフレームワークであるDual-Channel Attention Guidance (DCAG)を提案する。
本稿では,キーチャネルが非線形ソフトマックス関数を介して動作し,粗い制御ノブとして機能し,バリューチャネルが線形重み付け和を通じて動作し,微細な補体として機能することを示す理論的解析を行う。
2次元パラメータ空間 $(δ_k, δ_v)$ は、任意の単一チャネル法よりも正確な編集-忠実トレードオフを可能にする。
PIE-Benchベンチマーク(700のイメージ、10の編集カテゴリ)の大規模な実験では、DCAGはすべての忠実度指標でキーのみのガイダンスよりも優れており、オブジェクト削除(4.9%のLPIPS削減)やオブジェクトの追加(3.2%のLPIPS削減)といった局所的な編集タスクにおいて最も顕著な改善が見られた。
関連論文リスト
- Harnessing Intrinsic Subject-Aware Attention for Controllable Multi-Subject Video Generation [23.97734604758057]
特定の注意ブロックが、参照対象を正確に特定する内在的空間接地マップ(ISGM)を自然に形成していることが判明した。
低雑音の段階では、ISGMを用いて注意機構を誘導し、再訓練せずに推論中の忠実度を正確に制御することができる。
高ノイズの段階では、これらの同じマップを使用して、強化学習のための追加コストなしで、好みのペアを自動的に構築します。
論文 参考訳(メタデータ) (2026-09-10T13:15:03Z) - SPARK: Input-Conditioned Sparse Activation Modulation for Frozen DiT-based Super-Resolution [22.659619627342156]
凍結したDiTベースのSRモデルに対して,支配チャネルがコンパクトな適応インタフェースとして機能するかどうかを検討する。
本稿では,選択したチャネルのみに対して,チャネルごとのアフィン変換を有界に予測する軽量な入力条件制御系であるSPARKを紹介する。
DIV2K、RealSR、DRealSRにまたがる3つのDiTベースのSRバックボーンの実験では、ストリームとブロックの8チャンネルだけを調節しながら、忠実さと知覚品質の両面で一貫した利得を示した。
論文 参考訳(メタデータ) (2026-09-03T13:17:29Z) - TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution [52.96050253456634]
TRaM-VSRは、コンテキスト対応のビデオプリエントとネットワークレベルを用いた適応トークンアロケーションのためのフレームワークである。
その結果、TRaM-VSRは、最先端の復元品質と頑健な時間的整合性を維持しつつ、推論を著しく加速することがわかった。
論文 参考訳(メタデータ) (2026-07-24T11:57:26Z) - Lightweight CNN-Based Anomaly Detection for High Voltage Converter Modulators in the Spallation Neutron Source [0.788278500923222]
高出力パルスコンバータの予定外走行は、大型加速器施設におけるダウンタイムの主要な原因である。
本研究では, 時間的フィルタリングやチャネル間混合の順序付けなど, アーキテクチャ上の帰納バイアスが検出性能において重要な役割を担っていることを示す。
AUC-PRが0.816、AUC-ROCが0.934で、ほとんどのサブシステムと6つのフォールトファミリーのうち5つにおいて、技術状況よりも優れています。
論文 参考訳(メタデータ) (2026-05-29T12:54:13Z) - DC-ViT: Modulating Spatial and Channel Interactions for Multi-Channel Images [9.507520646516719]
マルチチャネルイメージング(MCI)のトレーニングと評価は、異種チャネル構成のため、依然として困難である。
最近のMulti-Channel Vision Transformers (MC-ViTs)は、フレキシブルなチャネル入力を可能にすることでこの問題に対処している。
Decoupled Self-Attention (DSA)を用いて情報共有を明示的に制御するDecoupled Vision Transformer (DC-ViT)を提案する。
論文 参考訳(メタデータ) (2026-03-15T08:31:34Z) - ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision [62.41380823195191]
本稿では,注意監督による映像拡散モデルにおける直接条件制御のためのフレームワークである,注意継続拡散(Attention-Conditional Diffusion)を提案する。
ACDは、モデルの注意マップと外部制御信号との整列により、より良い制御性を実現する。
ベンチマークビデオ生成データセットの実験は、ACDがコンディショニング入力と優れたアライメントを提供することを示した。
論文 参考訳(メタデータ) (2025-12-24T16:24:18Z) - Optimal Control Meets Flow Matching: A Principled Route to Multi-Subject Fidelity [35.95129874095729]
テキスト・トゥ・イメージ(T2I)モデルは単一エンタリティ・プロンプトに優れるが、多目的記述に苦慮する。
マルチオブジェクト忠実度に向けてサンプリングダイナミクスを操るための原理的最適化可能な目的を持った最初の理論的枠組みを導入する。
論文 参考訳(メタデータ) (2025-10-02T17:59:58Z) - Saliency-Motion Guided Trunk-Collateral Network for Unsupervised Video Object Segmentation [8.912201177914858]
Saliency-Motion Guided Trunk-Collateral Network (SMTC-Net)
動き適応型ビデオオブジェクトセグメンテーション(UVOS)のための新しいTrunk-Collateral構造を提案する。
SMTC-Netは3つのUVOSデータセットで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2025-04-08T11:02:14Z) - FreSca: Scaling in Frequency Space Enhances Diffusion Models [55.75504192166779]
本稿では,潜時拡散モデルにおける周波数制御について検討する。
本稿では,低周波成分と高周波成分にノイズ差を分解する新しいフレームワークFreScaを紹介する。
FreScaはモデルの再トレーニングやアーキテクチャの変更なしに動作し、モデルとタスクに依存しない制御を提供する。
論文 参考訳(メタデータ) (2025-04-02T22:03:11Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers [11.003945673813488]
Diffusion Transformerは、テキスト・ツー・イメージとテキスト・ツー・ビデオ生成において重要な役割を果たす。
本稿では,Relevance-Guided Efficient Controllable GenerationフレームワークRelaCtrlを提案する。
本手法は PixArt-delta と比較して, パラメータと計算複雑性の 15% しか得られず, 優れた性能を実現する。
論文 参考訳(メタデータ) (2025-02-20T09:10:05Z) - Label-Efficient Data Augmentation with Video Diffusion Models for Guidewire Segmentation in Cardiac Fluoroscopy [16.62770246342126]
深層学習法はワイヤセグメンテーションにおいて高い精度とロバスト性を示した。
これらの手法は、一般化可能性のためにかなりのデータセットを必要とする。
ラベル付き蛍光ビデオの大規模なコレクションを生成するためのフレーム一貫性拡散モデル(SF-VD)を提案する。
論文 参考訳(メタデータ) (2024-12-20T16:52:11Z) - Joint Channel Estimation and Feedback with Masked Token Transformers in
Massive MIMO Systems [74.52117784544758]
本稿では,CSI行列内の固有周波数領域相関を明らかにするエンコーダデコーダに基づくネットワークを提案する。
エンコーダ・デコーダネットワーク全体がチャネル圧縮に使用される。
提案手法は,共同作業における現状のチャネル推定およびフィードバック技術より優れる。
論文 参考訳(メタデータ) (2023-06-08T06:15:17Z) - ViT-Calibrator: Decision Stream Calibration for Vision Transformer [49.60474757318486]
本稿では、一般的な視覚変換器の性能を高めるための、決定ストリームと呼ばれる新しいパラダイムを提案する。
異なるトークンと複数の次元の関連係数の相関関係を探索し,学習過程における情報伝達機構について光を当てた。
論文 参考訳(メタデータ) (2023-04-10T02:40:24Z) - Efficient Two-Stream Network for Violence Detection Using Separable
Convolutional LSTM [0.0]
Separable Convolutional LSTM(SepConvLSTM)と予め訓練されたMobileNetを活用した効率的な2ストリームディープラーニングアーキテクチャを提案する。
SepConvLSTMは、ConvLSTMの各ゲートの畳み込み操作を深さ方向に分離可能な畳み込みに置き換えて構築されます。
我々のモデルは、大きくて挑戦的なrwf-2000データセットの精度を2%以上上回っている。
論文 参考訳(メタデータ) (2021-02-21T12:01:48Z) - Operation-Aware Soft Channel Pruning using Differentiable Masks [51.04085547997066]
本稿では,データ駆動型アルゴリズムを提案する。このアルゴリズムは,操作特性を利用して,ディープニューラルネットワークを異なる方法で圧縮する。
我々は大規模な実験を行い、出力ネットワークの精度で優れた性能を達成する。
論文 参考訳(メタデータ) (2020-07-08T07:44:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。