論文の概要: Attention Frequency Modulation: Training-Free Spectral Modulation of Diffusion Cross-Attention
- arxiv url: http://arxiv.org/abs/2603.28114v1
- Date: Mon, 30 Mar 2026 07:24:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.27426
- Title: Attention Frequency Modulation: Training-Free Spectral Modulation of Diffusion Cross-Attention
- Title(参考訳): 注意周波数変調:拡散クロスアテンションのトレーニング不要スペクトル変調
- Authors: Seunghun Oh, Unsang Park,
- Abstract要約: クロスアテンション(Cross-attention)は、テキスト条件が遅延拡散モデルとなる主要なインターフェースである。
本稿では,Attention Frequency Modulation (AFM)を紹介した。
- 参考スコア(独自算出の注目度): 1.4323566945483497
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cross-attention is the primary interface through which text conditions latent diffusion models, yet its step-wise multi-resolution dynamics remain under-characterized, limiting principled training-free control. We cast diffusion cross-attention as a spatiotemporal signal on the latent grid by summarizing token-softmax weights into token-agnostic concentration maps and tracking their radially binned Fourier power over denoising. Across prompts and seeds, encoder cross-attention exhibits a consistent coarse-to-fine spectral progression, yielding a stable time-frequency fingerprint of token competition. Building on this structure, we introduce Attention Frequency Modulation (AFM), a plug-and-play inference-time intervention that edits token-wise pre-softmax cross-attention logits in the Fourier domain: low- and high-frequency bands are reweighted with a progress-aligned schedule and can be adaptively gated by token-allocation entropy, before the token softmax. AFM provides a continuous handle to bias the spatial scale of token-competition patterns without retraining, prompt editing, or parameter updates. Experiments on Stable Diffusion show that AFM reliably redistributes attention spectra and produces substantial visual edits while largely preserving semantic alignment. Finally, we find that entropy mainly acts as an adaptive gain on the same frequency-based edit rather than an independent control axis.
- Abstract(参考訳): クロスアテンション(英語: Cross-attention)は、テキスト条件が遅延拡散モデル(英語版)を経由する主要なインタフェースであるが、そのステップワイドなマルチレゾリューションのダイナミクスは、非文字化され、原則化されたトレーニングフリー制御が制限される。
我々は,トークン-ソフトマックス重みをトークン非依存濃度マップに要約し,その放射結合されたフーリエパワーを追跡することにより,遅延格子上の時空間信号として拡散クロスアテンションをキャストした。
プロンプトとシードを越えて、エンコーダのクロスアテンションは、一貫した粗いスペクトルの進行を示し、トークン競合の安定な時間周波数指紋を生成する。
この構造に基づいて,Fourier領域におけるトークンワイド・ソフトマックスのクロスアテンションロジットを編集するプラグイン・アンド・プレイ・推論・タイム介入であるAttention Frequency Modulation (AFM)を導入し,低周波帯と高周波帯を進行順に重畳し,トークン・アロケーション・エントロピーにより適応的にゲートすることができることを示す。
AFMは、再トレーニング、プロンプト編集、パラメータ更新なしに、トークン競合パターンの空間スケールをバイアスする継続的なハンドルを提供する。
安定拡散実験により、AFMは注意スペクトルを確実に再分別し、意味的アライメントを保ちながらかなりの視覚的編集を行うことが示された。
最後に、エントロピーは独立制御軸ではなく、同じ周波数ベースの編集において適応的な利得として機能することを発見した。
関連論文リスト
- LEFT: Learnable Fusion of Tri-view Tokens for Unsupervised Time Series Anomaly Detection [53.191369031661885]
教師なし時系列異常検出は、アノテーションの可用性を前提とせず、異常なタイムスタンプを識別するモデルを構築することを目的としている。
本稿では,非教師付きTSADフレームワークであるLearnable Fusion of Tri-view Tokens(LEFT)について述べる。
実世界のベンチマーク実験では、LEFTはSOTAベースラインに対して最高の検出精度を示し、FLOPの5倍、トレーニングの8倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-02-09T13:33:49Z) - FADTI: Fourier and Attention Driven Diffusion for Multivariate Time Series Imputation [26.523421387059035]
本稿では,FBP(Fourier Bias Projection)モジュールを介して周波数インフォームド特徴変調を注入する拡散型フレームワークであるFADTIを提案する。
新たに導入された生物学的時系列データセットを含む複数のベンチマークの実験は、FADTIが一貫して最先端の手法より優れていることを示している。
論文 参考訳(メタデータ) (2025-12-17T06:16:31Z) - FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution [6.767948729335409]
実像超解像(Real-ISR)は、混合された未知の劣化を伴うLR入力からHR画像の復元を目指している。
バックボーンや推論を変更せずに拡散先を利用するプラグイン・アンド・プレイのトレーニングスキームであるFRAMERを紹介する。
論文 参考訳(メタデータ) (2025-12-01T08:09:05Z) - Morphing Through Time: Diffusion-Based Bridging of Temporal Gaps for Robust Alignment in Change Detection [51.56484100374058]
既存の変更検出ネットワークを変更することなく空間的・時間的ロバスト性を改善するモジュールパイプラインを導入する。
拡散モジュールは、大きな外観ギャップをブリッジする中間変形フレームを合成し、RoMaは段階的に対応を推定できる。
LEVIR-CD、WHU-CD、DSIFN-CDの実験は、登録精度と下流変化検出の両方において一貫した利得を示した。
論文 参考訳(メタデータ) (2025-11-11T08:40:28Z) - Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling [87.34677262370924]
標準離散拡散モデルは、吸収[MASK]トークンにそれらをマッピングすることで、すべての観測されていない状態を同一に扱う。
これは'インフォメーション・ヴォイド'を生成します。そこでは、偽のトークンから推測できるセマンティック情報は、デノイングステップの間に失われます。
連続的拡張離散拡散(Continuously Augmented Discrete Diffusion)は、連続的な潜在空間における対拡散で離散状態空間を拡大するフレームワークである。
論文 参考訳(メタデータ) (2025-10-01T18:00:56Z) - Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning [10.270002679268485]
本稿では、離散ウェーブレット変換を統合してトラジェクトリを低周波成分と高周波成分に分解する拡散型RLフレームワークを提案する。
WFDiffuserは、周波数シフトを効果的に軽減し、スムーズで安定した軌道となり、意思決定性能が向上する。
論文 参考訳(メタデータ) (2025-09-04T08:50:31Z) - Frequency Domain-Based Diffusion Model for Unpaired Image Dehazing [92.61216319417208]
そこで本稿では,未確認データにおける有益な知識を十分に活用するための,新しい周波数領域ベース拡散モデルを提案する。
拡散モデル(DM)が示す強い生成能力に着想を得て,周波数領域再構成の観点からデハージング課題に取り組む。
論文 参考訳(メタデータ) (2025-07-02T01:22:46Z) - Robust Spectral Fuzzy Clustering of Multivariate Time Series with Applications to Electroencephalogram [6.62414474989199]
スペクトル領域にファジィクラスタリングフレームワークを導入し、変数間の周波数特異なモノトニックな関係を抽出する。
本手法は、クラスタリング精度を向上させるために、周波数ベースのクロスリージョン接続パターンを優先的に活用する。
フラッグシップアプリケーションとして脳波記録を解析し,潜在認知状態の周波数・接続性特異的マーカーを明らかにする。
論文 参考訳(メタデータ) (2025-06-28T12:02:01Z) - FreSca: Scaling in Frequency Space Enhances Diffusion Models [55.75504192166779]
本稿では,潜時拡散モデルにおける周波数制御について検討する。
本稿では,低周波成分と高周波成分にノイズ差を分解する新しいフレームワークFreScaを紹介する。
FreScaはモデルの再トレーニングやアーキテクチャの変更なしに動作し、モデルとタスクに依存しない制御を提供する。
論文 参考訳(メタデータ) (2025-04-02T22:03:11Z) - Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators [83.48423407316713]
本稿では,クエリとキーを別々に扱うために,追加の仲介者トークンを組み込んだ新しい拡散トランスフォーマーフレームワークを提案する。
本モデルでは, 正確な非曖昧な段階を呈し, 詳細に富んだ段階へと徐々に遷移する。
本手法は,最近のSiTと統合した場合に,最先端のFIDスコア2.01を達成する。
論文 参考訳(メタデータ) (2024-08-11T07:01:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。