論文の概要: WD-FQDet: Multispectral Detection Transformer via Wavelet Decomposition and Frequency-aware Query Learning
- arxiv url: http://arxiv.org/abs/2605.13621v1
- Date: Wed, 13 May 2026 14:51:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:28.115618
- Title: WD-FQDet: Multispectral Detection Transformer via Wavelet Decomposition and Frequency-aware Query Learning
- Title(参考訳): WD-FQDet:ウェーブレット分解と周波数対応クエリ学習によるマルチスペクトル検出変換器
- Authors: Chunjin Yang, Xiwei Zhang, Yiming Xiao, Fanman Meng,
- Abstract要約: そこで本研究では,赤外線と可視光からのモダリティ共有情報とモダリティ固有情報を明確に分離する新しい検出フレームワークを提案する。
FLIR、LLVIP、M3FDデータセットの実験結果から、WD-FQDetは複数の評価指標で最先端のパフォーマンスを達成することが示された。
- 参考スコア(独自算出の注目度): 20.245276698663115
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Infrared-visible object detection improves detection performance by combining complementary features from multispectral images. Existing backbone-specific and backbone-shared approaches still suffer from the problems of severe bias of modality-shared features and the insufficiency of modality-specific features. To address these issues, we propose a novel detection framework WD-FQDet that explicitly decouples modality-shared and modality-specific information from infrared and visible modalities in the new view of low- and high-frequency domains, allowing fusion strategies tailored to their frequency characteristics. Specifically, a low-frequency homogeneity alignment module is proposed to align modality-shared features across modalities via a cross-modal attention mechanism, and a high-frequency specificity retention module is proposed to preserve modality-specific features through the multi-scale gradient consistency loss. To reinforce the feature representation in the frequency domain, we propose a hybrid feature enhancement module that incorporates spatial cues. Furthermore, considering that the contributions of homogeneous and modality-specific features to object detection vary across scenarios, we propose a frequency-aware query selection module to dynamically regulate their contributions. Experimental results on the FLIR, LLVIP, and M3FD datasets demonstrate that WD-FQDet achieves state-of-the-art performance across multiple evaluation metrics.
- Abstract(参考訳): 赤外線可視物体検出は、マルチスペクトル画像からの相補的特徴を組み合わせることにより、検出性能を向上させる。
既存のバックボーン特異的およびバックボーン共有アプローチは、モダリティ共有特徴の深刻な偏見と、モダリティ特異的特徴の欠如に悩まされている。
これらの課題に対処するために、低周波領域と高周波領域の新たな視点において、赤外線と可視モードからモダリティとモダリティの情報を明示的に分離する新しい検出フレームワークWD-FQDetを提案する。
具体的には、低周波の均一性アライメントモジュールを提案し、モーダル間のアライメント機構を介してモーダル間のモーダル性共有特徴を整列させ、マルチスケールの勾配整合損失を通じてモーダル性特異的特徴を保ちながら高周波特異性保持モジュールを提案する。
周波数領域における特徴表現を強化するために,空間的手がかりを組み込んだハイブリッド特徴強調モジュールを提案する。
さらに,オブジェクト検出に対する均質性やモダリティに特有な特徴の寄与がシナリオによって異なることを考慮し,動的にコントリビューションを調節する周波数対応クエリ選択モジュールを提案する。
FLIR、LLVIP、M3FDデータセットの実験結果から、WD-FQDetは複数の評価指標で最先端のパフォーマンスを達成することが示された。
関連論文リスト
- FreDFT: Frequency Domain Fusion Transformer for Visible-Infrared Object Detection [32.27664742588076]
可視赤外物体検出のための周波数領域融合変換器FreDFTを提案する。
提案手法は、変調と周波数フィードフォワード層の間の相補的な情報をマイニングするために、新しいマルチモーダル周波数アテンション(MFDA)を用いる。
提案するFreDFTは,他の最先端手法と比較して,複数の公開データセット上で優れた性能を発揮する。
論文 参考訳(メタデータ) (2025-11-13T07:46:18Z) - Frequency-Domain Decomposition and Recomposition for Robust Audio-Visual Segmentation [60.9960601057956]
本稿では2つの主要なモジュールからなる周波数対応オーディオ・ビジュアルコンポスタ(FAVS)フレームワークを紹介する。
FAVSフレームワークは、3つのベンチマークデータセットで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-09-23T12:33:48Z) - IRDFusion: Iterative Relation-Map Difference guided Feature Fusion for Multispectral Object Detection [23.256601188227865]
クロスモーダルな特徴のコントラストとスクリーニング戦略に基づく,革新的な機能融合フレームワークを提案する。
提案手法は,オブジェクト認識の相補的クロスモーダル特徴を融合させることにより,有能な構造を適応的に強化する。
IRDFusionは、様々な挑戦的なシナリオで既存のメソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2025-09-11T01:22:35Z) - AuxDet: Auxiliary Metadata Matters for Omni-Domain Infrared Small Target Detection [49.81255045696323]
補助メタデータ駆動型赤外小型ターゲット検出器(AuxDet)について述べる。
AuxDetはメタデータセマンティクスと視覚的特徴を統合し、各サンプルに対する適応表現学習を導く。
挑戦的なWideIRSTD-Fullベンチマークの実験は、AuxDetが一貫して最先端のメソッドより優れていることを示した。
論文 参考訳(メタデータ) (2025-05-21T07:02:05Z) - Accelerated Multi-Contrast MRI Reconstruction via Frequency and Spatial Mutual Learning [50.74383395813782]
本稿では,周波数・空間相互学習ネットワーク(FSMNet)を提案する。
提案したFSMNetは, 加速度係数の異なるマルチコントラストMR再構成タスクに対して, 最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-09-21T12:02:47Z) - Modality Prompts for Arbitrary Modality Salient Object Detection [57.610000247519196]
本論文は、任意のモーダリティ・サリエント物体検出(AM SOD)の課題について述べる。
任意のモダリティ、例えばRGBイメージ、RGB-Dイメージ、RGB-D-Tイメージから有能なオブジェクトを検出することを目的としている。
AM SODの2つの基本的な課題を解明するために,新しいモード適応トランス (MAT) を提案する。
論文 参考訳(メタデータ) (2024-05-06T11:02:02Z) - Frequency Domain Modality-invariant Feature Learning for
Visible-infrared Person Re-Identification [79.9402521412239]
本稿では、周波数領域から見たモダリティの相違を低減するために、新しい周波数領域モダリティ不変特徴学習フレームワーク(FDMNet)を提案する。
我々のフレームワークでは、インスタンス適応振幅フィルタ(IAF)とPhrase-Preserving Normalization(PPNorm)という、2つの新しいモジュールを導入している。
論文 参考訳(メタデータ) (2024-01-03T17:11:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。