論文の概要: FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection
- arxiv url: http://arxiv.org/abs/2607.05176v1
- Date: Mon, 06 Jul 2026 14:57:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.199231
- Title: FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection
- Title(参考訳): FSDC-DETR:小物体検出のための周波数空間領域協調型DETR
- Abstract要約: 小物体検出(SOD)は、現実世界のアプリケーションでは依然として難しい課題である。
既存の検出器は、暗黙の周波数エイリアスと切り離しで空間的な凝集を絡める厳密な処理によって制限されている。
本稿では,相補的空間および周波数表現を明示的にモデル化した周波数空間協調検出変換器(FSDC-DETR)を提案する。
- 参考スコア(独自算出の注目度): 14.980913285523764
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Small object detection (SOD) remains a challenging task in real-world applications. Despite recent advances, existing detectors remain limited by rigid processing that entangle spatial aggregation with implicit frequency aliasing and truncation, leading to inadequate preservation of high-frequency components for SOD. To tackle these limitations, we propose a Frequency-Spatial Domain Collaborative Detection Transformer (FSDC-DETR), a novel collaborative framework that explicitly models complementary spatial and frequency representations. Specifically, we first introduce Dual-Branch Frequency-Spatial Adaptive Fusion (DBFSAF) to enhance frequency diversity and adaptively capture frequency-spatial domain discriminative representations. Building on these representations, a frequency-spatial interaction scheme is further explored within the hybrid encoder to enable progressive feature propagation to the decoder. In particular, structure-aware frequency-spatial aggregation is achieved through Shunt Frequency-Spatial Feature Fusion (SFS-FF), establishing bidirectional interaction and progressive cross-scale propagation between frequency and spatial representations for coherent discriminative modeling. Meanwhile, informative high-frequency responses are preserved during scale transitions through Frequency-Spatial Dynamic Downsampling (FSD-Down), thereby minimizing frequency degradation throughout multi-scale fusion for the precise SOD. Experimental results demonstrate that FSDC-DETR achieves state-of-the-art performance, improving AP by 6.4 on VisDrone-DET2019 and 6.6 on AITODv2, with gains of 6.8 and 6.9 AP for small objects. The code is available at github.com/nevereverinsomnia/FSDC-DETR.
- Abstract(参考訳): 小物体検出(SOD)は、現実世界のアプリケーションでは依然として難しい課題である。
近年の進歩にもかかわらず、既存の検出器は、暗黙の周波数エイリアスと切り離しで空間的な凝集を絡ませる厳密な処理によって制限されており、SODの高周波成分の保存が不十分である。
これらの制約に対処するために、補間空間および周波数表現を明示的にモデル化する新しい協調フレームワークであるFSDC-DETR(Fluquency-Spatial Domain Collaborative Detection Transformer)を提案する。
具体的には、Dual-Branch Frequency-Spatial Adaptive Fusion (DBFSAF)を導入し、周波数の多様性を高め、周波数-空間領域の識別表現を適応的にキャプチャする。
これらの表現に基づいて、デコーダへのプログレッシブな特徴伝搬を可能にするために、ハイブリッドエンコーダ内で周波数-空間相互作用スキームを探索する。
特に, 周波数-空間的特徴融合(SFS-FF)により, 周波数と空間的表現間の双方向の相互作用と進行的クロススケールな伝播を確立し, 連続的な識別モデルを構築する。
一方、周波数-空間動的ダウンサンプリング(FSD-Down)によるスケール遷移の間は、情報的高周波応答が保存され、精度の高いSODのマルチスケール核融合における周波数劣化が最小化される。
実験の結果、FSDC-DETRは最先端の性能を達成し、VisDrone-DET2019で6.4、AITODv2で6.6、小天体で6.8、APで6.9、APで6.9の改善を実現している。
コードはgithub.com/nevereverinsomnia/FSDC-DETRで入手できる。
関連論文リスト
- MDAFNet: Multiscale Differential Edge and Adaptive Frequency Guided Network for Infrared Small Target Detection [5.434562114399152]
赤外線小目標検出は、多くの軍事・民間用途において重要な役割を担っている。
既存の手法では、ネットワーク層の数が増えるにつれて、ターゲットのエッジピクセルが徐々に劣化していく。
本稿では,Multi-Scale Differential Edge(MSDE)モジュールとDual-Domain Adaptive Feature Enhancement(DAFE)モジュールを統合したMDAFNetを提案する。
論文 参考訳(メタデータ) (2026-01-23T04:16:16Z) - SONAR: Spectral-Contrastive Audio Residuals for Generalizable Deepfake Detection [6.042897432654865]
Spectral-cONtrastive Audio Residuals (AR)は、ディープフェイクオーディオ検出器のための周波数誘導フレームワークである。
ARは音声信号を補完表現に切り離す。
ASVspoof 2021およびin-the-wildベンチマークで評価した。
論文 参考訳(メタデータ) (2025-11-26T12:16:38Z) - SFFR: Spatial-Frequency Feature Reconstruction for Multispectral Aerial Object Detection [12.521255528136278]
本研究では,新しい空間周波数特徴再構成法 (SFFR) を提案する。
特徴融合の前に空間領域と周波数領域の相補表現を再構成する。
提案するFCEKANモジュールとMSGKANモジュールは相補的であり,それぞれの周波数と空間的意味的特徴を効果的に捉えることができることを示す。
論文 参考訳(メタデータ) (2025-11-09T09:34:10Z) - Wavelet-Guided Dual-Frequency Encoding for Remote Sensing Change Detection [67.84730634802204]
リモートセンシング画像の変化検出は,自然災害監視,都市拡張追跡,インフラ管理など,さまざまな工学的応用において重要な役割を担っている。
既存のほとんどの手法は空間領域モデリングに依存しており、特徴表現の限られた多様性は微妙な変化領域の検出を妨げる。
本研究では、特にウェーブレット領域における周波数領域の特徴モデリングが周波数成分の微細な違いを増幅し、空間領域において捉えにくいエッジ変化の知覚を高めることを観察する。
論文 参考訳(メタデータ) (2025-08-07T11:14:16Z) - SWAN: Synergistic Wavelet-Attention Network for Infrared Small Target Detection [8.098063209250684]
赤外線小目標検出(IRSTD)は、民間および軍事用途において重要である。
近年の手法は局所的な空間パターンを主に捉えた従来の畳み込み処理に重点を置いている。
空間領域と周波数領域の両方からターゲットを知覚する新しいフレームワークであるSynergistic Wavelet-Attention Network (SWAN)を提案する。
論文 参考訳(メタデータ) (2025-08-02T11:26:58Z) - Efficient Dual-domain Image Dehazing with Haze Prior Perception [26.57698394898644]
トランスフォーマーベースのモデルは、シングルイメージのデハージングにおいて強力なグローバルモデリング能力を示すが、その高い計算コストはリアルタイム適用性を制限する。
そこで我々はDGFDNet(Dark Channel Guided Frequency-aware Dehazing Network)を提案する。
4つのベンチマークハウズデータセットの実験により、DGFDNetは、より優れた堅牢性とリアルタイム効率で最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-07-15T06:56:56Z) - FADPNet: Frequency-Aware Dual-Path Network for Face Super-Resolution [70.61549422952193]
計算コストの制限による顔超解像(FSR)は未解決の問題である。
既存のアプローチでは、全ての顔のピクセルを等しく扱い、計算資源を最適以下に割り当てる。
本稿では、低周波成分と高周波成分に顔の特徴を分解する周波数対応デュアルパスネットワークであるFADPNetを提案する。
論文 参考訳(メタデータ) (2025-06-17T02:33:42Z) - PAD: Phase-Amplitude Decoupling Fusion for Multi-Modal Land Cover Classification [49.37555541088792]
位相振幅デカップリング(PAD)は、位相(モダリティ共有)と振幅(モダリティ補完)を分離する周波数対応のフレームワークである。
この研究は、リモートセンシングにおける物理を意識したマルチモーダル融合の新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-04-27T07:21:42Z) - Frequency-aware Feature Fusion for Dense Image Prediction [99.85757278772262]
本稿では,高密度画像予測のための周波数認識機能融合(FreqFusion)を提案する。
FreqFusionは、Adaptive Low-Pass Filter (ALPF) ジェネレータ、オフセットジェネレータ、Adaptive High-Pass Filter (AHPF) ジェネレータを統合する。
包括的可視化と定量的分析は、FreqFusionが機能一貫性を効果的に改善し、オブジェクト境界を鋭くすることを示している。
論文 参考訳(メタデータ) (2024-08-23T07:30:34Z) - Frequency-Aware Deepfake Detection: Improving Generalizability through
Frequency Space Learning [81.98675881423131]
この研究は、目に見えないディープフェイク画像を効果的に識別できるユニバーサルディープフェイク検出器を開発するという課題に対処する。
既存の周波数ベースのパラダイムは、偽造検出のためにGANパイプラインのアップサンプリング中に導入された周波数レベルのアーティファクトに依存している。
本稿では、周波数領域学習を中心にしたFreqNetと呼ばれる新しい周波数認識手法を導入し、ディープフェイク検出器の一般化性を高めることを目的とする。
論文 参考訳(メタデータ) (2024-03-12T01:28:00Z) - Adaptive Frequency Learning in Two-branch Face Forgery Detection [66.91715092251258]
本稿では、AFDと呼ばれる2分岐検出フレームワークにおいて、周波数情報を適応的に学習する手法を提案する。
我々は、固定周波数変換からネットワークを解放し、データおよびタスク依存の変換層でより良いパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-03-27T14:25:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。