論文の概要: LDFE: Laplacian Decoupled Feature Enhancement Block for Dual-Stream CNN-based RGB-IR Object Detection
- arxiv url: http://arxiv.org/abs/2607.08076v1
- Date: Thu, 09 Jul 2026 03:11:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.401978
- Title: LDFE: Laplacian Decoupled Feature Enhancement Block for Dual-Stream CNN-based RGB-IR Object Detection
- Title(参考訳): LDFE:Dual-Stream CNN-based RGB-IR Object Detectionのためのラプラシアンデカップリング機能拡張ブロック
- Authors: Wenhao Dong, Xiaoyan Luo, Linlin Yang, Haodong Zhu, Xiaorong Shi, Guodong Guo, Baochang Zhang,
- Abstract要約: 既存の方法は、特徴抽出のためにYOLO上に構築されたデュアルストリームCNNバックボーンを好む。
本稿では,Laplacian Decoupled Feature Enhancement Block (LDFE)を導入し,CNNバックボーンの異なるステージから特徴を抽出する。
- 参考スコア(独自算出の注目度): 42.233702113689695
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The complementary information between RGB and IR images can significantly enhance object detection performance under extreme conditions. Existing methods prefer dual-stream CNN backbones built upon YOLO for feature extraction and focus on the design of feature fusion. In this paper, we introduce the Laplacian Decoupled Feature Enhancement block (LDFE) to fuse features from different stages of the dual-stream CNN backbone. By design, LDFE simultaneously considers the characteristics of modalities and structures for feature fusion by employing global-local decomposition, denoising, fusion, and reconstruction, sequentially. The LDFE first separates features into global and local components based on Laplacian Pyramid, and then performs denoising and fusion based on Global State Space Enhancement module (GS2E) and Local Convolutional Correlation Enhancement module (LC2E) separately. Specifically, the GS2E conducts a two-branch architecture for the main and auxiliary modalities. It dynamically suppresses noise in the main modality through cross-modal attention derived from the auxiliary modality, while employing a State Space Model to capture long-range dependencies within the global feature representations of the main modality. To obtain bidirectional interaction, the two modalities systematically alternate their main/auxiliary roles. Moreover, the LC2E suppresses noise in local features and leverages spatial and channel dimension along with triple convolution to extract fine-grained details for fusion. These innovative designs achieve a significant performance improvement, with mAP surpassing the SOTA methods 6.2%, 3.7%, 4.7%, 2.3%, 4.1% and 2.0% on M3FD, DroneVehicle, LLVIP, FLIR-Aligned, KAIST and VEDAI datasets,respectively.
- Abstract(参考訳): RGB画像とIR画像の相補的な情報は、極端な条件下での物体検出性能を大幅に向上させることができる。
既存の方法は、特徴抽出のためにYOLO上に構築されたデュアルストリームCNNバックボーンを好んでおり、特徴融合の設計に重点を置いている。
本稿では,Laplacian Decoupled Feature Enhancement Block (LDFE)を導入し,CNNバックボーンの異なるステージから特徴を抽出する。
LDFEは,グローバルな局所分解,デノナイジング,融合,再構築を連続的に行うことで,特徴融合のモダリティと構造の特徴を同時に考察する。
LDFEはまず、ラプラシアピラミッドに基づくグローバルコンポーネントとローカルコンポーネントを分離し、グローバルステートスペース拡張モジュール(GS2E)とローカルコンボリューショナルコンボリューショナル・コンポレーション・エンハンスメントモジュール(LC2E)を別々に使用する。
具体的には、GS2Eは主および補助モダリティのための2分岐アーキテクチャを実行する。
主モーダルのグローバルな特徴表現内での長距離依存性を捉えるためにステートスペースモデルを用いて、補助モーダルに由来するクロスモーダルな注意を通して主モーダルのノイズを動的に抑制する。
双方向の相互作用を得るために、2つのモダリティは、それぞれの主役と副役を体系的に交互に交互に行う。
さらに、LC2Eは局所的な特徴のノイズを抑制し、三重畳み込みとともに空間とチャネルの次元を活用し、核融合の詳細な詳細を抽出する。
これらの革新的な設計は、MAPがSOTA法を6.2%、3.7%、4.7%、2.3%、4.1%、2.0%を超え、M3FD、DroneVehicle、LLVIP、FLIR-Aligned、KAIST、VEDAIのデータセットを上回り、大幅な性能向上を実現している。
関連論文リスト
- Pyramidal Adaptive Cross-Gating for Multimodal Detection [0.0]
PACGNetは、バックボーン内で深い融合を実行するように設計されたアーキテクチャである。
Pモジュールは、プログレッシブ階層的ゲーティング機構を通じて特徴階層を再構築する。
私たちのPACGNetは、mAP50スコアがそれぞれ81.7%と82.1%という、最先端のベンチマークを新たに設定しています。
論文 参考訳(メタデータ) (2025-12-20T09:32:18Z) - Residual Prior-driven Frequency-aware Network for Image Fusion [6.90874640835234]
画像融合は、高品質な融合画像を生成するために、モダリティにまたがる相補的な情報を統合することを目的としている。
本稿ではRPFNetと呼ばれる残差優先周波数対応ネットワークを提案する。
論文 参考訳(メタデータ) (2025-07-09T10:48:00Z) - MS-Occ: Multi-Stage LiDAR-Camera Fusion for 3D Semantic Occupancy Prediction [15.656771219382076]
MS-Occは、新しいマルチステージLiDARカメラ融合フレームワークである。
これはLiDARの幾何学的忠実度とカメラベースのセマンティックリッチネスを統合する。
実験の結果、MS-Occは連合(IoU)を32.1%、平均IoU(mIoU)を25.3%で割った。
論文 参考訳(メタデータ) (2025-04-22T13:33:26Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - Dual Mutual Learning Network with Global-local Awareness for RGB-D Salient Object Detection [10.353412441955436]
本研究では,グローバルな相互学習ネットワークであるGL-DMNetを提案する。
異なるモード間の相互依存性を利用するために,位置相互融合モジュールとチャネル相互融合モジュールを提案する。
提案するGL-DMNetは, 24 RGB-D SOD法よりも優れた性能を示し, 平均3%の改善を実現している。
論文 参考訳(メタデータ) (2025-01-03T05:37:54Z) - PVAFN: Point-Voxel Attention Fusion Network with Multi-Pooling Enhancing for 3D Object Detection [59.355022416218624]
点とボクセルの表現の統合は、LiDARベースの3Dオブジェクト検出においてより一般的になりつつある。
PVAFN(Point-Voxel Attention Fusion Network)と呼ばれる新しい2段3次元物体検出器を提案する。
PVAFNはマルチプール戦略を使用して、マルチスケールとリージョン固有の情報を効果的に統合する。
論文 参考訳(メタデータ) (2024-08-26T19:43:01Z) - CDDFuse: Correlation-Driven Dual-Branch Feature Decomposition for
Multi-Modality Image Fusion [138.40422469153145]
本稿では,CDDFuse(Relationed-Driven Feature Decomposition Fusion)ネットワークを提案する。
近赤外可視画像融合や医用画像融合など,複数の融合タスクにおいてCDDFuseが有望な結果をもたらすことを示す。
論文 参考訳(メタデータ) (2022-11-26T02:40:28Z) - RGB-D Salient Object Detection with Cross-Modality Modulation and
Selection [126.4462739820643]
本稿では, RGB-D Salient Object Detection (SOD) において, モジュール間相補性を段階的に統合し, 改良する有効な方法を提案する。
提案するネットワークは,1)RGB画像とそれに対応する深度マップからの補完情報を効果的に統合する方法,および2)より精度の高い特徴を適応的に選択する方法の2つの課題を主に解決する。
論文 参考訳(メタデータ) (2020-07-14T14:22:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。