論文の概要: CFGPNet: Cross-Attention-Based Fused Gradient Programmed Network Framework for Multispectral Object Detection
- arxiv url: http://arxiv.org/abs/2608.06205v1
- Date: Thu, 06 Aug 2026 15:59:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.948306
- Title: CFGPNet: Cross-Attention-Based Fused Gradient Programmed Network Framework for Multispectral Object Detection
- Title(参考訳): CFGPNet:マルチスペクトルオブジェクト検出のためのクロスアテンションベース融合型プログラミングネットワークフレームワーク
- Abstract要約: RGB-Tオブジェクト検出は、可視画像と赤外線画像の相補的な強度を活用し、低照度、悪天候、複雑なマルチスケール環境における堅牢な認識をサポートする。
既存の手法はいまだにクロスモーダル相互作用が不十分で、モダリティ分布ギャップからの不安定な融合と高い計算コストに悩まされている。
CFGPNetはマルチスペクトルオブジェクト検出のためのクロスアテンションベースフューズド・グラディエント・プログラム・ネットワークフレームワークである。
- 参考スコア(独自算出の注目度): 4.299007466612815
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: RGB--T object detection exploits the complementary strengths of visible and infrared imagery, supporting robust perception in low-light, adverse-weather, and complex multi-scale environments. However, existing methods still suffer from insufficient cross-modal interaction, unstable fusion from modality distribution gaps, and the high computational cost of heavy attention-based architectures. To address these issues, CFGPNet is proposed, a Cross-Attention-Based Fused Gradient Programmed Network framework for multispectral object detection. CFGPNet uses an improved GELAN backbone with RepViT-style re-parameterized blocks to strengthen feature representation while preserving computational efficiency. A Cross Computation Efficient Attention (CrossCEA) module is introduced to enhance cross-modal feature interaction and reduce redundant information transfer between visible and thermal branches. To generate compact and discriminative fused representations, an Attention Selection and Aggregation Fusion (ASAF) network combines dense feature aggregation with selective attention-based emphasis. Moreover, a programmable-gradient auxiliary branch is integrated into each CFGPNet variant to improve gradient delivery and optimization quality. Experiments on five public multispectral benchmarks, FLIR, M3FD, LLVIP, VEDAI, and MFAD, demonstrate that CFGPNet achieves strong and consistent performance across diverse scenes, object scales, and modality balances. In particular, the framework attains 80.7% mAP50 / 45.0% mAP50:95 on FLIR, 89.9% / 63.4% on M3FD, and 97.8% / 68.9% on LLVIP. It also reaches 83.3% / 56.9% on VEDAI and 83.4% / 61.8% on MFAD. These results show that CFGPNet is an effective, practical solution offering useful accuracy--efficiency trade-offs across three model scales. The code, data, and fine-tuned models are available at https://github.com/NimaHatami99/CFGPNet.
- Abstract(参考訳): RGB-Tオブジェクト検出は、可視画像と赤外線画像の相補的な強度を活用し、低照度、悪天候、複雑なマルチスケール環境における堅牢な認識をサポートする。
しかし, 既存の手法は, クロスモーダル相互作用の不足, モーダル分布ギャップからの不安定な融合, 重注意アーキテクチャの計算コストの増大に悩まされている。
これらの問題に対処するため、CFGPNetはマルチスペクトルオブジェクト検出のためのクロスアテンションベースフューズド・グラディエント・プログラム・ネットワークフレームワークである。
CFGPNetは改良されたGELANバックボーンとRepViTスタイルの再パラメータ化ブロックを使用して、計算効率を保ちながら特徴表現を強化する。
Cross Computation Efficient Attention (CrossCEA)モジュールが導入された。
コンパクトで差別的な融合表現を生成するために、高密度特徴集約と選択的注意に基づく強調を結合した注意選択凝集融合(ASAF)ネットワークを提供する。
さらに、プログラム可能な段階的補助分岐を各CFGPNet変種に統合し、勾配配信と最適化品質を改善する。
FLIR、M3FD、LLVIP、VEDAI、MFADの5つの公開マルチスペクトルベンチマークの実験は、CFGPNetが様々なシーン、オブジェクトスケール、モダリティバランスで強力で一貫したパフォーマンスを達成することを示した。
特に、FLIRでは80.7% mAP50 / 45.0% mAP50:95、M3FDでは89.9% / 63.4%、LLVIPでは97.8% / 68.9%に達する。
また、VEDAIでは83.3% / 56.9%、MFADでは83.4% / 61.8%に達する。
これらの結果から,CFGPNetは3つのモデルスケールにまたがる有用な精度-効率トレードオフを提供する,効果的で実用的なソリューションであることが示唆された。
コード、データ、微調整されたモデルはhttps://github.com/NimaHatami99/CFGPNetで入手できる。
関連論文リスト
- Modality-Decoupled Federated Learning for Privacy-Preserving Embodied Intelligence in 6G [90.42669277637026]
第6世代(6G)無線ネットワークは、大規模なインボディードインテリジェンスのための重要な基盤を提供すると期待されている。
本稿では、6Gネットワークにおけるプライバシー保護型インテリジェンスのためのモダリティ分離FLフレームワークであるFedMVLAを提案する。
論文 参考訳(メタデータ) (2026-09-09T01:36:44Z) - LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data [0.0]
本稿では,現在のビジョンに基づくレール欠陥検出手法の限界に対処する。
本稿では,RGB-Dデータを利用した軽量ピラミッドクロスアテンションネットワーク(LPCANet)を提案する。
LPCANetは990万のパラメータ、2.50GのFLOP、162.60fpsの推論速度で最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-14T03:35:09Z) - MS-ISSM: Objective Quality Assessment of Point Clouds Using Multi-scale Implicit Structural Similarity [65.85858856481131]
点雲の非構造的で不規則な性質は、客観的品質評価(PCQA)に重大な課題をもたらす
マルチスケールインシシシット構造類似度測定(MS-ISSM)を提案する。
論文 参考訳(メタデータ) (2026-01-03T14:58:52Z) - Physics-Inspired Modeling and Content Adaptive Routing in an Infrared Gas Leak Detection Network [19.83756107644484]
赤外線ガス漏れを検出する物理エッジハイブリッドガスダイナミックルーティングネットワーク(PEG-DRNet)を提案する。
PEG-DRNetは、精度と計算効率の最良のバランスで、より優れた全体的な性能を達成する。
論文 参考訳(メタデータ) (2025-12-29T06:28:20Z) - Cross-Layer Feature Self-Attention Module for Multi-Scale Object Detection [14.148258708632211]
Cross-Layer Feature Self-Attention Module (CFSAM)
CFSAMは、マルチスケールの機能マップ内のローカルとグローバルの両方の依存関係をホリスティックにモデル化する。
SSD300フレームワークに統合されると、CFSAMは検出性能を大幅に向上する。
論文 参考訳(メタデータ) (2025-10-16T14:25:21Z) - Efficient Leaf Disease Classification and Segmentation using Midpoint Normalization Technique and Attention Mechanism [0.0]
画像前処理のための2段階変換手法であるミドルポイント正規化(MPN)を導入する。
分類パイプラインは、例外的なクラスバランスを維持しながら、93%の精度を達成する。
セグメンテーションタスクでは,MPNを付加した入力を用いて,U-Netアーキテクチャ内の同一の注意ブロックをシームレスに統合する。
論文 参考訳(メタデータ) (2025-05-27T15:14:04Z) - MSCA-Net:Multi-Scale Context Aggregation Network for Infrared Small Target Detection [0.1759252234439348]
本稿では,3つのキーコンポーネントを統合したMSCA-Netというネットワークアーキテクチャを提案する。
MSEDAは、異なるスケールにわたる情報を適応的に集約するために、マルチスケールのフュージョンアテンション機構を使用している。
PCBAMは相関行列に基づく戦略によりグローバル特徴と局所特徴の相関を捉える。
CABは、それらに重みを割り当て、低レベル情報と高レベル情報を統合することで、重要な特徴の表現を強化する。
論文 参考訳(メタデータ) (2025-03-21T14:42:31Z) - Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection [70.84835546732738]
RGB-Thermal Salient Object Detectionは、目視と熱赤外画像のペア内の目立つ物体をピンポイントすることを目的としている。
従来のエンコーダ・デコーダアーキテクチャは、欠陥モードから生じるノイズに対する頑健さを十分に考慮していなかったかもしれない。
本稿では,Divide-and-Conquer戦略を用いた,堅牢なConfluent Triple-Flow NetworkであるConTriNetを提案する。
論文 参考訳(メタデータ) (2024-12-02T14:44:39Z) - PVAFN: Point-Voxel Attention Fusion Network with Multi-Pooling Enhancing for 3D Object Detection [59.355022416218624]
点とボクセルの表現の統合は、LiDARベースの3Dオブジェクト検出においてより一般的になりつつある。
PVAFN(Point-Voxel Attention Fusion Network)と呼ばれる新しい2段3次元物体検出器を提案する。
PVAFNはマルチプール戦略を使用して、マルチスケールとリージョン固有の情報を効果的に統合する。
論文 参考訳(メタデータ) (2024-08-26T19:43:01Z) - Feature Aggregation and Propagation Network for Camouflaged Object
Detection [42.33180748293329]
カモフラージュされたオブジェクト検出(COD)は、環境に埋め込まれたカモフラージュされたオブジェクトを検出し、分離することを目的としている。
いくつかのCOD法が開発されているが, 前景オブジェクトと背景環境との固有の類似性により, 依然として不満足な性能に悩まされている。
カモフラージュされた物体検出のための新しい特徴集約・伝播ネットワーク(FAP-Net)を提案する。
論文 参考訳(メタデータ) (2022-12-02T05:54:28Z) - SafeSpace MFNet: Precise and Efficient MultiFeature Drone Detection
Network [12.221253007423394]
MultiFeatureNet(MFNet)は、最も集中した特徴マップをキャプチャすることで特徴表現を強化するソリューションである。
MFNet-FAは入力特徴写像の異なるチャネルを適応的に重み付けする手法である。
フォーカスモジュールを用いたMFNet-L(Ablation study 2)は,最も顕著な分類結果を示す。
論文 参考訳(メタデータ) (2022-11-30T06:56:39Z) - SFNet: Faster and Accurate Semantic Segmentation via Semantic Flow [88.97790684009979]
性能を改善するための一般的な実践は、強力な意味表現を持つ高解像度の特徴写像を得ることである。
隣接レベルの特徴マップ間のテキストセマンティックフローを学習するためのフローアライメントモジュール(FAM)を提案する。
また,高分解能特徴写像と低分解能特徴写像を直接整列するGated Dual Flow Alignment Moduleを提案する。
論文 参考訳(メタデータ) (2022-07-10T08:25:47Z) - Resource Allocation in Multicore Elastic Optical Networks: A Deep
Reinforcement Learning Approach [47.187609203210705]
新しい環境はOpenAIのGymと互換性がある。
ネットワーク状態と物理層関連の側面を考慮してエージェントアクションを処理する。
ベストパフォーマンス剤は、ブロッキング確率の4倍の低下を達成する。
論文 参考訳(メタデータ) (2022-07-05T14:24:21Z) - Hierarchical Dynamic Filtering Network for RGB-D Salient Object
Detection [91.43066633305662]
RGB-D Salient Object Detection (SOD) の主な目的は、相互融合情報をよりよく統合し活用する方法である。
本稿では,これらの問題を新たな視点から考察する。
我々は、より柔軟で効率的なマルチスケールのクロスモーダルな特徴処理を実装している。
論文 参考訳(メタデータ) (2020-07-13T07:59:55Z) - Cross-layer Feature Pyramid Network for Salient Object Detection [102.20031050972429]
本稿では,有能な物体検出における進行的融合を改善するために,新しいクロス層特徴ピラミッドネットワークを提案する。
レイヤごとの分散機能は、他のすべてのレイヤからセマンティクスと健全な詳細の両方を同時に所有し、重要な情報の損失を減らします。
論文 参考訳(メタデータ) (2020-02-25T14:06:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。