論文の概要: Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion
- arxiv url: http://arxiv.org/abs/2606.30215v1
- Date: Mon, 29 Jun 2026 12:28:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.215758
- Title: Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion
- Title(参考訳): Sparse Cross-Modality FusionによるRGB-Tオブジェクトの効率的な検出
- Abstract要約: RGB-T検出器は可視光と熱赤外モードの相補的な強度を利用する。
それらの多くは、重い双対のバックボーンと、全体像にまたがる徹底的な相互モダリティ融合に頼っている。
効率的なRGB-T検出のためのスパース融合機構を提案する。
- 参考スコア(独自算出の注目度): 16.654966330137054
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: RGB-T detectors leverage the complementary strengths of visible and thermal infrared modalities, achieving robust performance under challenging conditions. Many of them resort to heavy dual backbones and exhaustive cross-modality fusion across the entire image, leading to impractically high computational costs. We observe that most image regions are smooth backgrounds (e.g., sky, ground) that can be easily handled by lightweight single-modality models. In light of this observation, we propose a sparse fusion mechanism for efficient RGB-T detection: first rapidly scanning the image to identify the proposals and then carefully examining the remaining sparse proposals via feature fusion. We propose a two-stage framework to instantiate this mechanism, which performs detection in two stages: 1) a lightweight and modality-specific detection stage that produces high-recall RoIs, and 2) a fusion-driven examination and refinement stage that filters out the false positives and refines the bounding boxes. This design enables the detector to adaptively allocate more computational resources to the potential foregrounds, improving the efficiency while ensuring detection accuracy. Extensive experiments show that our method achieves competitive performance with substantially fewer parameters and lower cost, while maintaining strong scalability to high-resolution images.
- Abstract(参考訳): RGB-T検出器は可視および熱赤外モードの相補的な強度を活用し、困難な条件下で堅牢な性能を達成する。
それらの多くは、重い双対のバックボーンと、画像全体にわたる徹底的な相互モダリティ融合を頼りにしており、不規則に高い計算コストをもたらしている。
多くの画像領域はスムーズな背景(例えば、空、地面)であり、軽量な単一モダリティモデルで容易に処理できる。
そこで本研究では,RGB-T検出を効率的に行うためのスパース融合機構を提案する。
このメカニズムをインスタンス化するための2段階のフレームワークを提案する。
1)ハイリコールRoIを発生させる軽量かつモダリティ特異的な検出段階、及び
2) 偽陽性を除去し, 境界箱を精製する, 核融合反応による検査・精錬段階。
この設計により、検出器はより多くの計算資源を潜在的フォアグラウンドに適応的に割り当てることができ、検出精度を確保しながら効率を向上させることができる。
大規模な実験により,高解像度画像に対する高いスケーラビリティを維持しつつ,パラメータが大幅に小さく,低コストで競合性能を達成できることが示されている。
関連論文リスト
- RA-SOD: Reliability-Aware RGB-T Salient Object Detection under Modality Degradation [23.43264234749439]
信頼性を考慮したRGB-T有能なオブジェクト検出フレームワークであるRA-SODを提案する。
RA-SODは、モダリティの信頼性を特徴学習とクロスモーダル融合に統合する。
実験により、RA-SODは最先端性能を示し、重度モード劣化下で強靭性を示す。
論文 参考訳(メタデータ) (2026-09-11T09:22:20Z) - Lightweight Interpretable RGB-Guided Hyperspectral Super-Resolution under Real Cross-resolution Misalignment [6.5685272845309255]
RGB誘導ハイパースペクトル超解像は、高解像度のRGBガイドから低解像度のハイパースペクトル画像へ空間的詳細を転送する。
モデルベースGram-Schmidtization fusionとクロスモーダルフローアライメントを組み合わせた軽量かつ解釈可能なRGB誘導型HSRフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-01T10:55:11Z) - Modality-Decoupled RGB-Thermal Object Detector via Query Fusion [15.717929078660227]
本稿では,モダリティ補間と分離のバランスをとるために,MDQF (Query Fusion) を用いたモダリティ分離RGB-T検出フレームワークを提案する。
提案手法は既存のRGB-T検出器に優れた性能を提供し,モダリティ独立性を向上する。
論文 参考訳(メタデータ) (2026-01-13T11:32:29Z) - A Fusion-Guided Inception Network for Hyperspectral Image Super-Resolution [4.487807378174191]
我々はFusion-Guided Inception Network (FGIN)と呼ばれる単一画像の超解像モデルを提案する。
具体的には、まずスペクトル空間融合モジュールを用いて、スペクトル情報と空間情報を効果的に統合する。
インセプションのような階層的特徴抽出戦略は、マルチスケール空間依存をキャプチャするために用いられる。
再構成品質をさらに向上するため,バイリニアと奥行き分離可能な畳み込みを組み合わせた最適化されたアップサンプリングモジュールを組み込んだ。
論文 参考訳(メタデータ) (2025-05-06T11:15:59Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - Bringing RGB and IR Together: Hierarchical Multi-Modal Enhancement for Robust Transmission Line Detection [67.02804741856512]
高速かつ高精度なTL検出のために,RGBとIRデータを統合したHMMEN(Hierarchical Multi-Modal Enhancement Network)を提案する。
提案手法では,(1)階層的RGBおよびIR特徴写像を大まかに融合・拡張するMMEB,(2)デコーダ出力とIR特徴写像の不整合を変形可能な畳み込みを利用して補正するFAB,の2つの重要な構成要素を紹介する。
論文 参考訳(メタデータ) (2025-01-25T06:21:06Z) - Optimizing Multispectral Object Detection: A Bag of Tricks and Comprehensive Benchmarks [49.84182981950623]
RGBおよびTIR(熱赤外)変調を利用したマルチスペクトル物体検出は,課題として広く認識されている。
モダリティと堅牢な融合戦略の両方から特徴を効果的に抽出するだけでなく、スペクトルの相違といった問題に対処する能力も必要である。
本稿では,高パフォーマンス単一モードモデルのシームレスな最適化が可能な,効率的かつ容易にデプロイ可能なマルチスペクトルオブジェクト検出フレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-27T12:18:39Z) - CDDFuse: Correlation-Driven Dual-Branch Feature Decomposition for
Multi-Modality Image Fusion [138.40422469153145]
本稿では,CDDFuse(Relationed-Driven Feature Decomposition Fusion)ネットワークを提案する。
近赤外可視画像融合や医用画像融合など,複数の融合タスクにおいてCDDFuseが有望な結果をもたらすことを示す。
論文 参考訳(メタデータ) (2022-11-26T02:40:28Z) - ReDFeat: Recoupling Detection and Description for Multimodal Feature
Learning [51.07496081296863]
我々は、相互重み付け戦略による多モーダル特徴学習の検出と記述の独立した制約を再定義する。
本研究では,大きな受容場を有し,学習可能な非最大抑制層を備える検出器を提案する。
我々は,特徴マッチングと画像登録タスクにおける特徴量を評価するために,クロス可視,赤外線,近赤外,合成開口レーダ画像ペアを含むベンチマークを構築した。
論文 参考訳(メタデータ) (2022-05-16T04:24:22Z) - Target-aware Dual Adversarial Learning and a Multi-scenario
Multi-Modality Benchmark to Fuse Infrared and Visible for Object Detection [65.30079184700755]
本研究は、物体検出のために異なるように見える赤外線と可視画像の融合の問題に対処する。
従来のアプローチでは、2つのモダリティの根底にある共通点を発見し、反復最適化またはディープネットワークによって共通空間に融合する。
本稿では、融合と検出の連立問題に対する二段階最適化の定式化を提案し、その後、核融合と一般的に使用される検出ネットワークのためのターゲット認識デュアル逆学習(TarDAL)ネットワークに展開する。
論文 参考訳(メタデータ) (2022-03-30T11:44:56Z) - LIF-Seg: LiDAR and Camera Image Fusion for 3D LiDAR Semantic
Segmentation [78.74202673902303]
本稿では,LiDAR分割のための粗大なLiDARとカメラフュージョンベースネットワーク(LIF-Seg)を提案する。
提案手法は,画像の文脈情報を完全に活用し,単純だが効果的な早期融合戦略を導入する。
これら2つのコンポーネントの協力により、効果的なカメラ-LiDAR融合が成功する。
論文 参考訳(メタデータ) (2021-08-17T08:53:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。