論文の概要: CMTFormer: Marrying Transformer with Hierarchical Information Interaction for RGB-Event Object Detection
- arxiv url: http://arxiv.org/abs/2606.29136v1
- Date: Sun, 28 Jun 2026 00:49:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.800052
- Title: CMTFormer: Marrying Transformer with Hierarchical Information Interaction for RGB-Event Object Detection
- Title(参考訳): CMTFormer:RGBイベントオブジェクト検出のための階層情報インタラクションによる変換器の結婚
- Abstract要約: イベントカメラは、高時間分解能と高ダイナミックレンジでスパース輝度の変化をキャプチャする。
従来のマルチモーダル融合技術は、RGBフレームとイベントストリームの間に固有の不均一性を扱うことができない。
本稿では,RGBとイベント情報を階層的に統合したCross-Modal Information inTeraction transFormerを提案する。
- 参考スコア(独自算出の注目度): 17.487415888287
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Event cameras capture sparse brightness changes with high temporal resolution and high dynamic range, compensating for the deficiencies of the conventional RGB frames. However, previous multi-modal fusion techniques typically fail to handle the inherent heterogeneity between RGB frames and event streams, thus easily leading to noise amplification or redundant feature integration during cross-modal fusion. In this paper, we propose a Cross-Modal information inTeraction transFormer, coined as CMTFormer, which hierarchically integrates RGB and event information to achieve efficient and stable multimodal collaboration. Specifically, we design a shallow-to-deep information interaction scheme. In the shallow stage, we present the Shallow Alignment Module (SAM) to achieve an efficient fusion of RGB and event low-level features, which mitigates attribute disparities and prevents noisy information. In the middle stage, we devise the Cross-modal Enhancement Module (CEM) that utilizes texture and edge information to produce mutually reinforced middle-level features. In the deep stage, we present the Learnable Deep Fusion Module (LDFM) which performs high-level information aggregation through learnable weights, thus enabling the network to adaptively fuse RGB and event clues. A Spatial Prior Module is further designed to utilize global spatial information to enhance localization accuracy. Extensive experiments are conducted on two prevalent event-based object detection benchmarks, i.e., DSEC-Detection and PKU-DAVIS-SOD. Our CMTFormer consistently surpasses the detection counterparts in both uni-modal and multi-modal settings, strongly demonstrating the effectiveness of our paradigm. Codes will be available upon publication.
- Abstract(参考訳): イベントカメラは、高時間分解能と高ダイナミックレンジでスパース輝度の変化を捉え、従来のRGBフレームの欠陥を補う。
しかし、従来のマルチモーダル融合技術は、通常、RGBフレームとイベントストリームの固有の不均一性を扱うことができず、これにより、クロスモーダル融合時のノイズ増幅や冗長な特徴統合が容易になる。
本稿では,RGBとイベント情報を階層的に統合し,効率的かつ安定したマルチモーダル協調を実現する,CMTFormerと呼ばれるクロスモーダル情報インタアクショントランスフォーマーを提案する。
具体的には,浅層間情報対話方式を設計する。
浅い段階では,Shallow Alignment Module (SAM) を用いてRGBとイベントの低レベル特徴の効率的な融合を実現し,特性の相違を緩和し,ノイズ情報を防止する。
中間段階において,テクスチャとエッジ情報を利用して相互に強化された中層特徴を生成するクロスモーダル・エンハンスメント・モジュール(CEM)を考案した。
深層部では,学習可能な重みによる高レベル情報収集を行うLDFM(Learnerable Deep Fusion Module)を提案する。
空間優先モジュールは、グローバルな空間情報を利用してローカライズ精度を高めるように設計されている。
DSEC検出(DSEC-Detection)とPKU-DAVIS-SOD(PKU-DAVIS-SOD)という2つの一般的なイベントベースオブジェクト検出ベンチマークで大規模な実験を行った。
我々のCMTFormerは、ユニモーダル設定とマルチモーダル設定の両方において、常に検出対象を上回り、我々のパラダイムの有効性を強く示しています。
コードは出版時に入手できる。
関連論文リスト
- HyPSAM: Hybrid Prompt-driven Segment Anything Model for RGB-Thermal Salient Object Detection [75.406055413928]
RGB-T SODのための新しいプロンプト駆動セグメントモデル(HyPSAM)を提案する。
DFNetは動的畳み込みとマルチブランチデコーディングを使用して、適応的な相互モダリティ相互作用を促進する。
3つの公開データセットの実験により,本手法が最先端の性能を達成することを示す。
論文 参考訳(メタデータ) (2025-09-23T07:32:11Z) - Beyond conventional vision: RGB-event fusion for robust object detection in dynamic traffic scenarios [23.41380544271609]
従来のRGBカメラのダイナミックレンジは、大域的なコントラストを減少させ、高周波の詳細が失われる。
そこで本研究では,光の難易度を最適化した移動キュー融合ネットワーク(MCFNet)を提案する。
MCFNetは、様々な低照度および高速移動トラフィックシナリオにおいて、既存の手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2025-08-14T14:48:21Z) - CIR-Net: Cross-modality Interaction and Refinement for RGB-D Salient
Object Detection [144.66411561224507]
本稿では,CIR-Netと呼ばれる畳み込みニューラルネットワーク(CNN)モデルを提案する。
我々のネットワークは、定性的かつ定量的に最先端の塩分濃度検出器より優れています。
論文 参考訳(メタデータ) (2022-10-06T11:59:19Z) - Dual Swin-Transformer based Mutual Interactive Network for RGB-D Salient
Object Detection [67.33924278729903]
本研究では,Dual Swin-Transformerを用いたMutual Interactive Networkを提案する。
視覚入力における長距離依存をモデル化するために,RGBと奥行きモードの両方の機能抽出器としてSwin-Transformerを採用している。
5つの標準RGB-D SODベンチマークデータセットに関する総合的な実験は、提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2022-06-07T08:35:41Z) - Transformer-based Network for RGB-D Saliency Detection [82.6665619584628]
RGB-Dサリエンシ検出の鍵は、2つのモードにわたる複数のスケールで情報を完全なマイニングとヒューズすることである。
コンバータは機能融合と機能拡張の両面において高い有効性を示す一様操作であることを示す。
提案するネットワークは,最先端のRGB-D値検出手法に対して良好に動作する。
論文 参考訳(メタデータ) (2021-12-01T15:53:58Z) - Cross-modality Discrepant Interaction Network for RGB-D Salient Object
Detection [78.47767202232298]
本稿では,RGB-D SODのためのクロスモダリティ離散相互作用ネットワーク(CDINet)を提案する。
2つのコンポーネントは、効果的な相互モダリティ相互作用を実装するように設計されている。
我々のネットワークは、定量的にも質的にも15ドルの最先端の手法より優れています。
論文 参考訳(メタデータ) (2021-08-04T11:24:42Z) - RGB-D Salient Object Detection with Cross-Modality Modulation and
Selection [126.4462739820643]
本稿では, RGB-D Salient Object Detection (SOD) において, モジュール間相補性を段階的に統合し, 改良する有効な方法を提案する。
提案するネットワークは,1)RGB画像とそれに対応する深度マップからの補完情報を効果的に統合する方法,および2)より精度の高い特徴を適応的に選択する方法の2つの課題を主に解決する。
論文 参考訳(メタデータ) (2020-07-14T14:22:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。