論文の概要: Beyond Symmetric Fusion: Exploiting Task-Dependent Modality Strengths for RGB-Event Small Object Detection
- arxiv url: http://arxiv.org/abs/2608.01302v1
- Date: Sun, 02 Aug 2026 15:10:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.153802
- Title: Beyond Symmetric Fusion: Exploiting Task-Dependent Modality Strengths for RGB-Event Small Object Detection
- Title(参考訳): 対称性融合を超えて:RGBイベント小物体検出のためのタスク依存モード強度の爆発
- Authors: Ziheng Wang, Chaolang Li, Yutong Yang, Xiaohan Xu, Chongxiang Yang, Hengxuan Zhong, Zhen Liang, Pengwen Dai,
- Abstract要約: 最先端のRGBイベント検出器は、RGBとイベントデータからの補完的な特徴を組み合わせることで、小型で高速なオブジェクトの検出を改善する。
イベントデータはクラス非依存のローカライゼーションにおいて著しく有効であるが、RGBデータは、ローカライズされたターゲット領域内でより強力なカテゴリエビデンスを提供する。
このタスク依存型非対称性により、非対称なイベント-RGBオブジェクト検出変換器(AERODet)を提案する。
- 参考スコア(独自算出の注目度): 12.262266865349254
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: State-of-the-art RGB-Event detectors improve the detection of small, fast-moving objects by combining complementary features from RGB and Event data, yet they typically fuse the two modalities into a unified representation for both localization and classification. Such a task-symmetric design is inconsistent with the intuition that the two modalities should play different roles according to their task-specific strengths. To examine this issue, we conduct a modality-specific evaluation and find that the relative advantage of the two modalities reverses across tasks: Event data are substantially more effective for class-agnostic localization, whereas RGB data provide stronger category evidence within localized target regions. Motivated by this task-dependent asymmetry, we propose an Asymmetric Event-RGB Object Detection Transformer (AERODet). During class-agnostic localization, Scale-wise Uncertainty-aware Reliability Estimation (SURE) calculates the relative reliability of the two modalities from their objectness response heatmaps and accordingly calibrates their contributions when the decoder aggregates multimodal features. Once the candidate boxes are obtained, Task-Decoupled Semantic Refinement (TDSR) decouples classification from localization and uses RGB RoI features for fine-grained classification. Extensive experiments on FRED and NeRDD demonstrate that AERODet achieves state-of-the-art performance. In particular, it surpasses the strongest RGB-Event baseline by 10.7 mAP points on the FRED challenging split.
- Abstract(参考訳): 最先端のRGB-Event検出器は、RGBデータとイベントデータの相補的な特徴を組み合わせることで、小さな高速移動物体の検出を改善するが、通常は2つのモードをローカライゼーションと分類の両方のための統一された表現に融合する。
このようなタスク対称設計は、2つのモダリティがタスク固有の強みに応じて異なる役割を演じるという直感とは矛盾する。
イベントデータは、クラスに依存しないローカライゼーションに極めて有効であるのに対し、RGBデータは、ローカライズされたターゲット領域内でより強力なカテゴリエビデンスを提供する。
本研究では,非対称なイベントRGBオブジェクト検出変換器 (AERODet) を提案する。
クラス非依存型ローカライゼーションにおいて、スケールワイド不確実性信頼度推定(SURE)は、2つのモードの相対的信頼性をオブジェクト応答熱マップから算出し、デコーダがマルチモーダル特徴を集約するとそれらの貢献を校正する。
候補ボックスが取得されると、タスク分離セマンティックリファインメント(TDSR)は、ローカライゼーションから分類を分離し、RGB RoI特徴をきめ細かな分類に使用する。
FREDとNeRDDの大規模な実験は、AERODetが最先端のパフォーマンスを達成することを示した。
特に、最強のRGB-Eventベースラインを10.7mAPポイント上回っている。
関連論文リスト
- Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking [58.338848435042536]
RGB-Eventトラッキングは、イベントセンサからRGB外観テクスチャと高密度時間運動キューを融合することにより、ローカライズを改善する。
現実世界のシーンは、従来のマルチモーダル融合を妨げる多様な構造的な信号劣化に悩まされる。
本稿では,RGBイベント追跡に適した階層的摂動・検索フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-24T23:34:06Z) - RSONet: Region-guided Selective Optimization Network for RGB-T Salient Object Detection [76.1829298714382]
本稿では,RGB画像と熱画像の相違点に着目した。
RGB-T有向物体検出のための領域誘導選択最適化ネットワークを提案する。
我々は,RGB-Tデータセットに関する広範な実験を行い,提案したRSONetが27種類の最先端SOD手法と競合する性能を発揮することを示した。
論文 参考訳(メタデータ) (2026-03-13T06:01:17Z) - Re-coding for Uncertainties: Edge-awareness Semantic Concordance for Resilient Event-RGB Segmentation [18.450662919776757]
本稿では,エッジ認識型セマンティック・コンセンサス・フレームワークを提案する。
提案手法は,提案したDERS-XSに対して2.55% mIoUで最先端の手法である。
論文 参考訳(メタデータ) (2025-11-11T14:00:27Z) - SAMSOD: Rethinking SAM Optimization for RGB-T Salient Object Detection [15.774524474470233]
RGB-T Salient Object Detection (SOD) は、RGBと熱赤外画像を組み合わせて魅力的な物体を分割することを目的としている。
我々は,非支配的モダリティの学習を促進するために,一助的指導を利用するtextitSAMSOD というモデルを提案する。
論文 参考訳(メタデータ) (2025-10-04T06:02:12Z) - TENet: Targetness Entanglement Incorporating with Multi-Scale Pooling and Mutually-Guided Fusion for RGB-E Object Tracking [30.89375068036783]
既存のアプローチでは、従来の外観モデルを用いて、RGB-E追跡のためのイベント特徴抽出を行う。
本稿では,イベントデータ固有の特徴を認識可能な高品質な特徴表現を実現するために,イベントバックボーン(Pooler)を提案する。
提案手法は,2つの広く使用されているRGB-E追跡データセットにおいて,最先端トラッカーを著しく上回っている。
論文 参考訳(メタデータ) (2024-05-08T12:19:08Z) - Residual Spatial Fusion Network for RGB-Thermal Semantic Segmentation [19.41334573257174]
従来の方法では、主にRGBイメージを使用し、照明条件、例えば暗闇の影響が大きい。
近年の研究では、セグメンテーションの補正モダリティとして、熱画像は夜のシナリオに頑健であることが示されている。
本稿では,RGB-TセマンティックセグメンテーションのためのResidual Spatial Fusion Network (RSFNet)を提案する。
論文 参考訳(メタデータ) (2023-06-17T14:28:08Z) - CIR-Net: Cross-modality Interaction and Refinement for RGB-D Salient
Object Detection [144.66411561224507]
本稿では,CIR-Netと呼ばれる畳み込みニューラルネットワーク(CNN)モデルを提案する。
我々のネットワークは、定性的かつ定量的に最先端の塩分濃度検出器より優れています。
論文 参考訳(メタデータ) (2022-10-06T11:59:19Z) - Dual Swin-Transformer based Mutual Interactive Network for RGB-D Salient
Object Detection [67.33924278729903]
本研究では,Dual Swin-Transformerを用いたMutual Interactive Networkを提案する。
視覚入力における長距離依存をモデル化するために,RGBと奥行きモードの両方の機能抽出器としてSwin-Transformerを採用している。
5つの標準RGB-D SODベンチマークデータセットに関する総合的な実験は、提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2022-06-07T08:35:41Z) - Cross-modality Discrepant Interaction Network for RGB-D Salient Object
Detection [78.47767202232298]
本稿では,RGB-D SODのためのクロスモダリティ離散相互作用ネットワーク(CDINet)を提案する。
2つのコンポーネントは、効果的な相互モダリティ相互作用を実装するように設計されている。
我々のネットワークは、定量的にも質的にも15ドルの最先端の手法より優れています。
論文 参考訳(メタデータ) (2021-08-04T11:24:42Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。