論文の概要: SuppreSensing: Expert-Guided Feature Recalibration and Discrepancy Augmentation for Multimodal Object Detection
- arxiv url: http://arxiv.org/abs/2608.20944v1
- Date: Fri, 21 Aug 2026 10:06:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.503576
- Title: SuppreSensing: Expert-Guided Feature Recalibration and Discrepancy Augmentation for Multimodal Object Detection
- Title(参考訳): SuppreSensing:マルチモーダル物体検出のためのエキスパートガイドによる特徴校正と離散性向上
- Authors: Xin Wu, Zhenyu Gao, Qiankun Zhang, Shaoyong Guo,
- Abstract要約: 本稿では,多モード融合を選択的協調プロセスとして再構成するSuppreSensingを提案する。
SupreSensingは、最初にExpert-driven Multimodal Feature Recalibration (EMFR)モジュールを設計した。
モーダリティ固有の拡張戦略を用いて、特定のモーダリティの特徴を属性とする。
DroneVehicleとVEDAIデータセットの実験は、SuppreSensingが最先端の検出パフォーマンスを達成することを実証している。
- 参考スコア(独自算出の注目度): 19.446402308279676
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multimodal object detection in remote sensing faces challenges due to semantic heterogeneity and modality-specific noise interference. To this end, we propose SuppreSensing, which reformulates multimodal fusion as a selective collaboration process that jointly models shared information and modality-specific cues. SuppreSensing first designs an Expert-driven Multimodal Feature Recalibration (EMFR) module, which reformulates shared-consensus extraction as an input-adaptive multi-expert selection process to alleviate the symmetry trap in multimodal fusion. Complementing this, a modality-specific attribute augmentation strategy is employed to enhance specific modality features by modeling bidirectional discrepancy patterns, mitigating cross-modal heterogeneity. Furthermore, we propose an Expert-driven Customized Feature Purification (ECFP) module based on a "specialized inspection-comprehensive analysis-diagnostic update" physical examination paradigm to iteratively filter redundancies and reinforce task-relevant semantics. Extensive experiments on the DroneVehicle and VEDAI datasets demonstrate that SuppreSensing achieves state-of-the-art detection performance. Cross-domain evaluations on natural scene datasets (FLIR and LLVIP) further validate its superior robustness and generalization capability across diverse environmental conditions.
- Abstract(参考訳): リモートセンシングにおけるマルチモーダル物体検出は、意味的不均一性とモーダリティ特異的ノイズ干渉による課題に直面している。
そこで本稿では,共有情報とモダリティ特異的な手がかりを共同でモデル化する,多モード融合を選択的協調プロセスとして再構成するSuppreSensingを提案する。
SuppreSensingは、まず、Multimodal fusionにおける対称性トラップを軽減するために、入力適応型マルチエキスパート選択プロセスとして共有コンセンサス抽出を再構成する、Expert-driven Multimodal Feature Recalibration (EMFR)モジュールを設計する。
これを補完し、双方向の相違パターンをモデル化し、異種間の相違を緩和することにより、特異な相違性を高めるために、モダリティ固有の属性増強戦略を用いる。
さらに,「特定検査包括的分析-診断的更新」に基づくエキスパート駆動型カスタマイズ特徴浄化(ECFP)モジュールを提案し,冗長性を反復的にフィルタリングし,タスク関連セマンティクスを補強する。
DroneVehicleとVEDAIデータセットに関する大規模な実験は、SuppreSensingが最先端の検出パフォーマンスを達成することを実証している。
自然シーンデータセット(FLIR, LLVIP)のクロスドメイン評価により, 多様な環境条件における優れた堅牢性と一般化能力が検証された。
関連論文リスト
- Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection [58.25418970608328]
単一ソースドメイン上でトレーニングされた検出器を複数の未確認領域に転送することを目的としたシングルドメイン一般化オブジェクト検出(Single-DGOD)について検討する。
既存の手法は主に、トレーニング分布を拡大するために、データ拡張やテキストプロンプトといったシミュレーション駆動の戦略に依存している。
本稿では, 未知領域の一般化を多様体回帰問題として定式化する, Visual-Text Dual Chain-of-Thought (MR-DCoT) を用いたマニフォールド回帰を提案する。
論文 参考訳(メタデータ) (2026-07-08T09:27:15Z) - Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning [4.730640137945023]
実世界のシナリオにおける物体検出は、多様な画像劣化と異種物体分布のため、依然として困難である。
動的決定プロセスとしてオブジェクト検出を定式化するエージェント検出フレームワークであるDetASを提案する。
論文 参考訳(メタデータ) (2026-05-29T11:41:58Z) - AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition [62.16431420189863]
LLMに基づくマルチモーダル感情認識は静的なパラメトリックメモリに依存しており、ニュアンス化された感情状態の解釈時にしばしば幻覚を与える。
本稿では,感情指向型マルチエージェント検索拡張生成フレームワークであるAffectAgentを紹介する。
AffectAgentは3つの共同最適化されたエージェント、すなわちクエリプランナー、エビデンスフィルタ、感情生成器から構成される。
論文 参考訳(メタデータ) (2026-04-14T13:49:19Z) - Modality-Agnostic Prompt Learning for Multi-Modal Camouflaged Object Detection [61.36976558603528]
本稿では,Segment Anything Model(SAM)のためのモダリティに依存しないマルチモーダルプロンプトを生成する新しいフレームワークを提案する。
具体的には,データ駆動型コンテンツドメインと知識駆動型プロンプトドメインとのインタラクションを通じて,マルチモーダル学習をモデル化する。
さらに,微粒なプロンプトキューを組み込むことで,粗い予測をキャリブレーションする軽量マスクリファインモジュールを導入する。
論文 参考訳(メタデータ) (2026-04-14T07:13:28Z) - WMoE-CLIP: Wavelet-Enhanced Mixture-of-Experts Prompt Learning for Zero-Shot Anomaly Detection [9.097817457018179]
ゼロショット異常検出(ZSAD)のためのウェーブレット強化実験用混合学習法を提案する。
変分オートエンコーダは、グローバルな意味表現をモデル化し、それらを多様な異常パターンへの適応性を高めるプロンプトに統合するために用いられる。
14の産業用および医療用データセットに対する実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2026-03-06T14:16:06Z) - MIDG: Mixture of Invariant Experts with knowledge injection for Domain Generalization in Multimodal Sentiment Analysis [11.688062963416117]
マルチモーダル・センティメント・アナリティクス(MSA)のための領域一般化のための新しいフレームワークを提案する。
このフレームワークには、ドメイン不変の機能を抽出するMixture of Invariant Expertsモデルが含まれている。
第2に、クロスモーダルな知識注入によるマルチモーダル表現のセマンティックリッチネスを高めるためのクロスモーダル適応器を設計する。
論文 参考訳(メタデータ) (2025-12-08T11:04:00Z) - Modality Prompts for Arbitrary Modality Salient Object Detection [57.610000247519196]
本論文は、任意のモーダリティ・サリエント物体検出(AM SOD)の課題について述べる。
任意のモダリティ、例えばRGBイメージ、RGB-Dイメージ、RGB-D-Tイメージから有能なオブジェクトを検出することを目的としている。
AM SODの2つの基本的な課題を解明するために,新しいモード適応トランス (MAT) を提案する。
論文 参考訳(メタデータ) (2024-05-06T11:02:02Z) - Exploiting Modality-Specific Features For Multi-Modal Manipulation
Detection And Grounding [54.49214267905562]
マルチモーダルな操作検出とグラウンド処理のためのトランスフォーマーベースのフレームワークを構築する。
本フレームワークは,マルチモーダルアライメントの能力を維持しながら,モダリティ特有の特徴を同時に探求する。
本稿では,グローバルな文脈的キューを各モーダル内に適応的に集約する暗黙的操作クエリ(IMQ)を提案する。
論文 参考訳(メタデータ) (2023-09-22T06:55:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。