論文の概要: A2DINOv3: Rethinking Multi-Modal Object Detection via Socialized Collaboration
- arxiv url: http://arxiv.org/abs/2608.21099v1
- Date: Fri, 21 Aug 2026 13:44:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.557662
- Title: A2DINOv3: Rethinking Multi-Modal Object Detection via Socialized Collaboration
- Title(参考訳): A2DINOv3: ソーシャル化コラボレーションによるマルチモーダル物体検出の再考
- Abstract要約: マルチモーダル物体検出は、困難な状況下での堅牢なシーン理解に不可欠である。
最近のビジョン基礎モデル(例:DINOv3)は強力な表現能力を示した。
DINOv3 (A2DINOv3) へのアダプタを提案する。
- 参考スコア(独自算出の注目度): 3.467977830050488
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-modal object detection is essential for robust scene understanding in challenging conditions, including low-light and adverse environments. Recent vision foundation models (e.g., DINOv3) have exhibited strong representation capabilities, yet adapting them to multi-modal scenarios remains challenging. Existing dense cross-modal fusion strategies often force heterogeneous modalities to interact indiscriminately, which may introduce redundant information and disrupt the valuable pre-trained representations. To address this issue, we revisit multi-modal fusion from the perspective of socialized learning and propose adapter to DINOv3 (A2DINOv3), a multi-expert collaboration framework with a Socialized Collaboration Protocol (SCP). Specifically, RGB and infrared branches are modeled as heterogeneous experts that independently preserve their specialized knowledge while exchanging complementary information through selective and constrained interactions. This design mitigates harmful cross-modal interference and prevents degradation of pre-trained priors during adaptation. Furthermore, a zero-initialization strategy is introduced to gradually activate cross-modal collaboration, enabling a smooth transition from modality-specific learning to cooperative representation learning. Extensive experiments on four multi-modal benchmarks, including aerial detection (GAIIC), autonomous driving (FLIR), low-light surveillance (LLVIP), and diverse real-world scenarios (M3FD), demonstrate that A2DINOv3 consistently achieves state-of-the-art performance in multi-modal object detection.
- Abstract(参考訳): マルチモーダル物体検出は、低照度や悪環境を含む困難な環境において、堅牢なシーン理解に不可欠である。
最近のビジョン基礎モデル(例:DINOv3)は強力な表現能力を示したが、マルチモーダルシナリオに適応することは依然として困難である。
既存の密接なクロスモーダル融合戦略は、しばしば異質なモダリティを無差別に相互作用させ、冗長な情報を導入し、価値ある事前訓練された表現を妨害する。
この問題に対処するため,ソーシャル化学習の観点からマルチモーダル融合を再考し,ソーシャル化協調プロトコル(SCP)を用いたマルチエキスパート協調フレームワークであるDINOv3(A2DINOv3)へのアダプタを提案する。
具体的には、RGBと赤外線の枝は、選択的および制約された相互作用を通じて補完的な情報を交換しながら、その専門知識を独立に保持する異種の専門家としてモデル化される。
この設計は、有害なクロスモーダル干渉を軽減し、適応中に事前訓練された事前学習の劣化を防止する。
さらに、モダリティ固有の学習から協調表現学習へのスムーズな移行を可能にするため、段階的にクロスモーダル協調を活性化するゼロ初期化戦略を導入する。
空中検出(GAIIC)、自律運転(FLIR)、低照度監視(LLVIP)、多彩な実世界のシナリオ(M3FD)を含む4つのマルチモーダルベンチマークに対する大規模な実験は、A2DINOv3がマルチモーダルオブジェクト検出において一貫して最先端のパフォーマンスを達成することを示した。
関連論文リスト
- MODAL: Multi-Modal Object Re-ID via Model-Driven Sparse Decoupling and Text-Image Differential Filtering [51.99452481869329]
MODALは、スパース符号理論と微分抑圧原理を組み合わせた、新しいマルチモーダルオブジェクト再識別フレームワークである。
MODALの中核となるコンポーネントは、モデル駆動のディープアンロール方式で開発されたマルチモーダル特徴スパースデカップリングモジュールである。
MODALは原則的な機能障害から恩恵を受け、不完全なモダリティシナリオにおけるパフォーマンス低下を自然に軽減します。
4つのデータセットの実験では、MODALが最先端のパフォーマンスを達成し、透明性が優れていることが示されている。
論文 参考訳(メタデータ) (2026-08-15T07:41:10Z) - Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild [49.77540427384148]
本稿では,基礎モデルの汎用的マルチモーダル推論能力を野生でのHOI検出に伝達する,訓練不要なエージェント型フレームワークであるAgenHoIを提案する。
不完全な相互作用発見と複雑な場面におけるあいまいな局所化の課題に対処するために,2つの重要なメカニズムを導入する。
AgentHOIは、リアルタイム設定において、最先端の教師付きおよび弱教師付きメソッドよりも優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-15T14:30:20Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection [79.58755811919366]
本稿では,リモートセンシングのためのマルチモーダルデータセットとマルチタスクオブジェクト検出(M2Det)という新しいタスクを提案する。
水平方向または指向方向の物体を、あらゆるセンサーから正確に検出するように設計されている。
この課題は、1)マルチモーダルモデリングの管理に関わるトレードオフ、2)マルチタスク最適化の複雑さに起因する。
論文 参考訳(メタデータ) (2024-12-30T02:47:51Z) - DeepInteraction++: Multi-Modality Interaction for Autonomous Driving [80.8837864849534]
我々は,モダリティごとの個別表現を学習し,維持することのできる,新しいモダリティインタラクション戦略を導入する。
DeepInteraction++はマルチモーダルなインタラクション・フレームワークであり、マルチモーダルな表現型インタラクション・エンコーダとマルチモーダルな予測型インタラクション・デコーダを特徴とする。
実験では,3次元物体検出とエンドツーエンドの自律走行の両方において,提案手法の優れた性能を示す。
論文 参考訳(メタデータ) (2024-08-09T14:04:21Z) - Asynchronous Multimodal Video Sequence Fusion via Learning Modality-Exclusive and -Agnostic Representations [19.731611716111566]
本稿では,モダリティ学習のためのマルチモーダル融合手法を提案する。
我々は、モーダル内の信頼性のあるコンテキストダイナミクスをキャプチャする予測的自己アテンションモジュールを導入する。
階層的クロスモーダルアテンションモジュールは、モダリティ間の価値ある要素相関を探索するために設計されている。
両識別器戦略が提示され、異なる表現を敵対的に生成することを保証する。
論文 参考訳(メタデータ) (2024-07-06T04:36:48Z) - Modality Unifying Network for Visible-Infrared Person Re-Identification [24.186989535051623]
Visible-infrared person re-identification (VI-ReID) は、異種間の大きな相違とクラス内変異のために難しい課題である。
既存の手法は主に、異なるモダリティを同じ特徴空間に埋め込むことで、モダリティ共有表現を学習することに焦点を当てている。
そこで我々は,VI-ReID の頑健な補助モダリティを探索するために,新しいモダリティ統一ネットワーク (MUN) を提案する。
論文 参考訳(メタデータ) (2023-09-12T14:22:22Z) - Spatio-Temporal Domain Awareness for Multi-Agent Collaborative
Perception [18.358998861454477]
車両間通信の潜在的な応用としてのマルチエージェント協調認識は、単一エージェント認識よりも自律走行車の性能知覚を著しく向上させる可能性がある。
本稿では,エージェント間の認識特性をエンドツーエンドに集約する新しい協調認識フレームワークSCOPEを提案する。
論文 参考訳(メタデータ) (2023-07-26T03:00:31Z) - Dynamic Dual-Attentive Aggregation Learning for Visible-Infrared Person
Re-Identification [208.1227090864602]
Visible-infrared person re-identification (VI-ReID) は、歩行者検索の課題である。
既存のVI-ReID法は、識別可能性に制限があり、ノイズの多い画像に対して弱いロバスト性を持つグローバル表現を学習する傾向にある。
そこで我々は,VI-ReIDのための動的二段階集合(DDAG)学習法を提案する。
論文 参考訳(メタデータ) (2020-07-18T03:08:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。