論文の概要: CAMF-Det: Closure-Aware Multimodal Fusion for LiDAR-Camera 3D Object Detection on UAV Platforms
- arxiv url: http://arxiv.org/abs/2606.09143v1
- Date: Mon, 08 Jun 2026 07:40:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.807547
- Title: CAMF-Det: Closure-Aware Multimodal Fusion for LiDAR-Camera 3D Object Detection on UAV Platforms
- Title(参考訳): CAMF-Det:UAVプラットフォーム上でのLiDARカメラ3Dオブジェクト検出のためのクロージャ対応マルチモーダルフュージョン
- Authors: Yanze Jiang, Yanfeng Gu, Xian Li,
- Abstract要約: LiDARとカメラを用いたマルチモーダル3Dオブジェクト検出は,地上車両のシナリオにおいて優れた性能を示した。
UAVプラットフォーム上でのLiDARカメラ3Dオブジェクト検出のためのクロージャ対応マルチモーダル融合フレームワークであるCAMF-Detを提案する。
我々は、CAMF-Detが全ての難易度で最高のパフォーマンスを達成し、ハードレベルのmAP$_mathrmBEV$9.43%と4.88%の最高の競合手法で改善したことを示す。
- 参考スコア(独自算出の注目度): 9.923404615359223
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal 3D object detection based on LiDAR and cameras has demonstrated excellent performance in ground-vehicle scenarios, but has not been explored for Unmanned Aerial Vehicle (UAV) platforms. In UAV top-down scenes, frequent groundobject occlusion dominated by tree canopies causes spatially varying and modality-dependent information degradation. Existing multimodal fusion frameworks neither explicitly model such ground-object occlusion nor embed occlusion awareness into the detection pipeline, limiting their performance in occluded UAV scenes. To address these challenges, we propose CAMF-Det, a closure-aware multimodal fusion framework for LiDAR-camera 3D object detection on UAV platforms, which derives dual-modal occlusion intensity through physics-inspired modeling and embeds them as priors throughout the detection pipeline. First, a dual-modal closure modeling module explicitly constructs occlusion intensity ground truth for both modalities offline via a Beer-Lambert-inspired formulation and building-mask correction. Second, using these ground-truth maps as supervision, a dual-modal prediction network converts the offline modeling results into online occlusion intensity predictions under single-frame inference. Third, both ground-truth and predicted occlusion intensity are injected into data augmentation, feature encoding, multimodal fusion, and detection head, enabling adaptive detection under spatially varying and modality-dependent information degradation. Experiments on two self-built UAV-based multimodal datasets, SI3D-DI and SI3D-DII, demonstrate that CAMF-Det achieves the best performance across all difficulty levels, with hard-level mAP$_{\mathrm{BEV}}$ improvements of 9.43% and 4.88% over the best competing methods, respectively. These results confirm the effectiveness of explicit occlusion prior modeling and exploitation for robust multimodal 3D detection in UAV scenes.
- Abstract(参考訳): LiDARとカメラに基づくマルチモーダル3Dオブジェクト検出は、地上車両のシナリオでは優れた性能を示しているが、無人航空機(UAV)プラットフォームでは研究されていない。
UAVトップダウンシーンでは、ツリーキャノピーに支配されるしばしば接地対象の閉塞が、空間的に変化し、モダリティに依存した情報劣化を引き起こす。
既存のマルチモーダル融合フレームワークは、そのような接地対象の隠蔽を明示的にモデル化したり、検出パイプラインに隠蔽意識を埋め込んだりせず、閉鎖されたUAVシーンのパフォーマンスを制限したりしない。
これらの課題に対処するため,UAVプラットフォーム上でのLiDARカメラ3Dオブジェクト検出のためのクロージャ対応マルチモーダル融合フレームワークであるCAMF-Detを提案する。
まず、双対モーダル閉包モデリングモジュールは、ベル・ランベルトにインスパイアされた定式化とビル・マスク補正を通じて、両方のモダリティをオフラインにする閉包強度基底真理を明示的に構成する。
第二に、これらの地上構造図を監督として用いて、双対モーダル予測ネットワークは、オフラインのモデリング結果を、単一フレームの推論の下でオンラインの閉塞強度予測に変換する。
第3に、データ増強、特徴符号化、マルチモーダル融合、検出ヘッドに接地剛性および予測閉塞強度の両方を注入し、空間的変化及びモダリティに依存した情報劣化の下で適応検出を可能にする。
2つの自作UAVベースのマルチモーダルデータセット(SI3D-DIとSI3D-DII)の実験では、CAMF-Detが全ての難易度で最高のパフォーマンスを達成している。
これらの結果は、UAVシーンにおけるロバストなマルチモーダル3D検出のための、モデリングおよび利用前の明示的な隠蔽の有効性を裏付けるものである。
関連論文リスト
- CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection [10.131066023908023]
マルチモーダル融合は正確な3次元物体検出のための有望なパラダイムとして登場してきた。
しかし、トレーニングとは異なるターゲットドメインにデプロイされた場合、パフォーマンスは大幅に低下する。
本研究では、堅牢なクロスドメイン一般化を制限する2つの要因を同定する。
これらの課題に対処するための3つのコンポーネントを提案する。
論文 参考訳(メタデータ) (2026-03-24T14:39:51Z) - A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles [74.8162337823142]
MM-UAVはMulti-Modal UAV Trackingの最初の大規模ベンチマークである。
データセットは30以上の挑戦的なシナリオにまたがっており、1,321の同期マルチモーダルシーケンスと280万以上の注釈付きフレームがある。
データセットを伴って、我々は新しいマルチモーダルマルチUAV追跡フレームワークを提供する。
論文 参考訳(メタデータ) (2025-11-23T08:42:17Z) - Efficient Multimodal 3D Object Detector via Instance-Level Contrastive Distillation [17.634678949648208]
提案したICDフレームワークとCLFM(Cross Linear Attention Fusion Module)を組み込んだ高速かつ効果的なマルチモーダル3Dオブジェクト検出器を提案する。
我々の3Dオブジェクト検出器は、より優れた効率を実現しつつ、最先端(SOTA)手法より優れています。
論文 参考訳(メタデータ) (2025-03-17T08:26:11Z) - Progressive Multi-Modal Fusion for Robust 3D Object Detection [12.048303829428452]
既存の方法は、バードアイビュー(BEV)とパースペクティブビュー(PV)の両方のモードから特徴を投影することで、単一ビューでセンサフュージョンを実行する。
本稿では,中間クエリレベルとオブジェクトクエリレベルの両方で,BEVとPVの両方の機能を組み合わせたプログレッシブフュージョンフレームワークProFusion3Dを提案する。
我々のアーキテクチャは、局所的およびグローバルな特徴を融合させ、3次元オブジェクト検出の堅牢性を高める。
論文 参考訳(メタデータ) (2024-10-09T22:57:47Z) - Towards Unified 3D Object Detection via Algorithm and Data Unification [70.27631528933482]
我々は、最初の統一型マルチモーダル3Dオブジェクト検出ベンチマークMM-Omni3Dを構築し、上記のモノクロ検出器をマルチモーダルバージョンに拡張する。
設計した単分子・多モード検出器をそれぞれUniMODEとMM-UniMODEと命名した。
論文 参考訳(メタデータ) (2024-02-28T18:59:31Z) - Dense Voxel Fusion for 3D Object Detection [10.717415797194896]
ボクセル融合 (Voxel Fusion, DVF) は, 多スケール密度ボクセル特徴表現を生成する逐次融合法である。
地上の真理2Dバウンディングボックスラベルを直接トレーニングし、ノイズの多い検出器固有の2D予測を避けます。
提案したマルチモーダルトレーニング戦略は, 誤った2次元予測を用いたトレーニングに比べ, より一般化できることを示す。
論文 参考訳(メタデータ) (2022-03-02T04:51:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。