論文の概要: C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation
- arxiv url: http://arxiv.org/abs/2607.01827v1
- Date: Thu, 02 Jul 2026 07:48:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.724265
- Title: C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation
- Title(参考訳): C2E:マルチ教師コントラスト知識蒸留によるエゴ専用3次元物体検出
- Authors: Jinlong Wang, Xun Huang, Qiming Xia, Shijia Zhao, Chenglu Wen,
- Abstract要約: 我々は,Multi-to-Single (M2S)エージェントを用いた新しいC2E(Co-Perception to Eo-Perception)パラダイムを開発した。
当社のM2Sフレームワークは,通信コストを伴わずに,最大8.64%の3D mAP性能向上を実現しています。
- 参考スコア(独自算出の注目度): 30.753798055264184
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LiDAR-based 3D object detection is essential for autonomous driving systems. However, traditional Ego-only Perception (Eo-Perception) suffers from limited perspective and occlusions in a complex outdoor environment, leading to performance bottlenecks. Recently, research on multi-agent Collaborative Perception (Co-Perception) has demonstrated excellent performance, but high communication costs and accumulated pose error hinder its application. To address this, we explore a novel C2E (Co-Perception to Eo-Perception) paradigm through the Multi-to-Single (M2S) agent contrastive knowledge distillation framework. Our M2S framework first designs Multi-Level Feature Enhancement module to provide more stable features, and introduces Auxiliary Point Cloud Reconstruction and Multi-Teacher Contrastive Distillation mechanisms to mitigate domain gaps in point cloud and feature distributions within the C2E paradigm. Benefiting from this, our M2S can retain the excellent performance of collaborative perception while effectively avoiding the drawbacks, such as communication delays and positioning errors. Extensive experiments on the V2XSet, V2V4Real and DAIR-V2X datasets show the effectiveness and generalizability of our M2S framework when combined with the state-of-the-art CoSDH model and other excellent 3D detectors. Our M2S framework can deliver up to a 8.64% improvement in 3D mAP performance without introducing any communication costs.
- Abstract(参考訳): LiDARベースの3Dオブジェクト検出は、自律運転システムに不可欠である。
しかしながら、伝統的なEgoのみの知覚(Eo-Perception)は、複雑な屋外環境において限定的な視点と排他性に悩まされ、パフォーマンスのボトルネックに繋がる。
近年,マルチエージェント協調知覚(Co-Perception)の研究は優れた性能を示したが,高い通信コストと累積ポーズ誤差が応用を妨げている。
そこで本稿では,Multi-to-Single (M2S)エージェントを用いた新しいC2E(Co-Perception to Eo-Perception)パラダイムについて検討する。
我々のM2Sフレームワークは、まず、より安定した機能を提供するためにマルチレベル機能拡張モジュールを設計し、C2Eパラダイム内のドメインギャップを緩和する補助的なポイントクラウド再構成とマルチTeacher Contrastive Distillationメカニズムを導入しました。
これより、我々のM2Sは、コミュニケーション遅延や位置決め誤差などの欠点を効果的に回避しつつ、協調認識の優れた性能を維持することができる。
V2XSet、V2V4Real、DAIR-V2Xデータセットの大規模な実験は、最先端のCoSDHモデルや他の優れた3D検出器と組み合わせることで、我々のM2Sフレームワークの有効性と一般化性を示している。
当社のM2Sフレームワークは,通信コストを伴わずに,最大8.64%の3D mAP性能向上を実現しています。
関連論文リスト
- AirFed: Federated Graph-Enhanced Multi-Agent Reinforcement Learning for Multi-UAV Cooperative Mobile Edge Computing [21.4907371859268]
複数の無人航空機(UAV)協調移動エッジコンピューティング(MEC)システムは、軌道計画、タスクオフロード、リソース割り当ての調整において重要な課題に直面している。
既存のアプローチは、スケーラビリティの制限、収束の遅さ、UAV間の非効率な知識共有に悩まされている。
本稿では,新しい多エージェント強化学習フレームワークであるAirFedを提案する。
論文 参考訳(メタデータ) (2025-10-27T06:31:35Z) - MCOP: Multi-UAV Collaborative Occupancy Prediction [40.58729551462363]
Current Bird's Eye View (BEV)ベースのアプローチには2つの大きな制限がある。
本稿では,複数UAV共同占有予測フレームワークを提案する。
提案手法は最先端の精度を達成し,既存の協調手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-10-14T16:17:42Z) - Towards Accurate and Efficient 3D Object Detection for Autonomous Driving: A Mixture of Experts Computing System on Edge [2.372616758549089]
本稿では,低レイテンシかつ高精度な3Dオブジェクト検出を同時に実現する自律走行車(AV)のための最適計算システムを提案する。
このシステムは、LiDARとカメラデータを効果的に融合させることで、スパース3D点雲と高密度2D画像の相補的な強度を利用して、堅牢なマルチモーダル表現を生成する。
論文 参考訳(メタデータ) (2025-07-05T18:28:04Z) - X2-DFD: A framework for eXplainable and eXtendable Deepfake Detection [55.77552681618732]
X2-DFDは、eXplainableおよびeXtendableフレームワークであり、ディープフェイク検出のためのマルチモーダルな多言語モデル(MLLM)に基づいている。
最初の段階であるモデル特徴評価は、MLLMの偽造関係の特徴の検出可能性を体系的に評価する。
2番目のステージであるExplainable dataset Constructionは、Strong Feature StrengtheningとWeak Feature Supplementingの2つの重要なモジュールで構成されている。
3番目のステージであるファインチューニングと推論では、構築されたデータセット上でMLLMを微調整し、最終的な検出と説明のためにデプロイする。
論文 参考訳(メタデータ) (2024-10-08T15:28:33Z) - UniM$^2$AE: Multi-modal Masked Autoencoders with Unified 3D Representation for 3D Perception in Autonomous Driving [47.590099762244535]
Masked Autoencoders (MAE)は、強力な表現の学習において重要な役割を担い、様々な3D知覚タスクにおいて優れた結果をもたらす。
この研究は、自律運転における統一された表現空間に適したマルチモーダルのMasked Autoencodersに展開する。
画像に固有のセマンティクスとLiDAR点雲の幾何学的複雑さを複雑に結合するため,UniM$2$AEを提案する。
論文 参考訳(メタデータ) (2023-08-21T02:13:40Z) - M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System [39.37647248710612]
フェイスプレゼンテーションアタック(FPA)は、様々な悪意あるアプリケーションを通じて、公衆の懸念を高めている。
我々は,M3FASという,正確で堅牢なマルチモーダル・モバイル・フェイス・アンチ・スポーフィングシステムを開発した。
論文 参考訳(メタデータ) (2023-01-30T12:37:04Z) - EPNet++: Cascade Bi-directional Fusion for Multi-Modal 3D Object
Detection [56.03081616213012]
本稿では,新しいCasscade Bi-directional Fusion(CB-Fusion)モジュールを導入することで,マルチモーダル3Dオブジェクト検出のためのEPNet++を提案する。
提案したCB-Fusionモジュールは、カスケード双方向相互作用融合方式で画像特徴と点特徴の豊富な意味情報を高める。
KITTI、JRDB、SUN-RGBDデータセットの実験結果は、最先端の手法よりもEPNet++の方が優れていることを示している。
論文 参考訳(メタデータ) (2021-12-21T10:48:34Z) - EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation [62.210091681352914]
自律運転やロボティクスなど,多くのアプリケーションを対象とした3次元セマンティックセマンティックセグメンテーションのためのマルチセンサフュージョンについて検討する。
本研究では,知覚認識型マルチセンサフュージョン(PMF)と呼ばれる協調融合方式について検討する。
本稿では,2つのモードから特徴を分離して抽出する2ストリームネットワークを提案する。
論文 参考訳(メタデータ) (2021-06-21T10:47:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。