論文の概要: ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models
- arxiv url: http://arxiv.org/abs/2607.12959v1
- Date: Tue, 14 Jul 2026 16:56:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.225156
- Title: ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models
- Title(参考訳): ViCo3D:ビジョンファウンデーションモデルを用いたLiDARを用いた協調3次元物体検出
- Authors: Haojie Ren, Songrui Luo, Lingfeng Wang, Yan Xia, Yao Li, Jing Li, Lu Zhang, Jiajun Deng, Yanyong Zhang,
- Abstract要約: ViCo3Dはビジョンファウンデーションモデル(VFM)を利用した3Dオブジェクトの協調検出フレームワーク
VFMを3つの側面からLiDARベースの協調認識に適応させる。
DAIR-V2XとV2XSetの実験は、ViCo3Dが最先端の3D検出性能を達成することを示した。
- 参考スコア(独自算出の注目度): 38.539942506000166
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LiDAR-based collaborative 3D perception in Vehicle-to-Everything (V2X) systems typically relies on fusing bird's-eye-view (BEV) features across agents. However, current BEV representations, typically extracted by LiDAR backbones trained from scratch, are geometry-dominated and lack general semantic priors, inherently limiting the efficacy of feature-level collaboration. Meanwhile, vision foundation models (VFMs) pretrained on large-scale image data have demonstrated strong capability in learning general-purpose and informative visual representations for 2D tasks, and have the potential to enhance agent-wise LiDAR BEV representations for collaboration. Despite this potential, adapting VFMs to LiDAR-based 3D detection remains challenging due to the substantial image-point cloud modality gap. To bridge this gap, we propose ViCo3D, a collaborative 3D object detection framework powered by VFMs. Specifically, ViCo3D adapts VFMs to LiDAR-based collaborative perception from three aspects: First, ViCo3D projects point clouds onto the BEV plane as three-channel images, enabling DINOv2 to extract BEV-space visual features from LiDAR inputs. Besides, to effectively integrate these DINOv2-derived features with LiDAR geometric features, ViCo3D introduces a multi-scale BEV fusion module within the single-agent encoder. In addition, ViCo3D adopts an ego-centric cross-agent fusion strategy to aggregate complementary information from multiple agents. Experiments on DAIR-V2X and V2XSet demonstrate that ViCo3D achieves state-of-the-art 3D detection performance. Remarkably, it delivers up to 1.8x greater collaborative gains than prior methods on DAIR-V2X. The code will be made public available for future investigation.
- Abstract(参考訳): LiDARをベースとしたV2Xシステムにおける協調的な3D知覚は、通常、エージェント間で鳥の目視(BEV)機能を融合させることに依存している。
しかしながら、現在のBEV表現は、通常、スクラッチから訓練されたLiDARバックボーンによって抽出され、幾何学的に支配されており、機能レベルのコラボレーションの有効性を本質的に制限している。
一方、大規模画像データに事前訓練された視覚基礎モデル(VFM)は、2Dタスクの汎用的および情報的視覚表現を学習する上で強力な能力を示し、協調のためのエージェントワイドなLiDAR BEV表現を強化する可能性がある。
このような可能性にもかかわらず、LiDARベースの3D検出にVFMを適用することは、画像ポイントの雲の質差がかなり大きいため、依然として困難である。
このギャップを埋めるため,VFMを用いた3Dオブジェクト検出フレームワークであるViCo3Dを提案する。
第一に、ViCo3Dプロジェクトは3チャンネルの画像としてBEV平面上に雲を向け、DINOv2はLiDAR入力からBEV空間の視覚的特徴を抽出できる。
さらに、これらのDINOv2由来の機能をLiDAR幾何学的特徴と効果的に統合するために、ViCo3Dはシングルエージェントエンコーダ内にマルチスケールのBEV融合モジュールを導入する。
さらに、ViCo3Dはエゴ中心のクロスエージェント融合戦略を採用し、複数のエージェントから補完情報を収集する。
DAIR-V2XとV2XSetの実験は、ViCo3Dが最先端の3D検出性能を達成することを示した。
注目すべきは、DAIR-V2Xの以前のメソッドよりも、最大1.8倍の協力的なゲインを提供することだ。
コードは今後の調査のために公開されます。
関連論文リスト
- AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models [42.57469056850227]
VLA(Vision-Language-Action)モデルは最近、ロボットの知覚と制御において顕著な進歩を遂げている。
深度推定をVLAモデルに統合し,3次元特徴表現を充実させる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:57:32Z) - Label-Efficient LiDAR Semantic Segmentation with 2D-3D Vision Transformer Adapters [32.21090169762889]
BALViTは、凍結視覚モデルを利用して強力なLiDARエンコーダを学習するためのアモーダル機能エンコーダである。
コードとモデルは、http://balvit.cs.uni-freiburg.deで公開しています。
論文 参考訳(メタデータ) (2025-03-05T09:30:49Z) - LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving [88.85002707211777]
LargeADは多用途でスケーラブルなフレームワークで、さまざまな現実世界の運転データセットにわたる大規模3D事前トレーニング用に設計されている。
我々のフレームワークはVFMを利用して2次元画像から意味的にリッチなスーパーピクセルを抽出する。
このアライメントは、クロスモーダルな表現学習を促進し、2Dデータと3Dデータのセマンティック一貫性を高める。
論文 参考訳(メタデータ) (2025-01-07T18:59:59Z) - Progressive Multi-Modal Fusion for Robust 3D Object Detection [12.048303829428452]
既存の方法は、バードアイビュー(BEV)とパースペクティブビュー(PV)の両方のモードから特徴を投影することで、単一ビューでセンサフュージョンを実行する。
本稿では,中間クエリレベルとオブジェクトクエリレベルの両方で,BEVとPVの両方の機能を組み合わせたプログレッシブフュージョンフレームワークProFusion3Dを提案する。
我々のアーキテクチャは、局所的およびグローバルな特徴を融合させ、3次元オブジェクト検出の堅牢性を高める。
論文 参考訳(メタデータ) (2024-10-09T22:57:47Z) - CooPre: Cooperative Pretraining for V2X Cooperative Perception [47.00472259100765]
CooPreは、V2X協調知覚のための自己教師型学習フラムワークである。
異種V2Xエージェント間の3D特徴に効果的に注意を向けることのできる,V2Xバードアイビュー(BEV)ガイドマスキング戦略を開発した。
CooPreはV2X-Realデータセットで4%のmAP改善を実現し、トレーニングデータの50%しか使用せず、ベースラインのパフォーマンスを上回っている。
論文 参考訳(メタデータ) (2024-08-20T23:39:26Z) - VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection [80.62052650370416]
モノクル3Dオブジェクト検出は、自律運転やロボティクスなど、さまざまなアプリケーションにおいて重要な役割を担っている。
本稿では,VFMM3Dを提案する。VFMM3Dは,ビジョンファウンデーションモデル(VFM)の機能を利用して,単一ビュー画像を正確にLiDARポイントクラウド表現に変換する,革新的なフレームワークである。
論文 参考訳(メタデータ) (2024-04-15T03:12:12Z) - LiDAR-Based 3D Object Detection via Hybrid 2D Semantic Scene Generation [38.38852904444365]
本稿では,2次元空間における3次元環境のセマンティクスと幾何学の両方をエンコードするシーン表現を提案する。
私たちのシンプルで効果的なデザインは、ほとんどの最先端の3Dオブジェクト検出器に簡単に統合できます。
論文 参考訳(メタデータ) (2023-04-04T04:05:56Z) - Fully Convolutional One-Stage 3D Object Detection on LiDAR Range Images [96.66271207089096]
FCOS-LiDARは、自律走行シーンのLiDAR点雲のための完全な1段式3Dオブジェクト検出器である。
標準的な2Dコンボリューションを持つRVベースの3D検出器は、最先端のBEVベースの検出器と同等の性能を発揮することを示す。
論文 参考訳(メタデータ) (2022-05-27T05:42:16Z) - M^2BEV: Multi-Camera Joint 3D Detection and Segmentation with Unified
Birds-Eye View Representation [145.6041893646006]
M$2$BEVは3Dオブジェクトの検出とマップのセグメンテーションを共同で行う統合フレームワークである。
M$2$BEVは、両方のタスクを統一モデルで推論し、効率を向上する。
論文 参考訳(メタデータ) (2022-04-11T13:43:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。