論文の概要: DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection
- arxiv url: http://arxiv.org/abs/2607.12419v1
- Date: Tue, 14 Jul 2026 06:46:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.056157
- Title: DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection
- Title(参考訳): DeGuNet:高効率LiDARカメラ3D検出のための奥行きガイド付き超コンパクトバックボーン
- Abstract要約: 本稿では,DeGuNetを提案する。DeGuNetは深度誘導型表現学習のために設計された,超コンパクトでプラグアンドプレイの画像バックボーンである。
DeGuNetは、スペーサを意識した特徴抽出機構を組み込むことで、マルチビュー画像と非構造化LiDAR深度を効果的に整列し、無効領域の汚染を厳格に防止する。
nuScenesデータセットの実験では、DeGuNetの広範なプラグアンドプレイ適用性と優れた効率が示されている。
- 参考スコア(独自算出の注目度): 15.320081659452562
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In autonomous driving perception, the fusion of LiDAR and camera modalities has become the dominant paradigm for 3D object detection. However, current multi-modal frameworks heavily rely on massive visual backbones pretrained on 2D semantic tasks. This reliance introduces substantial parameter redundancy and a structural misalignment, as 2D priors are ill-equipped to handle the extreme sparsity of LiDAR projections required for Bird's-Eye-View geometry. To address this, we present DeGuNet, an ultra-compact and plug-and-play image backbone explicitly designed for depth-guided representation learning. By incorporating sparsity-aware feature extraction mechanisms, DeGuNet effectively aligns multi-view images with unstructured LiDAR depth while strictly preventing invalid-region contamination. Extensive experiments on the nuScenes dataset demonstrate DeGuNet's broad plug-and-play applicability and superior efficiency. When integrated into established baselines, it fundamentally eliminates architectural redundancy, reducing GPU memory consumption by up to 66.5% and achieving a 1.16x inference speedup. Concurrently, DeGuNet delivers up to a 6.20 absolute mAP gain, establishing a new paradigm for parameter-efficient multi-modal 3D perception.
- Abstract(参考訳): 自律運転知覚では、LiDARとカメラモダリティの融合が3次元物体検出の主要なパラダイムとなっている。
しかし、現在のマルチモーダルフレームワークは、2Dセマンティックタスクで事前訓練された巨大な視覚的バックボーンに大きく依存している。
この依存は、Bird's-Eye-View幾何学に必要なLiDAR射影の極端な間隔を扱うために2D先行装置が不備であるため、かなりのパラメータ冗長性と構造的ミスアライメントをもたらす。
そこで我々は,DeGuNetを提案する。DeGuNetは深度誘導表現学習のために設計された,超コンパクトでプラグアンドプレイの画像バックボーンである。
DeGuNetは、スペーサを意識した特徴抽出機構を組み込むことで、マルチビュー画像と非構造化LiDAR深度を効果的に整列し、無効領域の汚染を厳格に防止する。
nuScenesデータセットに関する大規模な実験は、DeGuNetの広範なプラグアンドプレイ適用性と優れた効率を実証している。
確立されたベースラインに統合されると、アーキテクチャ上の冗長性を根本的に排除し、GPUメモリ使用量を最大66.5%削減し、1.16倍の推論スピードアップを達成する。
同時にDeGuNetは6.20の絶対的なmAPゲインを提供し、パラメータ効率の良いマルチモーダル3D知覚のための新しいパラダイムを確立している。
関連論文リスト
- Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction [23.223291360701907]
Lite3RはSparse Linear Attentionに置き換わるモデルに依存しない教師学習フレームワークである。
Lite3R はレイテンシ (1.7-2.0x) とメモリ使用率 (1.9-2.4x) を大幅に削減し、全体として競争力のある再構築品質を維持する。
論文 参考訳(メタデータ) (2026-05-12T00:20:02Z) - AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models [42.57469056850227]
VLA(Vision-Language-Action)モデルは最近、ロボットの知覚と制御において顕著な進歩を遂げている。
深度推定をVLAモデルに統合し,3次元特徴表現を充実させる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:57:32Z) - LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation [23.72983078807998]
現在の3Dオブジェクト検出器は、高い検出精度を達成するために複雑なアーキテクチャとトレーニング戦略に依存している。
これらの方法はLiDARセンサーに大きく依存しているため、LiDARが欠如している場合に大きな性能低下に悩まされる。
我々は,LiDAR点からの相補的特徴を四元数空間内の画像特徴に統合する,新しい多モード3D検出器LiteFusionを導入する。
論文 参考訳(メタデータ) (2025-12-23T10:16:33Z) - Johnson-Lindenstrauss Lemma Guided Network for Efficient 3D Medical Segmentation [42.23472421492995]
本研究では,高次元画像の特徴に基づいてフレームワークを再設計する方法について述べる。
私たちのアプローチであるVeloxSegは、デプロイ可能でデュアルストリームのCNN-Transformerアーキテクチャから始まります。
VeloxSegはDiceを26%改善し、GPUスループットを11倍、CPUを48倍向上させた。
論文 参考訳(メタデータ) (2025-09-26T13:12:43Z) - TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP [52.79100775328595]
3Dビジュアルグラウンドティングは、人間の指示に基づいて現実世界の3D環境における視覚情報を理解するための具体的エージェントである。
既存の3Dビジュアルグラウンド法は、異なるモダリティの異なるエンコーダに依存している。
本稿では,3つのモードすべてを処理するために,統合された2次元事前学習型マルチモーダルネットワークを提案する。
論文 参考訳(メタデータ) (2025-07-20T10:28:06Z) - GEOcc: Geometrically Enhanced 3D Occupancy Network with Implicit-Explicit Depth Fusion and Contextual Self-Supervision [49.839374549646884]
本稿では,視覚のみのサラウンドビュー知覚に適したジオメトリ強化OccupancyネットワークであるGEOccについて述べる。
提案手法は,Occ3D-nuScenesデータセット上で,画像解像度が最小で,画像バックボーンが最大である状態-Of-The-Art性能を実現する。
論文 参考訳(メタデータ) (2024-05-17T07:31:20Z) - Fully Sparse Fusion for 3D Object Detection [69.32694845027927]
現在広く使われているマルチモーダル3D検出法は、通常、密度の高いBird-Eye-View特徴マップを使用するLiDARベースの検出器上に構築されている。
完全にスパースなアーキテクチャは、長距離知覚において非常に効率的であるため、注目を集めている。
本稿では,新たに出現するフルスパースアーキテクチャにおいて,画像のモダリティを効果的に活用する方法を検討する。
論文 参考訳(メタデータ) (2023-04-24T17:57:43Z) - MSMDFusion: Fusing LiDAR and Camera at Multiple Scales with Multi-Depth
Seeds for 3D Object Detection [89.26380781863665]
自律運転システムにおける高精度で信頼性の高い3次元物体検出を実現するためには,LiDARとカメラ情報の融合が不可欠である。
近年のアプローチでは、2次元カメラ画像の3次元空間への昇華点によるカメラ特徴のセマンティックな密度の探索が試みられている。
マルチグラニュラリティLiDARとカメラ機能とのマルチスケールなプログレッシブインタラクションに焦点を当てた,新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-09-07T12:29:29Z) - EPNet++: Cascade Bi-directional Fusion for Multi-Modal 3D Object
Detection [56.03081616213012]
本稿では,新しいCasscade Bi-directional Fusion(CB-Fusion)モジュールを導入することで,マルチモーダル3Dオブジェクト検出のためのEPNet++を提案する。
提案したCB-Fusionモジュールは、カスケード双方向相互作用融合方式で画像特徴と点特徴の豊富な意味情報を高める。
KITTI、JRDB、SUN-RGBDデータセットの実験結果は、最先端の手法よりもEPNet++の方が優れていることを示している。
論文 参考訳(メタデータ) (2021-12-21T10:48:34Z) - ZoomNet: Part-Aware Adaptive Zooming Neural Network for 3D Object
Detection [69.68263074432224]
ステレオ画像に基づく3D検出のためのZoomNetという新しいフレームワークを提案する。
ZoomNetのパイプラインは、通常の2Dオブジェクト検出モデルから始まり、左右のバウンディングボックスのペアを取得するために使用される。
さらに,RGB画像のテクスチャキューを多用し,より正確な異質度推定を行うため,適応ズームという概念的に真直ぐなモジュールを導入する。
論文 参考訳(メタデータ) (2020-03-01T17:18:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。