論文の概要: Lightweight 3D Object Detection via Mamba-Based Knowledge Distillation
- arxiv url: http://arxiv.org/abs/2608.03490v1
- Date: Tue, 04 Aug 2026 11:26:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.156897
- Title: Lightweight 3D Object Detection via Mamba-Based Knowledge Distillation
- Title(参考訳): マンバに基づく知識蒸留による軽量3次元物体検出
- Abstract要約: 光検出・測光センサ(LiDAR)を用いた3次元物体検出には,精度と計算効率のバランスが必要である。
既存のLiDARベースの検出手法の多くは、複雑なアーキテクチャを用いて特徴を抽出し、大量のコンテキスト情報を統合して精度を高める。
本稿では,強力な教師モデルから選択的なボクセル空間の特徴アライメントを通じて,オブジェクトレベルのボクセル表現を軽量な学生モデルに伝達する知識蒸留フレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D object detection using light detection and ranging (LiDAR) sensors requires a balance between accuracy and computational efficiency for onboard perception in autonomous driving and robotic navigation. Many existing LiDAR-based detection methods employ complex architectures to extract features, integrating large amounts of contextual information to enhance accuracy. This often results in significant computational costs, leading to suboptimal performance on resource-constrained embedded devices. In this study, we propose a knowledge distillation framework that transfers object-level voxel representations from a strong teacher model to lightweight student models through selective voxel-space feature alignment. Taking advantage of the linear-time sequence model with selective state spaces (Mamba), we design a multi-branch Mamba teacher backbone and a box-aware feature transfer mechanism that aligns spatially corresponding voxel features between teacher and student networks through a Mamba-based projection module. Experimental results on both a public dataset and real-world data show that our approach significantly reduces computational load while maintaining competitive accuracy compared with state-of-the-art methods.
- Abstract(参考訳): 光検出・測光センサ(LiDAR)を用いた3次元物体検出には、自律走行とロボットナビゲーションにおける車載認識の精度と計算効率のバランスが必要である。
既存のLiDARベースの検出手法の多くは、複雑なアーキテクチャを用いて特徴を抽出し、大量のコンテキスト情報を統合して精度を高める。
これはしばしば大きな計算コストをもたらし、リソースに制約された組み込みデバイス上での最適以下の性能をもたらす。
本研究では,強力な教師モデルから選択的なボクセル空間の特徴アライメントを通じて,オブジェクトレベルのボクセル表現を軽量な学生モデルに伝達する知識蒸留フレームワークを提案する。
選択状態空間を持つ線形時間列モデル(Mamba)を利用して,マルチブランチのMamba教師バックボーンと,Mambaベースプロジェクションモジュールによる教師ネットワークと学生ネットワーク間の空間的に対応するボクセル特徴を整列するボックス対応機能伝達機構を設計する。
公開データセットと実世界のデータによる実験結果から,提案手法は最先端手法と比較して競争精度を維持しつつ,計算負荷を著しく低減することが示された。
関連論文リスト
- Selective Transfer Learning of Cross-Modality Distillation for Monocular 3D Object Detection [41.41435217865119]
クロスモダリティの知識蒸留は、LiDARから画像ベースネットワークへの深度情報転送を効果的に行うことができる。
しかし、画像とLiDARの間のモダリティギャップは、その精度を著しく制限している。
これらの問題を克服するために,MonoSTLという選択学習手法を提案する。
論文 参考訳(メタデータ) (2026-03-08T05:05:07Z) - Smooth-Distill: A Self-distillation Framework for Multitask Learning with Wearable Sensor Data [0.0]
本稿では,人間の活動認識(HAR)とセンサ配置検出を同時に行うように設計された,新しい自己蒸留フレームワークであるSmooth-Distillを紹介する。
従来の蒸留法とは異なり, 提案手法では, モデル自体のスムーズな歴史バージョンを教師として利用している。
実験結果から,Smooth-Distill は異なる評価シナリオにおける代替手法よりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-06-27T06:51:51Z) - Resource-Efficient Beam Prediction in mmWave Communications with Multimodal Realistic Simulation Framework [57.994965436344195]
ビームフォーミングは、方向と強度を最適化して信号伝送を改善するミリ波通信において重要な技術である。
マルチモーダルセンシング支援ビーム予測は,ユーザ位置やネットワーク条件を予測するために,さまざまなセンサデータを使用して注目されている。
その有望な可能性にもかかわらず、マルチモーダルセンシング支援ビーム予測の採用は、高い計算複雑性、高いコスト、限られたデータセットによって妨げられている。
論文 参考訳(メタデータ) (2025-04-07T15:38:25Z) - Unleashing the Potential of Mamba: Boosting a LiDAR 3D Sparse Detector by Using Cross-Model Knowledge Distillation [22.653014803666668]
FASDと呼ばれる高速LiDAR3Dオブジェクト検出フレームワークを提案する。
高速シーケンスモデリングのための変換器のキャパシティをFLOPの低いMambaモデルに蒸留し,知識伝達による精度の向上を実現することを目的とする。
我々は,データセットとnuScenesのフレームワークを評価し,リソース消費の4倍の削減と,現在のSoTA手法よりも1-2%の性能向上を実現した。
論文 参考訳(メタデータ) (2024-09-17T09:30:43Z) - Real-time Multi-view Omnidirectional Depth Estimation for Real Scenarios based on Teacher-Student Learning with Unlabeled Data [13.107135855680992]
本稿では,Rt-OmniMVS というエッジコンピューティングプラットフォームを対象とした全方向のリアルタイム深度推定手法を提案する。
実環境における高精度,堅牢性,一般化を実現するため,教師の学習戦略を導入する。
また,多視点魚眼カメラとエッジデバイスを用いた全方位深度センシングシステムであるHexaMODEを提案する。
論文 参考訳(メタデータ) (2024-09-12T08:44:35Z) - 4D Contrastive Superflows are Dense 3D Representation Learners [62.433137130087445]
我々は,LiDARとカメラのペアを連続的に利用して事前学習の目的を確立するための,新しいフレームワークであるSuperFlowを紹介する。
学習効率をさらに向上するため,カメラビューから抽出した知識の整合性を高めるプラグイン・アンド・プレイ・ビュー・一貫性モジュールを組み込んだ。
論文 参考訳(メタデータ) (2024-07-08T17:59:54Z) - Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving [58.16024314532443]
我々は、異なるLiDARスキャンからレーザービーム操作を統合するフレームワークであるLaserMix++を導入し、データ効率の学習を支援するためにLiDAR-カメラ対応を組み込んだ。
結果は、LaserMix++が完全に教師付き代替よりも優れており、5倍のアノテーションで同等の精度を実現していることを示している。
この大幅な進歩は、LiDARベースの3Dシーン理解システムにおける広範囲なラベル付きデータへの依存を減らすための半教師付きアプローチの可能性を示している。
論文 参考訳(メタデータ) (2024-05-08T17:59:53Z) - Cross-Cluster Shifting for Efficient and Effective 3D Object Detection
in Autonomous Driving [69.20604395205248]
本稿では,自律運転における3次元物体検出のための3次元点検出モデルであるShift-SSDを提案する。
我々は、ポイントベース検出器の表現能力を解き放つために、興味深いクロスクラスタシフト操作を導入する。
我々は、KITTI、ランタイム、nuScenesデータセットに関する広範な実験を行い、Shift-SSDの最先端性能を実証した。
論文 参考訳(メタデータ) (2024-03-10T10:36:32Z) - Learning to Simulate Realistic LiDARs [66.7519667383175]
リアルLiDARセンサのデータ駆動シミュレーションのためのパイプラインを提案する。
本モデルでは, 透明表面上の落下点などの現実的な効果を符号化できることが示される。
我々は2つの異なるLiDARセンサのモデルを学習し、それに従ってシミュレーションされたLiDARデータを改善する。
論文 参考訳(メタデータ) (2022-09-22T13:12:54Z) - Boosting 3D Object Detection by Simulating Multimodality on Point Clouds [51.87740119160152]
本稿では,LiDAR 画像検出器に追従する特徴や応答をシミュレートすることで,単一モダリティ (LiDAR) 3次元物体検出器を高速化する新しい手法を提案する。
このアプローチでは、単一モダリティ検出器をトレーニングする場合のみ、LiDARイメージデータを必要とし、十分にトレーニングされた場合には、推論時にのみLiDARデータが必要である。
nuScenesデータセットの実験結果から,本手法はSOTA LiDARのみの3D検出器よりも優れていることがわかった。
論文 参考訳(メタデータ) (2022-06-30T01:44:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。