論文の概要: MM-BEV: Enhancing Timeliness by Computing Where and When it Matters
- arxiv url: http://arxiv.org/abs/2608.15437v1
- Date: Sat, 15 Aug 2026 22:42:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.299278
- Title: MM-BEV: Enhancing Timeliness by Computing Where and When it Matters
- Title(参考訳): MM-BEV: 時間軸と時間軸の計算によるタイムラインの強化
- Abstract要約: MM-BEVは、簡単な原理で導かれるリアルタイムBEVシステムである。
nuScenesでは、MM-BEVは推論のレイテンシを1.96倍、エンドツーエンドのレイテンシを2.93倍に減らし、幾何学的クリティカルなリコールは失われず、安全クリティカルなリコールは0.2ポイントしか減少しない。
Ouster-128 LiDAR、BEVカメラ、Jetson AGX Orinを搭載したClearpath Husky A300では、MM-BEVは平均遅延を2.11倍に減らし、その可能性を示している。
- 参考スコア(独自算出の注目度): 10.46858352449155
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multimodal bird's-eye-view (BEV) perception combines LiDAR depth accuracy with dense camera semantics, but its high computational cost and imperfect sensing conditions make real-time deployment challenging. Existing methods largely compress individual detectors and overlook three opportunities: structured sparsity within camera and LiDAR inputs, timing misalignment between modalities, and the fact that many detected objects do not affect the planner's immediate action. We present MM-BEV, a real-time multimodal BEV system guided by a simple principle: compute where and when it matters. MM-BEV divides perception into mandatory work for safety-critical objects within braking distance of the ego vehicle and with short time-to-collision (TTC), and optional work for less urgent regions. It prioritizes mandatory work and reduces or sheds optional work under tight compute budgets. MM-BEV integrates four mechanisms: (1) a criticality-ranked temporal ROI selector based on motion-extrapolated detections from prior frames; (2) sparse, ROI-aware feature extraction using shared-shape camera crops at context-adaptive resolution and ROI-aware LiDAR voxelization; (3) a latency-aware coordinator that adapts LiDAR sweeps, image resolution, and keyframes according to scene dynamics and TTC; and (4) an asynchronous scheduler that decouples sensing from inference and skips stale frames. On nuScenes, MM-BEV reduces inference latency by 1.96x and end-to-end latency by 2.93x, with no loss in geometry-critical recall and only a 0.2 percentage-point drop in safety-critical recall. On a Clearpath Husky A300 equipped with an Ouster-128 LiDAR, BEV cameras, and a Jetson AGX Orin, MM-BEV further reduces mean latency by 2.11x, demonstrating its potential for real-world autonomous systems.
- Abstract(参考訳): マルチモーダルバードアイビュー(BEV)知覚は、LiDAR深度精度と高密度カメラセマンティクスを組み合わせるが、その高い計算コストと不完全な検知条件は、リアルタイムデプロイメントを困難にしている。
既存の方法は、主に個々の検出器を圧縮し、カメラとLiDAR入力内の構造的間隔、モダリティ間のタイミングのずれ、多くの検出対象がプランナーの即時動作に影響を与えないという事実の3つの機会を見落としている。
MM-BEV は実時間マルチモーダル型 BEV システムであり,重要な場所と時刻の計算という単純な原理で導かれる。
MM-BEVは、認識をエゴ車両のブレーキ距離と短い時間対衝突(TTC)内での安全クリティカルな物体に対する義務的な作業と、緊急でない領域に対するオプション的な作業に分割する。
必須の作業の優先順位を付け、厳格な計算予算の下での任意の作業の削減または削減を行う。
MM-BEV は,(1) フレームからの動作抽出に基づく臨界ランク付き時間 ROI セレクタ,(2) コンテキスト適応型解像度と ROI 対応型LiDAR ボクセル化における共有形状カメラ作物を用いた ROI 対応特徴抽出,(3) シーンダイナミックスやTTC によるLiDAR のスイープ,画像解像度,キーフレームを適応する遅延対応コーディネータ,(4) の非同期スケジューラ,の4つのメカニズムを統合した。
nuScenesでは、MM-BEVは推論のレイテンシを1.96倍、エンドツーエンドのレイテンシを2.93倍に減らし、幾何学的クリティカルなリコールは失われず、安全クリティカルなリコールは0.2ポイントしか減少しない。
Ouster-128 LiDAR、BEVカメラ、Jetson AGX Orinを搭載したClearpath Husky A300では、MM-BEVは平均遅延を2.11倍に減らし、現実の自律システムの可能性を示している。
関連論文リスト
- Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation [68.02899606570223]
本稿では,効率的なエンボディナビゲーションのための統合フレームワークであるTAMP-Navを提案する。
まず、ナビゲーションを2次元の視覚座標に再構成するPixel-to-3D Action Formulation(Point)を導入する。
次に,Selective Reasoning and Anchor-Trajectory Memory Mechanism (Think and Memorize)を提案する。
論文 参考訳(メタデータ) (2026-08-18T08:37:08Z) - Think as Needed: Geometry-Driven Adaptive Perception for Autonomous Driving [4.320171553006484]
現在の3D検出モデルは、すべてのフレームに固定された計算予算を適用し、単純なシーンでリソースを浪費すると同時に、複雑なシーンのキャパシティを欠いている。
本稿では,各LiDARフレームの幾何学的複雑さを測定する適応型知覚アーキテクチャである拡張HOPEを提案する。
nuScenesとCARLAのベンチマークでは、強化HOPEは、正確さを損なわずに単純なシーンでのレイテンシを38%削減し、稀なロングテールシナリオでは平均平均精度を2.7ポイント改善している。
論文 参考訳(メタデータ) (2026-05-11T07:34:13Z) - Instance-level Visual Active Tracking with Occlusion-Aware Planning [61.982298426203165]
Visual Active Tracking (VAT)は、カメラを3D空間でターゲットに追従することを目的としている。
VATは、視覚的に類似したイントラクタからの混乱と、閉塞下での深刻な障害という、現実世界のデプロイメントにおいて2つの重要なボトルネックに直面している。
3つの相補的なモジュールを持つ統一パイプラインであるOA-VATを提案する。
論文 参考訳(メタデータ) (2026-04-23T09:11:50Z) - Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving [13.624495460189863]
異機種間特徴アライメントに変形可能な注意を生かしたレーダカメラBEV融合フレームワークを提案する。
MMF-BEVはBEVDepthカメラブランチとRadarBEVNetレーダーブランチを構築し、それぞれがDeformable Self-Attentionで強化されている。
センサコントリビューション分析は、距離ごとのモジュラリティ重み付けを定量化し、センサ相補性の解釈可能な証拠を提供する。
論文 参考訳(メタデータ) (2026-04-06T16:03:21Z) - Real-Time Structural Detection for Indoor Navigation from 3D LiDAR Using Bird's-Eye-View Images [0.0]
既存の3D手法は計算が禁じられているが、従来の2D幾何学的手法は頑丈さを欠いている。
本稿では,3次元LiDARデータを2D BirdのEye-View画像に投影し,マッピングとナビゲーションに関連する構造要素の効率的な検出を可能にするリアルタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-20T10:15:49Z) - DVLO4D: Deep Visual-Lidar Odometry with Sparse Spatial-temporal Fusion [28.146811420532455]
DVLO4Dは,空間-時空間融合を利用して精度とロバスト性を向上する新しい視覚-LiDARオドメトリーフレームワークである。
提案手法は,82msの予測時間を持つ高効率で,実時間展開の可能性を秘めている。
論文 参考訳(メタデータ) (2025-09-07T11:43:11Z) - Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance [12.513296074529727]
本稿では,自律走行のためのリアルタイムエッジベース自律走行軌道プランナ(REACT)を提案する。
REACTは、微調整軽量ビジョンランゲージモデル(VLM)に基づくADのためのV2X統合軌道最適化フレームワークである。
DeepAccidentベンチマークで評価されたREACTは、最先端の性能、77%の衝突率の低減、48.2%のビデオパノプティクス品質(VPQ)、およびJetson AGX Orinでの0.57秒の推論遅延を実現している。
論文 参考訳(メタデータ) (2025-08-01T20:16:04Z) - NOVA: Navigation via Object-Centric Visual Autonomy for High-Speed Target Tracking in Unstructured GPS-Denied Environments [56.35569661650558]
我々はNOVAというオブジェクト中心のフレームワークを導入し、ロバストな目標追跡と衝突認識ナビゲーションを可能にした。
グローバルマップを構築するのではなく、NOVAはターゲットの参照フレーム内での知覚、推定、制御を定式化する。
我々は,都市迷路や森林の小道,間欠的なGPS損失を伴う建物内の繰り返し遷移など,現実の挑戦的なシナリオにまたがってNOVAを検証する。
論文 参考訳(メタデータ) (2025-06-23T14:28:30Z) - AccidentBlip: Agent of Accident Warning based on MA-former [24.81148840857782]
AccidentBlipは視覚のみのフレームワークで、ビデオの各フレームを処理するために自設計のMotion Accident Transformer(MA-former)を使用している。
AccidentBlipは、DeepAccidentデータセット上の事故検出と予測タスクの両方のパフォーマンスを達成する。
また、V2VおよびV2Xシナリオにおける現在のSOTAメソッドよりも優れており、複雑な現実世界環境を理解するのに優れた能力を示している。
論文 参考訳(メタデータ) (2024-04-18T12:54:25Z) - Fully Convolutional One-Stage 3D Object Detection on LiDAR Range Images [96.66271207089096]
FCOS-LiDARは、自律走行シーンのLiDAR点雲のための完全な1段式3Dオブジェクト検出器である。
標準的な2Dコンボリューションを持つRVベースの3D検出器は、最先端のBEVベースの検出器と同等の性能を発揮することを示す。
論文 参考訳(メタデータ) (2022-05-27T05:42:16Z) - BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation [105.96557764248846]
本稿では,汎用マルチタスクマルチセンサ融合フレームワークであるBEVFusionを紹介する。
共有鳥眼ビュー表示空間におけるマルチモーダル特徴を統一する。
3Dオブジェクト検出では1.3%高いmAPとNDS、BEVマップのセグメンテーションでは13.6%高いmIoU、コストは1.9倍である。
論文 参考訳(メタデータ) (2022-05-26T17:59:35Z) - LIF-Seg: LiDAR and Camera Image Fusion for 3D LiDAR Semantic
Segmentation [78.74202673902303]
本稿では,LiDAR分割のための粗大なLiDARとカメラフュージョンベースネットワーク(LIF-Seg)を提案する。
提案手法は,画像の文脈情報を完全に活用し,単純だが効果的な早期融合戦略を導入する。
これら2つのコンポーネントの協力により、効果的なカメラ-LiDAR融合が成功する。
論文 参考訳(メタデータ) (2021-08-17T08:53:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。