論文の概要: 4DR360: State Reasoning for Joint 3D Detection and Occupancy Prediction in 4D Radar-Camera Full-Scene Perception
- arxiv url: http://arxiv.org/abs/2607.09629v2
- Date: Mon, 13 Jul 2026 13:49:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.281511
- Title: 4DR360: State Reasoning for Joint 3D Detection and Occupancy Prediction in 4D Radar-Camera Full-Scene Perception
- Title(参考訳): 4DR360:4次元レーダカメラフルシーン知覚における関節3次元検出と動作予測のための状態推論
- Authors: Xiaokai Bai, Lianqing Zheng, Runwei Guan, Songkai Wang, Siyuan Cao, Hui-liang Shen,
- Abstract要約: 信頼性の高い自律運転には、密集したセマンティックレイアウトで前景オブジェクトを結合するフルシーンの認識が必要である。
永続的なシーン状態としての意味的占有をモデル化した,360ドル前後のフルシーン知覚のための4次元レーダカメラフレームワークを提案する。
我々は、ManTruckScenesを衛星マップベースで生成された占有ラベルで拡張し、OmniHD-Scenesと組み合わせて、クロスデータセット検出・占有プロトコルを統一する。
- 参考スコア(独自算出の注目度): 12.807651354967183
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable autonomous driving requires full-scene perception that couples foreground objects with dense semantic layout. Recently, 4D millimeter-wave radar has emerged as a robust and affordable sensor, yet its sparse returns make radar-camera fusion necessary for comprehensive scene understanding. Existing radar-camera methods mainly optimize detection, while dual-task systems usually decode boxes and occupancy with limited interaction. To address this gap and advance radar-based multi-task learning, we propose \method, a 4D radar-camera framework for 360$^\circ$ full-scene perception, which models semantic occupancy as a persistent scene state rather than a terminal output. \method{} follows a cross-modal state reasoning paradigm, where the occupancy state is modeled and propagated through stages for coarse-to-fine feature aggregation. Specifically, State-guided BEV Enhancement (SBE) strengthens intra-frame BEV representation, while Doppler-guided Temporal Fusion (DTF) preserves state evidence over longer temporal horizons. Beyond the model, we further extend ManTruckScenes with satellite-map-based generated occupancy labels and pair it with OmniHD-Scenes in a unified cross-dataset detection-and-occupancy protocol. The resulting experiments cover accuracy, robustness, ablation, and efficiency under one radar-camera multi-task evaluation framework. Code and labels will be released upon acceptance.
- Abstract(参考訳): 信頼性の高い自律運転には、密集したセマンティックレイアウトで前景オブジェクトを結合するフルシーンの認識が必要である。
近年、4Dミリ波レーダーは頑丈で手頃な価格のセンサーとして登場しているが、そのスパースリターンはレーダーとカメラの融合を総合的なシーン理解に必要なものにしている。
既存のレーダーカメラ方式は主に検出を最適化するが、デュアルタスク方式は通常、限られた相互作用でボックスと占有をデコードする。
このギャップと先進的なレーダーベースのマルチタスク学習を実現するために,360$^\circ$フルシーン認識のための4DレーダカメラフレームワークであるShamethodを提案する。
\method{} はクロスモーダルな状態推論パラダイムに従い、占有状態は粗い特徴集合の段階を通してモデル化され、伝播される。
具体的には、状態誘導型BEV強化(SBE)はフレーム内BEV表現を強化し、ドップラー誘導型時間核融合(DTF)は長期の時間的地平線上の状態証拠を保存する。
モデルを超えて,衛星マップをベースとした占有ラベルをManTruckScenesに拡張し,OmniHD-Scenesと組み合わせてクロスデータセット検出・占有プロトコルを構築する。
得られた実験は、1つのレーダーカメラマルチタスク評価フレームワークの下での精度、堅牢性、アブレーション、効率をカバーしている。
コードとラベルは受理時にリリースされる。
関連論文リスト
- Boosting Instance Awareness via Cross-View Correlation with 4D Radar and Camera for 3D Object Detection [19.99225197463389]
SIFormerは4Dレーダーとカメラを用いた3Dオブジェクト検出のためのシーンインスタンス対応トランスフォーマーである。
実験の結果、SIFormerはView-of-Delft、TJ4DRadSet、NuScenesのデータセットで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-24T07:25:53Z) - Wavelet-based Multi-View Fusion of 4D Radar Tensor and Camera for Robust 3D Object Detection [44.78575994732947]
WRCFormerは、デカップリングされたレーダーキューブのマルチビュー表現を介して、生のレーダーキューブとカメラ入力を融合する新しい3Dオブジェクト検出フレームワークである。
WRCFormerはK-Radarベンチマークで最先端のパフォーマンスを達成し、すべてのシナリオで最高のモデルを約2.4%上回っている。
論文 参考訳(メタデータ) (2025-12-28T15:32:17Z) - RadarGen: Automotive Radar Point Cloud Generation from Cameras [64.69976771710057]
マルチビューカメラ画像からリアルな自動車用レーダー点雲を合成するための拡散モデルRadarGenを提案する。
RadarGenは、鳥の目視でレーダー計測を表現することで、レーダ領域への効率的な画像遅延拡散を適応する。
本稿では,RadarGenが特徴的レーダ計測分布を捕捉し,実データに基づいて学習した知覚モデルとのギャップを小さくすることを示す。
論文 参考訳(メタデータ) (2025-12-19T18:57:33Z) - RobuRCDet: Enhancing Robustness of Radar-Camera Fusion in Bird's Eye View for 3D Object Detection [68.99784784185019]
暗い照明や悪天候はカメラの性能を低下させる。
レーダーは騒音と位置のあいまいさに悩まされる。
本稿では,BEVの頑健な物体検出モデルであるRobuRCDetを提案する。
論文 参考訳(メタデータ) (2025-02-18T17:17:38Z) - Doracamom: Joint 3D Detection and Occupancy Prediction with Multi-view 4D Radars and Cameras for Omnidirectional Perception [9.76463525667238]
マルチビューカメラと4Dレーダを融合した最初のフレームワークであるDoracamomを提案する。
コードとモデルは公開されます。
論文 参考訳(メタデータ) (2025-01-26T04:24:07Z) - MetaOcc: Spatio-Temporal Fusion of Surround-View 4D Radar and Camera for 3D Occupancy Prediction with Dual Training Strategies [12.485905108032146]
本稿では,Omni指向の3次元占有予測のための新しいマルチモーダルフレームワークであるMetaOccを紹介する。
レーダーデータにエンコーダを直接適用することの限界に対処するため,レーダハイト自己保持モジュールを提案する。
高価な点クラウドへの依存を軽減するため,オープンセットセグメンタに基づく擬似ラベル生成パイプラインを提案する。
論文 参考訳(メタデータ) (2025-01-26T03:51:56Z) - V2X-Radar: A Multi-modal Dataset with 4D Radar for Cooperative Perception [61.58737390490639]
V2X-Radarは、4Dレーダを特徴とする世界初の大規模実世界のマルチモーダルデータセットである。
データセットは20KのLiDARフレーム、40Kのカメライメージ、350Kの注釈付きボックスを含む20Kの4Dレーダデータで構成されている。
様々な研究領域をサポートするために, 協調認識のためのV2X-Radar-C, 路面認識のためのV2X-Radar-I, 単車知覚のためのV2X-Radar-Vを確立した。
論文 参考訳(メタデータ) (2024-11-17T04:59:00Z) - V2X-R: Cooperative LiDAR-4D Radar Fusion with Denoising Diffusion for 3D Object Detection [64.93675471780209]
我々は、LiDAR、カメラ、および4Dレーダを取り入れた初のシミュレーションV2XデータセットであるV2X-Rを提案する。
V2X-Rには12,079のシナリオがあり、LiDARと4Dレーダーポイント雲の37,727フレーム、150,908の画像、170,859の注釈付き3D車両バウンディングボックスがある。
本稿では,3次元物体検出のための新しいコラボレーティブLiDAR-4Dレーダ融合パイプラインを提案し,様々な融合戦略を用いて実装する。
論文 参考訳(メタデータ) (2024-11-13T07:41:47Z) - DETR4D: Direct Multi-View 3D Object Detection with Sparse Attention [50.11672196146829]
サラウンドビュー画像を用いた3次元物体検出は、自動運転にとって必須の課題である。
マルチビュー画像における3次元オブジェクト検出のためのスパースアテンションと直接特徴クエリを探索するトランスフォーマーベースのフレームワークであるDETR4Dを提案する。
論文 参考訳(メタデータ) (2022-12-15T14:18:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。