論文の概要: UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion
- arxiv url: http://arxiv.org/abs/2606.03581v1
- Date: Tue, 02 Jun 2026 12:50:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 22:00:05.004476
- Title: UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion
- Title(参考訳): UnsOcc:Rendering Fusionによる非構造化シーンにおける3次元セマンティック占有予測
- Authors: Ye Wu, Ruiqi Song, Baiyong Ding, Nanxin Zeng, Junjie Cheng, Yunfeng Ai,
- Abstract要約: UnsOccは、非構造化環境における堅牢性を改善するマルチモーダルな3Dセマンティック占有予測フレームワークである。
その中核となるのはレンダリングベースの融合モジュールRenderFusionで、これはクロスモーダルな特徴アライメントを強化する。
提案手法は既存の最先端手法を著しく上回っている。
- 参考スコア(独自算出の注目度): 2.4196046716427393
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unstructured scenes present unique challenges for autonomous driving, as irregular obstacles and sparse scene layouts undermine the effectiveness of traditional perception methods such as 3D object detection. 3D semantic occupancy prediction has emerged as a prominent focus due to its ability to provide dense spatial representations by assigning semantic labels to individual voxels in 3D space. However, directly applying 3D semantic occupancy prediction to unstructured scenes remains challenging because scene sparsity hinders effective cross-modal fusion and the more severe long-tail distribution in these scenarios further degrades prediction performance. To validate the effectiveness of our approach, we construct a dedicated dataset of unstructured scenes collected from open-pit mines. Based on this, we propose UnsOcc, a multi-modal 3D semantic occupancy prediction framework that improves robustness in unstructured environments. At its core, we introduce a rendering-based fusion module, RenderFusion, which enhances cross-modal feature alignment through bidirectional rendering supervision. Furthermore, we propose GSRefinement, a detail-aware auxiliary supervision method based on Gaussian Splatting that projects sparse 3D occupancy predictions into dense 2D semantic segmentation maps, enabling effective supervision for long-tail categories. Extensive experiments on both the open-pit mine dataset and the nuScenes dataset demonstrate that our method significantly outperforms existing state-of-the-art approaches.
- Abstract(参考訳): 非構造的なシーンは、不規則な障害物やスパースなシーンレイアウトが、3Dオブジェクト検出のような従来の認識方法の有効性を損なうため、自律運転に特有の課題を示す。
3次元空間における個々のボクセルにセマンティックラベルを割り当てることで、密集した空間表現を提供する能力によって、3Dセマンティック占有予測が注目されている。
しかし,非構造シーンに3Dのセマンティック占有予測を直接適用することは,シーンの空間空間が効果的に相互融合を阻害し,これらのシナリオにおけるより深刻な長期分布が予測性能をさらに低下させるため,依然として困難である。
提案手法の有効性を検証するため,オープンピット鉱山から収集した非構造シーンの専用データセットを構築した。
そこで本研究では,非構造化環境におけるロバスト性を改善するマルチモーダルな3Dセマンティック占有予測フレームワークUnsOccを提案する。
中心となるのはレンダリングベースの融合モジュールであるRenderFusionを導入し、双方向レンダリングの監督を通じて機能アライメントを強化する。
さらに,Gaussian Splattingをベースとした詳細な補助的監視手法であるGSRefinementを提案する。
オープンピットマイニングデータセットとnuScenesデータセットの両方に関する大規模な実験により、我々の手法が既存の最先端のアプローチを著しく上回ることを示した。
関連論文リスト
- SUG-Occ: An Explicit Semantics and Uncertainty Guided Sparse Learning Framework for Real-Time 3D Occupancy Prediction [5.730573889498275]
SuG-Occは明示的なセマンティックスと不確実性ガイドによるスパース学習を可能とした3D職業予測フレームワークである。
まず、ビュー変換時の自由空間からの射影を抑えるために、意味的および不確実性事前を利用する。
次に、幾何整合性を高めるために明示的な符号なし距離符号化を用い、構造的に一貫したスパース3D表現を生成する。
論文 参考訳(メタデータ) (2026-01-16T16:07:38Z) - HD$^2$-SSC: High-Dimension High-Density Semantic Scene Completion for Autonomous Driving [52.959716866316604]
カメラベースの3Dセマンティックシーン補完(SSC)は、自動運転において重要な役割を果たす。
既存のSSC法は、固有の入出力次元ギャップとアノテーション-現実密度ギャップに悩まされている。
本稿では,画素セマンティクスを拡張した高次元高密度セマンティックシーンコンプリートフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-11T07:24:35Z) - TGP: Two-modal occupancy prediction with 3D Gaussian and sparse points for 3D Environment Awareness [13.68631587423815]
3Dセマンティックな占有力は、ロボット工学と自律運転環境知覚の分野において、急速に研究の焦点となっている。
既存の占有予測タスクは、voxelやポイントクラウドベースのアプローチを使用してモデル化される。
本稿では空間的位置と体積構造情報のバランスをとる3次元ガウス集合とスパース点に基づく2次元モーダル予測法を提案する。
論文 参考訳(メタデータ) (2025-03-13T01:35:04Z) - RadOcc: Learning Cross-Modality Occupancy Knowledge through Rendering
Assisted Distillation [50.35403070279804]
マルチビュー画像を用いた3次元シーンの占有状況とセマンティクスを推定することを目的とした,新たな課題である3D占有予測手法を提案する。
本稿では,RandOccを提案する。Rendering Assisted distillation paradigm for 3D Occupancy prediction。
論文 参考訳(メタデータ) (2023-12-19T03:39:56Z) - OccNeRF: Advancing 3D Occupancy Prediction in LiDAR-Free Environments [77.0399450848749]
本稿では,OccNeRF法を用いて,3次元監視なしで占有ネットワークを訓練する手法を提案する。
我々は、再構成された占有領域をパラメータ化し、サンプリング戦略を再編成し、カメラの無限知覚範囲に合わせる。
意味的占有予測のために,事前学習した開語彙2Dセグメンテーションモデルの出力をフィルタリングし,プロンプトを洗練するためのいくつかの戦略を設計する。
論文 参考訳(メタデータ) (2023-12-14T18:58:52Z) - Weakly Supervised Semantic Segmentation in 3D Graph-Structured Point
Clouds of Wild Scenes [36.07733308424772]
3Dセグメンテーションラベルの欠如は、効率的な点雲セグメンテーションの主な障害の1つである。
本稿では,2D のみを監督する点群における大規模セマンティックシーンセグメンテーションのための,新しいディープグラフ畳み込みネットワークフレームワークを提案する。
論文 参考訳(メタデータ) (2020-04-26T23:02:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。