論文の概要: SparseOcc++: Geometry-Aware Sparse Latent Representation for Semantic Occupancy Prediction
- arxiv url: http://arxiv.org/abs/2607.04732v1
- Date: Mon, 06 Jul 2026 07:10:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.067528
- Title: SparseOcc++: Geometry-Aware Sparse Latent Representation for Semantic Occupancy Prediction
- Title(参考訳): SparseOcc++:Sparse Latent Representation for Semantic Occupancy Prediction
- Authors: Pin Tang, Zhongdao Wang, Guoqing Wang, Xiangxuan Ren, Chao Ma,
- Abstract要約: 視覚に基づく3Dセマンティック占有予測は自動運転に不可欠である。
SparseOccを含む既存のメソッドは、セマンティックな予測でシーン補完を絡ませる。
本稿では,SparseOcc++を提案する。SparseOcc++は,シーン補完とセマンティックセグメンテーションを明示的に分離する,幾何学的なスパースフレームワークである。
- 参考スコア(独自算出の注目度): 22.045385519381217
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-based 3D semantic occupancy prediction is essential for autonomous driving, yet dense voxel representations waste computation on largely empty space, while BEV and TPV projections compromise fine-grained 3D structure. Fully sparse representations offer an attractive alternative, but existing methods, including SparseOcc, entangle scene completion with semantic prediction by indiscriminately propagating high-dimensional features into empty regions and applying voxel-wise classification. This creates excessive activations, computational overhead, and geometric ambiguity. We present SparseOcc++, a geometry-aware sparse framework that explicitly decouples scene completion from semantic segmentation. SparseOcc++ reformulates completion as signed-distance regression on sparse anchor voxels through a scene completion field (SCF). To model complex outdoor geometry robustly, it combines orthogonal decomposition with discretized distance learning. A geometry-guided propagation module then converts the SCF into a complete volumetric scene and restricts semantic segmentation to geometrically verified regions. Experiments establish new state of the art: SparseOcc++ improves IoU by 2.3 points and is 3.9x faster than SparseOcc on nuScenes, while achieving a 5.9x speedup over OccFormer on SemanticKITTI.
- Abstract(参考訳): 視覚に基づく3Dセマンティック占有予測は、自律運転には不可欠であるが、密度の高いボクセル表現は、ほとんど空き空間における廃棄物の計算を、BEVとTPVの予測は、きめ細かい3D構造を損なう。
完全なスパース表現は魅力的な代替手段を提供するが、SparseOccを含む既存の手法は、高次元の特徴を空の領域に無差別に伝播させ、ボクセル的分類を適用することによって、意味的予測を伴うシーン補完と絡み合う。
これは過剰なアクティベーション、計算オーバーヘッド、幾何学的曖昧さを生み出す。
本稿では,SparseOcc++を提案する。SparseOcc++は,シーン補完とセマンティックセグメンテーションを明示的に分離する,幾何学的なスパースフレームワークである。
SparseOcc++は、シーンコンプリートフィールド(SCF)を介してスパースアンカーボクセルの符号付き距離レグレッションとしてコンプリートを再構成する。
複雑な屋外幾何学を強固にモデル化するために、直交分解と離散距離学習を組み合わせる。
幾何学誘導伝搬モジュールは、SCFを完全なボリュームシーンに変換し、意味的セグメンテーションを幾何学的に検証された領域に制限する。
SparseOcc++はIoUを2.3ポイント改善し、nuScenesではSparseOccよりも3.9倍速く、SemanticKITTIではOccFormerよりも5.9倍のスピードアップを実現している。
関連論文リスト
- SUG-Occ: An Explicit Semantics and Uncertainty Guided Sparse Learning Framework for Real-Time 3D Occupancy Prediction [5.730573889498275]
SuG-Occは明示的なセマンティックスと不確実性ガイドによるスパース学習を可能とした3D職業予測フレームワークである。
まず、ビュー変換時の自由空間からの射影を抑えるために、意味的および不確実性事前を利用する。
次に、幾何整合性を高めるために明示的な符号なし距離符号化を用い、構造的に一貫したスパース3D表現を生成する。
論文 参考訳(メタデータ) (2026-01-16T16:07:38Z) - Open-Vocabulary Octree-Graph for 3D Scene Understanding [54.11828083068082]
Octree-Graphはオープンな3Dシーン理解のための新しいシーン表現である。
セマンティクスを記憶し、その形状に応じてオブジェクトの占有度を調節するアダプティブ・オクツリー構造を開発する。
論文 参考訳(メタデータ) (2024-11-25T10:14:10Z) - Large Spatial Model: End-to-end Unposed Images to Semantic 3D [79.94479633598102]
大空間モデル(LSM)は、RGB画像を直接意味的放射場に処理する。
LSMは、単一のフィードフォワード操作における幾何学、外観、意味を同時に推定する。
新しい視点で言語と対話することで、多目的ラベルマップを生成することができる。
論文 参考訳(メタデータ) (2024-10-24T17:54:42Z) - Fully Sparse 3D Occupancy Prediction [37.265473869812816]
運転予測は自動運転において重要な役割を果たす。
従来の手法は通常、密集した3Dボリュームを構築し、シーン固有の空間を無視し、高い計算コストを被る。
我々は,SparseOccと呼ばれる,完全スパース占有ネットワークを新たに導入した。
SparseOccは最初、カメラのみの入力からスパース3D表現を再構築し、その後スパースクエリによって3Dスパース表現からセマンティック/インスタンス占有を予測する。
論文 参考訳(メタデータ) (2023-12-28T16:54:53Z) - Camera-based 3D Semantic Scene Completion with Sparse Guidance Network [18.415854443539786]
本稿では,SGNと呼ばれるカメラベースのセマンティックシーン補完フレームワークを提案する。
SGNは空間幾何学的手がかりに基づいてセマンティック・アウェア・シード・ボクセルからシーン全体へのセマンティクスの伝播を行う。
実験の結果,既存の最先端手法よりもSGNの方が優れていることが示された。
論文 参考訳(メタデータ) (2023-12-10T04:17:27Z) - PointOcc: Cylindrical Tri-Perspective View for Point-based 3D Semantic
Occupancy Prediction [72.75478398447396]
本稿では,点雲を効果的かつ包括的に表現する円筒型三重対視図を提案する。
また,LiDAR点雲の距離分布を考慮し,円筒座標系における三点ビューを構築した。
プロジェクション中に構造の詳細を維持するために空間群プーリングを使用し、各TPV平面を効率的に処理するために2次元バックボーンを採用する。
論文 参考訳(メタデータ) (2023-08-31T17:57:17Z) - Neural 3D Scene Reconstruction with the Manhattan-world Assumption [58.90559966227361]
本稿では,多視点画像から3次元屋内シーンを再構築する課題について述べる。
平面的制約は、最近の暗黙の神経表現に基づく再構成手法に便利に組み込むことができる。
提案手法は, 従来の手法よりも3次元再構成品質に優れていた。
論文 参考訳(メタデータ) (2022-05-05T17:59:55Z) - SCFusion: Real-time Incremental Scene Reconstruction with Semantic
Completion [86.77318031029404]
本研究では,シーン再構成とセマンティックシーン補完を段階的かつリアルタイムに共同で行うフレームワークを提案する。
我々のフレームワークは、3Dグローバルモデルでセマンティックコンプリートを正確かつ効率的に融合させるために、占有マップを処理し、ボクセル状態を活用するように設計された新しいニューラルアーキテクチャに依存している。
論文 参考訳(メタデータ) (2020-10-26T15:31:52Z) - 3D Sketch-aware Semantic Scene Completion via Semi-supervised Structure
Prior [50.73148041205675]
セマンティック・シーン・コンプリート(SSC)タスクの目標は、単一視点で観察することで、ボリューム占有率とシーン内のオブジェクトの意味ラベルの完全な3Dボクセル表現を同時に予測することである。
低解像度のボクセル表現で深度情報を埋め込む新しい幾何学的手法を提案する。
提案手法は,SSCフレームワークからの深度特徴学習よりも有効である。
論文 参考訳(メタデータ) (2020-03-31T09:33:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。