論文の概要: OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Predictio
- arxiv url: http://arxiv.org/abs/2608.08696v1
- Date: Sun, 09 Aug 2026 13:19:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.918756
- Title: OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Predictio
- Title(参考訳): OccAnyScene: 屋内3D操作の統一化に向けて
- Authors: Junjie Liu, Wanshui Gan, Zitong Dai, Guiping Cao, Yan Li, Ke Chen, Dongmei Jiang, Xiangyuan Lan, Jianguo Zhang,
- Abstract要約: クロスシーン3Dセマンティック占領予測は、異種シーンを扱うために単一のモデルを必要とする。
OccAnySceneは,予め訓練された深度基礎モデルに基づいて構築された画素フラストム中心のガウスフレームワークである。
OccAnySceneは、室内のOcc-ScanNetで59.92% mIoU、屋外のSurroundOcc-nuScenesで23.06% mIoUを達成した。
- 参考スコア(独自算出の注目度): 36.62260610334548
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: 3D occupancy prediction is fundamental to scene understanding, yet existing 3D semantic occupancy methods are typically specialized to fixed scene types and occupancy protocols. We introduce Cross-Scene 3D Semantic Occupancy Prediction, a new task setting which requires a single model to handle heterogeneous indoor and outdoor scenes with varying cameras, spatial ranges, voxel specifications, and semantic taxonomies. This setting poses a fundamental challenge: achieving metric-consistent yet scene-adaptive image-to-3D lifting across varying camera configurations and scene scales. To address this challenge, we propose OccAnyScene, a pixel-frustum-centered Gaussian framework built upon a pretrained depth foundation model. Specifically, the framework employs Pixel-Aligned Frustum Feature Aggregation to construct a camera-aware frustum query for each feature pixel, and Frustum-Parameterized Gaussian Construction to decode each query into multiple Gaussians whose positions and sizes are constrained by the predicted pixel depth and corresponding frustum geometry. OccAnyScene sets new state-of-the-art results, achieving 59.92% mIoU on the indoor Occ-ScanNet and 23.06% mIoU on the outdoor SurroundOcc-nuScenes.
- Abstract(参考訳): 3Dの占有予測はシーン理解に不可欠であるが、既存の3Dセマンティック占有法は通常、固定されたシーンタイプや占有プロトコルに特化している。
室内および屋外の異種シーンをカメラ,空間範囲,ボクセル仕様,セマンティック分類で処理するための単一モデルを必要とする,クロスシーン3次元セマンティックアクセプタシー予測(Cross-Scene 3D Semantic Occupancy Prediction)を導入した。
この設定は、様々なカメラ構成とシーンスケールにまたがって、メートル法に一貫性があるが、シーン適応的な3Dリフトを実現するという根本的な課題を生んでいる。
この課題に対処するために,予め訓練された深度基礎モデルに基づいて構築された画素フラストム中心のガウスフレームワークであるOccAnySceneを提案する。
具体的には,Pixel-Aligned Frustum Feature Aggregationを用いて,各特徴画素に対するカメラ対応フラストムクエリを構築し,Frustum-Parameterized Gaussian Constructionにより,各クエリを,予測された画素深さと対応するフラストム形状に制約された複数のガウスアンにデコードする。
OccAnySceneは、室内のOcc-ScanNetで59.92% mIoU、屋外のSurroundOcc-nuScenesで23.06% mIoUを達成した。
関連論文リスト
- Unified Semantic Transformer for 3D Scene Understanding [55.415468022487005]
我々は、単一のモデル内に多様な3Dセマンティックタスクを統一する新しいフィードフォワードニューラルネットワークUNITEを紹介する。
我々のモデルは、完全なエンドツーエンドで見えないシーンで動作し、完全な3Dセマンティックジオメトリを推測するのにほんの数秒しかかからない。
UNITEはいくつかの異なる意味的タスクにおいて最先端のパフォーマンスを達成し、タスク固有のモデルよりも優れていることを実証する。
論文 参考訳(メタデータ) (2025-12-16T12:49:35Z) - WorldMirror: Universal 3D World Reconstruction with Any-Prior Prompting [51.69408870574092]
汎用的な3次元幾何予測タスクのためのオールインワンフィードフォワードモデルであるWorldMirrorを提案する。
我々のフレームワークは、カメラのポーズ、内在性、深度マップなど、様々な幾何学的先入観を柔軟に統合する。
WorldMirrorは、カメラ、ポイントマップ、深さ、表面正規推定から新しいビュー合成に至るまで、さまざまなベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-10-12T17:59:09Z) - DepthSSC: Monocular 3D Semantic Scene Completion via Depth-Spatial Alignment and Voxel Adaptation [2.949710700293865]
単眼カメラのみを用いたセマンティックシーン補完手法DepthSSCを提案する。
DepthSSCがGeometric-Aware Voxelization (GAV)とSpatial Transformation Graph Fusion (ST-GF)モジュールを統合
DepthSSCは複雑な3次元構造を効果的に捉え、最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-11-28T01:47:51Z) - Occ3D: A Large-Scale 3D Occupancy Prediction Benchmark for Autonomous
Driving [34.368848580725576]
我々は,任意のシーンに対して,濃密で可視性に配慮したラベルを生成するラベル生成パイプラインを開発した。
このパイプラインは、ボクセルの密度化、推論、画像誘導ボクセル精製の3段階からなる。
我々は、Occ3Dベンチマークにおいて優れた性能を示すCTF-Occネットワークと呼ばれる新しいモデルを提案する。
論文 参考訳(メタデータ) (2023-04-27T17:40:08Z) - SurroundOcc: Multi-Camera 3D Occupancy Prediction for Autonomous Driving [98.74706005223685]
3Dシーン理解は、視覚に基づく自動運転において重要な役割を果たす。
マルチカメラ画像を用いたSurroundOcc法を提案する。
論文 参考訳(メタデータ) (2023-03-16T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。