論文の概要: Spheriverse: 3D Scene Understanding from Spherical Observations in the Wild
- arxiv url: http://arxiv.org/abs/2609.09012v2
- Date: Tue, 15 Sep 2026 02:05:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.060189
- Title: Spheriverse: 3D Scene Understanding from Spherical Observations in the Wild
- Title(参考訳): 球面:野生の球面観測から3次元のシーン理解
- Abstract要約: 我々は,644配列に整理された64,400個の球面像-LiDAR対からなるSpheriverseを紹介した。
データセットは様々なシーン、照明、気象条件にまたがっており、微粒なセマンティッククラスがある。
密接な予測のために,球面形状のモデリングと意味的証拠の検索を併用した占有フレームワークであるSphereOccを提案する。
- 参考スコア(独自算出の注目度): 29.435475031890523
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spherical observations provide global visual context for 3D scene understanding. However, visual information is encoded in an angular domain, whereas the physical world is represented in Cartesian coordinates. This cross-space representation gap complicates geometric correspondence and semantic evidence aggregation. To delve into this challenge, we introduce Spheriverse, comprising 64,400 temporally aligned spherical image-LiDAR pairs organized into 644 sequences. The dataset spans diverse scenes, illumination, and weather conditions, with fine-grained semantic classes. We further establish benchmarks for semantic occupancy prediction, semantic mapping, and 3D object detection, evaluating 30+ methods through overall and scene-wise comparisons. For dense prediction, we propose SphereOcc, an occupancy framework that couples spherical geometry modeling with semantic evidence retrieval. Cartesian-Spherical Representation Remodeling (CSRR) incorporates spherical range-azimuth geometry into Cartesian voxel features through region-wise modulation. Spherical Evidence Re-querying (SER) then conditions queries on voxel content and range-height-azimuth geometry to adaptively retrieve relevant semantic evidence from source spherical image features. SphereOcc achieves 13.91% mIoU and 24.65% GeoIoU, yielding relative improvements of 13.9% and 9.3% over the respective best-performing methods, TPVFormer and SurroundOcc. It also ranks first in both metrics across all five scene categories, with consistent advantages across the evaluated spatial partitions and reduced fields of view. The established benchmark and source code will be available at https://feit-feiteng.github.io/Spheriverse.
- Abstract(参考訳): 球面観察は、3Dシーン理解のためのグローバルな視覚的コンテキストを提供する。
しかし、視覚情報は角領域でエンコードされるのに対し、物理世界はカルト座標で表される。
この交叉空間表現ギャップは、幾何学的対応と意味的証拠の集約を複雑にする。
この課題を掘り下げるために、644のシーケンスにまとめられた64,400の時間的に整列した球面-LiDAR対からなるSpheriverseを紹介した。
データセットは様々なシーン、照明、気象条件にまたがっており、微粒なセマンティッククラスがある。
さらに, セマンティック占有率予測, セマンティックマッピング, および3次元オブジェクト検出のためのベンチマークを構築し, 全体的および場面的比較による30以上の手法の評価を行った。
密接な予測のために,球面形状のモデリングと意味的証拠の検索を併用した占有フレームワークであるSphereOccを提案する。
Cartesian-Spherical Representation Remodeling (CSRR) は、球面領域のアジマス幾何を、領域ワイド変調を通じて、Cartesian voxel特徴に組み込む。
SER (Spherical Evidence Re-querying) では、ソースの球面画像特徴から関連する意味的証拠を適応的に取得するために、ボクセル内容とレンジハイト・アジマス幾何のクエリを条件付ける。
SphereOcc は 13.91% mIoU と 24.65% GeoIoU を達成し、それぞれのベストパフォーマンスメソッドである TPVFormer と SurroundOcc に対して 13.9% と 9.3% の相対的な改善を得た。
また、評価された空間分割と縮小された視野で一貫したアドバンテージを持つ5つのシーンカテゴリで、両方の指標で第1位にランクインしている。
確立されたベンチマークとソースコードはhttps://feit-feiteng.github.io/Spheriverseで入手できる。
関連論文リスト
- SphereSOD: Geometry-Structure Coupled Learning for 360 Salient Object Detection [75.77856258186854]
360度高解像度物体検出は、全視野にわたって高解像度領域を正確に分割することを目的としている。
既存の手法は主に、パノラマ幾何学と健全な物体構造との相互作用を見越しながら、投影歪みを補正することに焦点を当てている。
SphereSODは、パノラマ幾何学と進化する塩分構造を結合したERPネイティブフレームワークである。
論文 参考訳(メタデータ) (2026-09-07T14:47:54Z) - HeRO: Hierarchical 3D Semantic Representation for Pose-aware Object Manipulation [54.325346533275074]
HeROは、階層的意味論を通して幾何学と意味論を結合する拡散ベースのポリシーである。
様々なテストにおいて、HeROは新しい最先端技術を確立し、Place Dual Shoesの成功率を12.3%改善し、6つの挑戦的なポーズ対応タスクで平均6.5%向上した。
論文 参考訳(メタデータ) (2026-02-21T12:29:10Z) - EDM: Equirectangular Projection-Oriented Dense Kernelized Feature Matching [49.15373858190824]
等角射影指向カーネル化特徴マッチング (EDM) と呼ばれる,最初の学習に基づく密マッチングアルゴリズムを導入する。
提案手法は,Matterport3DおよびStanford2D3Dデータセット上でのAUC@5degにおける+26.72と+42.62の改善により,顕著な性能向上を実現する。
論文 参考訳(メタデータ) (2025-02-28T03:37:01Z) - GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction [70.65250036489128]
3Dのセマンティック占有予測は,周囲のシーンの3Dの微細な形状とセマンティックスを得ることを目的としている。
本稿では,3Dシーンを3Dセマンティック・ガウシアンで表現するオブジェクト中心表現を提案する。
GaussianFormerは17.8%から24.8%のメモリ消費しか持たない最先端のメソッドで同等のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-05-27T17:59:51Z) - 3D Scene Geometry Estimation from 360$^\circ$ Imagery: A Survey [1.3654846342364308]
本稿では,先駆的かつ最先端の3次元シーン形状推定手法に関する包括的調査を行う。
まず、球面カメラモデルの基本概念を再考し、最も一般的な取得技術と表現形式についてレビューする。
次に、単色レイアウトと深度推論のアプローチを調査し、球面データに適した学習ベースソリューションの最近の進歩を強調した。
論文 参考訳(メタデータ) (2024-01-17T14:57:27Z) - Camera-based 3D Semantic Scene Completion with Sparse Guidance Network [18.415854443539786]
本稿では,SGNと呼ばれるカメラベースのセマンティックシーン補完フレームワークを提案する。
SGNは空間幾何学的手がかりに基づいてセマンティック・アウェア・シード・ボクセルからシーン全体へのセマンティクスの伝播を行う。
実験の結果,既存の最先端手法よりもSGNの方が優れていることが示された。
論文 参考訳(メタデータ) (2023-12-10T04:17:27Z) - Geometrically-driven Aggregation for Zero-shot 3D Point Cloud Understanding [11.416392706435415]
ゼロショット3Dポイントクラウド理解は2Dビジョンランゲージモデル(VLM)によって達成できる
既存の戦略は、ヴィジュアル・ランゲージ・モデル(Vision-Language Model)をレンダリングまたはキャプチャされた2Dピクセルから3Dポイントにマッピングし、固有かつ表現可能な雲の幾何学構造を見渡す。
本稿では, 点雲の3次元幾何学的構造を利用して, 移動したビジョン・ランゲージモデルの品質を向上させるための, 初となるトレーニングフリーアグリゲーション手法を提案する。
論文 参考訳(メタデータ) (2023-12-04T12:30:07Z) - Sphere2Vec: A General-Purpose Location Representation Learning over a
Spherical Surface for Large-Scale Geospatial Predictions [73.60788465154572]
現在の2Dおよび3D位置エンコーダはユークリッド空間における点距離をモデル化するために設計されている。
本研究では,球面上の点座標を符号化する場合に,球面距離を保存できるSphere2Vecというマルチスケール位置エンコーダを提案する。
論文 参考訳(メタデータ) (2023-06-30T12:55:02Z) - PolarMOT: How Far Can Geometric Relations Take Us in 3D Multi-Object
Tracking? [62.997667081978825]
グラフのノードとして3D検出を符号化し、グラフエッジ上の局所極座標を用いてオブジェクト間の空間的および時間的対関係を符号化する。
これにより、グラフニューラルネットワークは、時間的および空間的相互作用を効果的に符号化することができる。
我々はnuScenesデータセット上に新しい最先端のデータセットを構築し、さらに重要なことに、私たちの手法であるPolarMOTが、異なる場所にわたって驚くほどよく一般化されていることを示す。
論文 参考訳(メタデータ) (2022-08-03T10:06:56Z) - Concentric Spherical GNN for 3D Representation Learning [53.45704095146161]
同心球面特徴写像を学習するための新しい多解畳み込みアーキテクチャを提案する。
当社の階層的アーキテクチャは、球内情報と球間情報の両方を組み込むための代替学習に基づいています。
回転データを用いた3次元分類作業における最先端性能向上へのアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2021-03-18T19:05:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。