論文の概要: GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors
- arxiv url: http://arxiv.org/abs/2607.13481v1
- Date: Wed, 15 Jul 2026 06:21:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.670786
- Title: GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors
- Title(参考訳): GPOcc++:ビジュアルジオメトリによる統一スパースガウス占有予測
- Abstract要約: 我々はGPOccを導入し、視覚幾何学の先駆者を占領に意識したスパースガウス表現に変換する。
GPOcc上に構築されているGPOcc++は、統合されたフレームワーク内でのマルチビュー観測と時間シーケンスをモデル化する。
室内および屋外のベンチマークの実験は、多視点および時間的設定の両方で一貫して強い性能を示す。
- 参考スコア(独自算出の注目度): 70.03915250336668
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurate 3D scene understanding is fundamental to embodied intelligence and autonomous driving, where 3D occupancy provides a unified representation of objects, structures, and free space. However, recovering such a complete volumetric representation from visual observations remains challenging, particularly in occluded and unobserved regions. Visual geometry priors offer strong and generalizable geometric cues for addressing this challenge, but their outputs are inherently surface-centric, whereas occupancy prediction requires reasoning about volumetric interiors and free space. To bridge this gap, we introduce GPOcc, which transforms visual geometry priors into occupancy-aware sparse Gaussian representations for efficient and expressive volumetric scene modeling. Building on GPOcc, GPOcc++ models multi-view observations and temporal sequences within a unified framework, allowing spatial and temporal evidence to be handled through the same representation. We further extend GPOcc++ from indoor scenes to outdoor occupancy prediction. Extensive experiments on both indoor and outdoor benchmarks demonstrate consistently strong performance across both multi-view and temporal settings, together with favorable efficiency and generalization. Code will be released at https://github.com/JuIvyy/GPOcc.
- Abstract(参考訳): 正確な3Dシーン理解は、インテリジェンスと自律運転の具体化の基礎であり、3Dの占有がオブジェクト、構造、自由空間の統一的な表現を提供する。
しかし、このような完全な容積表現を視覚的観察から回復することは、特に閉鎖された領域や観測されていない領域では、依然として困難である。
視覚幾何学の先駆者は、この課題に対処するために強力で一般化可能な幾何学的手がかりを提供するが、その出力は本質的に表面中心であるのに対して、占有率の予測には体積内積と自由空間の推論が必要である。
このギャップを埋めるために、GPOccを導入し、視覚幾何学の先行概念を占領性を考慮したスパースガウス表現に変換し、効率よく表現力のあるボリュームシーンモデリングを行う。
GPOccをベースとしたGPOcc++は、統合されたフレームワーク内のマルチビュー観測と時間シーケンスをモデル化し、空間的および時間的エビデンスを同じ表現で扱うことができる。
さらにGPOcc++を屋内シーンから屋外占有予測まで拡張する。
室内および屋外のベンチマークにおける広範囲な実験は、多視点および時間的設定の両方において、良好な効率と一般化とともに、一貫して強い性能を示す。
コードはhttps://github.com/JuIvyy/GPOcc.comでリリースされる。
関連論文リスト
- VGOcc: Learning Visual-Geometric Gaussians for Vision-Centric 3D Driving Occupancy Prediction [13.991187977226302]
視覚のみの占有予測では、キャリブレーションされたサラウンドビュー画像からセマンティックな3D占有領域を復元する必要がある。
本稿では,ガウスモデルの基礎モデルから視覚的および幾何学的手がかりを学習するVGOccを提案する。
nuScenesの実験は、VGOccが視覚のみの3D占有率予測において最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2026-07-20T15:46:30Z) - G$^2$TAM: Geometry Grounded Track Anything Model [49.05553245076823]
本稿では,RGB画像やビデオのみを用いて,3次元のインスタンス追跡を高速化するための統一的なフレームワークを提案する。
G$2$TAMは空間的に整列した幾何学的表現を暗黙記憶として使用し、安定したインスタンス識別とフレームとビュー間のローカライゼーションを保証する。
中心となるのは、視覚的およびテキスト的プロンプトを共有幾何学空間に統合し、エンドツーエンドの空間再構成とインスタンス一貫性マスク予測を可能にするクロスモーダル空間エンコーダである。
論文 参考訳(メタデータ) (2026-07-04T09:32:13Z) - Z-FLoc: Zero-Shot Floorplan Localization via Geometric Primitives [72.63181031215858]
そこで本研究では,ゼロショットフロアプランのローカライズ手法を提案する。
我々の重要な洞察は、支配的な幾何学的プリミティブが人間が作った環境でユビキタスであることである。
シミュレーションと実世界の両方のデータセットの実験により、我々のアプローチは、目に見えない環境における最先端の学習ベースの手法よりも優れています。
論文 参考訳(メタデータ) (2026-06-03T12:14:24Z) - GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation [75.85672467847631]
本稿では,3次元のコンパクトな特徴表現であるGeometry-Aware BEV (GA-BEV)を紹介する。
視覚的特徴を3次元空間に投影することで,RGB-D入力からBEV空間マップを構築する。
我々は,BEV空間に事前訓練された3Dファンデーションモデルの特徴を取り入れ,大規模3D再構築作業から学んだ構造的先行を注入する。
論文 参考訳(メタデータ) (2026-05-21T06:20:17Z) - OccAny: Generalized Unconstrained Urban 3D Occupancy [11.937212229169512]
オックアニー(OccAny)は、最初の非拘束型都市3D占有モデルである。
OccAnyは、シーケンシャル、モノクラー、サラウンドビューの画像から占有率を予測するために多用途である。
論文 参考訳(メタデータ) (2026-03-24T17:59:58Z) - Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding [50.098085774845195]
本稿では,大規模生成モデルにおいて暗黙の空間的先行性を活用することで,パラダイムシフトを提案する。
GeneEGA-3D (Video Extracted Generative Awareness) は,事前学習した映像拡散モデルを潜在世界シミュレータとして再利用するプラグイン・アンド・プレイ・フレームワークである。
論文 参考訳(メタデータ) (2026-03-19T17:59:58Z) - Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Prediction [10.394184895110007]
GPOccは、視覚的幾何学的先行情報を利用して、単眼での占有予測を行うフレームワークである。
Occ-ScanNet と EmbodiedOcc-ScanNet の実験は、大きな成功を収めた。
論文 参考訳(メタデータ) (2026-02-25T04:16:54Z) - COSMOS: Coherent Supergaussian Modeling with Spatial Priors for Sparse-View 3D Splatting [2.549594916296063]
3D Gaussian Splatting(3DGS)は,最近3D再構築の有望なアプローチとして登場した。
この問題に対処するために,Coherent Supergaussian Modeling with Spatial Priors (COSMOS)を提案する。
Blender と DTU に関する実験により,COSMOS は外部深度監視を伴わないスパースビュー設定において最先端の手法を超越していることが示された。
論文 参考訳(メタデータ) (2025-12-17T04:55:15Z) - ST-GS: Vision-Based 3D Semantic Occupancy Prediction with Spatial-Temporal Gaussian Splatting [21.87807066521776]
3次元占有予測は、視覚中心の自律運転における総合的なシーン理解に不可欠である。
近年, 計算オーバーヘッドを低減しつつ, 3次元意味ガウスモデルを用いて占有率をモデル化する研究が進められている。
本稿では,時空間モデリングと時空間モデリングの両立を図るため,新しい時空間ガウススティング(ST-GS)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-20T06:36:30Z) - QuadricFormer: Scene as Superquadrics for 3D Semantic Occupancy Prediction [49.75084732129701]
3D占有予測は、堅牢な自動運転システムにとって不可欠である。
既存の手法のほとんどは、密度の高いボクセルベースのシーン表現を使用している。
効率的な3次元占有予測のためのスーパークワッドリックモデルであるQuadricFormerを提案する。
論文 参考訳(メタデータ) (2025-06-12T17:59:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。