論文の概要: Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images
- arxiv url: http://arxiv.org/abs/2607.01633v1
- Date: Thu, 02 Jul 2026 03:00:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.64512
- Title: Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images
- Title(参考訳): 非ポーズ画像からの包括的開語彙シーン理解のための3次元ガウス図と意味操作
- Authors: Hu Zhu, Bohan Li, Xianda Guo, Yanlun Peng, Zheng Zhu, Xin Jin, Wenjun Zeng, Chang Wen Chen,
- Abstract要約: COVSceneはポーズレスセマンティックガウスフレームワークで、レンダリング可能なプリミティブと密接なセマンティック占有フィールドを結合する。
我々は、COVSceneは、競争力のあるレンダリング品質を維持し、オープン語彙のセグメンテーションを改善し、自己教師付きベースラインよりも強力なセマンティック占有率予測を実現することを示す。
- 参考スコア(独自算出の注目度): 62.31892851760248
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Comprehensive 3D scene understanding from sparse, unposed images requires a model to recover renderable geometry, open-vocabulary semantics, and free/occupied 3D space without relying on external camera calibration. Recent feed-forward Gaussian methods improve pose-free reconstruction and semantic rendering, but their Gaussian primitives are mainly optimized through image-space objectives and remain weakly constrained in unobserved regions. We propose \textit{COVScene}, a pose-free semantic Gaussian framework that couples renderable Gaussian primitives with a dense semantic occupancy field through differentiable volumetric lifting. Instead of converting Gaussians to voxels only at evaluation time, COVScene lifts the predicted semantic Gaussians inside the training computation graph, so volumetric regularization provides gradients to Gaussian opacity, geometry, and semantic features. The framework combines a semantic-aware Geometry Transformer, multi-task Gaussian decoding, geometric foundation distillation, and occupancy entropy regularization to support novel view synthesis, open-vocabulary semantic querying, and semantic occupancy prediction within a single representation. Experiments on ScanNet and ScanNet++ show that COVScene maintains competitive rendering quality, improves open-vocabulary segmentation, and achieves stronger semantic occupancy prediction than the self-supervised baseline without direct voxel-level supervision.
- Abstract(参考訳): スパース・アンポーズ画像からの総合的な3Dシーン理解には、外部カメラキャリブレーションに頼ることなく、レンダリング可能な幾何学、オープンボキャブラリセマンティクス、自由かつ占有された3D空間を復元するモデルが必要である。
最近のフィードフォワードガウス法はポーズフリーの再構成とセマンティックレンダリングを改善するが、ガウスのプリミティブは主に画像空間の目的によって最適化され、観測されていない領域では弱い制約が保たれている。
本稿では,表現可能なガウス的プリミティブと高密度なセマンティック占有領域を結合したポーズフリーなガウス的フレームワークである「textit{COVScene}」を提案する。
ガウスを評価時にのみボクセルに変換する代わりに、COVSceneはトレーニング計算グラフ内の予測されたセマンティックガウスを解除するので、ボリューム正規化はガウスの不透明度、幾何学、セマンティック特徴への勾配を提供する。
このフレームワークは、セマンティック・アウェアな幾何学変換器、マルチタスクガウス復号、幾何学的基礎蒸留、および占有エントロピー正規化を組み合わせて、新しいビュー合成、オープン語彙のセマンティッククエリ、単一の表現におけるセマンティック占有予測をサポートする。
ScanNetとScanNet++の実験では、COVSceneは競争力のあるレンダリング品質を維持し、オープン語彙のセグメンテーションを改善し、直接のボクセルレベルの監督なしに自己管理ベースラインよりも強力なセマンティック占有予測を実現する。
関連論文リスト
- OpenGaFF: Open-Vocabulary Gaussian Feature Field with Codebook Attention [80.51557267896938]
オープンな3Dシーン理解のための新しいフレームワークであるOpenGaFFについて述べる。
我々の手法の中核はガウス的特徴場であり、ガウス幾何学と外見の連続関数として意味論をモデル化する。
オブジェクトレベルのセマンティック一貫性をさらに強化するために、共有セマンティックプリミティブのセットとして機能する構造化コードブックを導入する。
論文 参考訳(メタデータ) (2026-05-07T12:10:07Z) - Free-Range Gaussians: Non-Grid-Aligned Generative 3D Gaussian Reconstruction [72.85652875805387]
フリーランジガウス(Free-Range Gaussians)は、4つの画像から非画素、非ボクセル対応の3Dガウスを推定する多視点再構成法である。
再構成の生成的定式化により,非グリッド型3次元データによるモデル管理が可能となった。
論文 参考訳(メタデータ) (2026-04-06T17:24:18Z) - UniSem: Generalizable Semantic 3D Reconstruction from Sparse Unposed Images [10.080087958100552]
2つのキーコンポーネントによる深度精度とセマンティックな一般化を改善する統合フレームワークUniSemを提案する。
Error-aware Gaussian Dropout (EGD) は冗長性のあるGaussianを抑えることでエラー誘導容量制御を行う。
第2に、2Dセグメンタリフトセマンティクスと、モデル独自の創発的な3DセマンティクスをブレンドするMix-training Curriculum(MTC)を導入する。
論文 参考訳(メタデータ) (2026-03-18T09:26:25Z) - Joint Semantic and Rendering Enhancements in 3D Gaussian Modeling with Anisotropic Local Encoding [86.55824709875598]
本稿では,セマンティックとレンダリングの両方を相乗化する3次元セマンティックガウスモデリングのための統合拡張フレームワークを提案する。
従来の点雲形状符号化とは異なり、細粒度3次元形状を捉えるために異方性3次元ガウシアン・チェビシェフ記述子を導入する。
我々は、学習した形状パターンを継続的に更新するために、クロスシーンの知識伝達モジュールを使用し、より高速な収束と堅牢な表現を可能にします。
論文 参考訳(メタデータ) (2026-01-05T18:33:50Z) - OGGSplat: Open Gaussian Growing for Generalizable Reconstruction with Expanded Field-of-View [74.58230239274123]
一般化可能な3次元再構成において視野を拡大するオープンガウス成長法であるOGGSplatを提案する。
我々の重要な洞察は、オープンガウスのセマンティックな属性が、画像外挿の強い先行性を提供するということである。
OGGSplatはまた、スマートフォンカメラから直接撮影される2つのビューイメージを備えた場合、有望なセマンティック・アウェア・シーン再構築機能を示す。
論文 参考訳(メタデータ) (2025-06-05T16:17:18Z) - MCGS: Multiview Consistency Enhancement for Sparse-View 3D Gaussian Radiance Fields [100.90743697473232]
3Dガウシアンによって表現される放射場は、高いトレーニング効率と高速レンダリングの両方を提供する、新しいビューの合成に優れている。
既存の手法では、高密度推定ネットワークからの奥行き先を組み込むことが多いが、入力画像に固有の多視点一貫性を見落としている。
スパースビューからのシーン再構成が可能な3次元ガウススプラッティングに基づくビュー合成フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-15T08:39:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。