論文の概要: Geospatial-Prior Guidance for 3D Semantic Scene Completion
- arxiv url: http://arxiv.org/abs/2608.03618v1
- Date: Tue, 04 Aug 2026 13:08:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.199097
- Title: Geospatial-Prior Guidance for 3D Semantic Scene Completion
- Title(参考訳): 3次元セマンティックシーンコンプリートのための地理空間的誘導
- Authors: Meng Wang, Shougao Zhang, Wenzhe He, Ruihui Li, Nan Hu, Zhuo Tang, Kenli Li,
- Abstract要約: GeoSceneは、衛星画像と構造化されたOpenStreetMap cuesを3Dセマンティックシーンの完成のためのソフトな先行手段として併用するフレームワークである。
GeoSceneは、船上観測と地理空間誘導のための相補的なボクセルの信頼性ウェイトを学習し、観測された領域と観測されていない領域の特徴改善を制御するためにそれらを利用する。
- 参考スコア(独自算出の注目度): 38.43604650752214
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Inferring complete 3D geometry and semantics from onboard images remains challenging because occlusions and restricted fields of view leave large scene regions underconstrained. Although satellite imagery provides wide-area context, appearance cues alone offer limited structural guidance and may be unreliable because of spatial or temporal discrepancies. We present GeoScene, a geospatially guided framework that jointly uses satellite imagery and structured OpenStreetMap cues as soft priors for 3D semantic scene completion. GeoScene learns complementary voxel-wise reliability weights for onboard observations and geospatial guidance, and uses them to control feature refinement in observed and unobserved regions. This design preserves local visual evidence while exploiting large-scale road and building structure beyond onboard visibility. Experiments on SemanticKITTI and SSCBench-KITTI-360 demonstrate that GeoScene consistently improves both geometric and semantic completion under the geospatial-prior-assisted setting, with the most pronounced benefits for large-scale static and geospatially structured classes.
- Abstract(参考訳): 画像から完全な3次元幾何と意味を推測することは、オクルージョンや制限された視野が、大きなシーン領域を制約しないままにしておくため、依然として困難である。
衛星画像は広い範囲の文脈を提供するが、外観の手がかりだけでは構造的なガイダンスが限られており、空間的あるいは時間的差異のために信頼性が低い可能性がある。
衛星画像と構造化されたOpenStreetMap cues を3Dセマンティックシーン補完のためのソフトな先駆体として併用した地表面ガイドフレームワークであるGeoSceneを提案する。
GeoSceneは、船上観測と地理空間誘導のための相補的なボクセルの信頼性ウェイトを学習し、観測された領域と観測されていない領域の特徴改善を制御するためにそれらを利用する。
この設計は、大規模な道路と建物構造を車載視界を超えて活用しながら、局所的な視覚的証拠を保存している。
SemanticKITTI と SSCBench-KITTI-360 の実験により、GeoScene は地理空間的事前支援設定の下で幾何的および意味的完備化を一貫して改善し、大規模で静的かつ地理的に構造化されたクラスにとって最も顕著な利点であることを示した。
関連論文リスト
- GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding [45.67186918674009]
GeoAnchorは、3次元空間関係のためのインターリーブテキストラテント推論フレームワークである。
3次元空間情報を3つの相補的な構成要素に分解する: 物体の接地位置潜時、リレーショナル配向方向潜時、シーン構造における幾何潜時である。
多様な複雑な3D推論タスクの実験により、GeoAnchorは、その有効性と一般化能力を検証して、技術の状態より優れていることが示された。
論文 参考訳(メタデータ) (2026-07-15T05:27:37Z) - TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive [19.699267665705715]
TerraDiT-$は、任意のネイティブプリミティブから直接衛星画像を生成する統合空間制御フレームワークである。
生成モデルは驚くべき進歩を遂げているが、衛星画像に適用することは依然として困難である。
論文 参考訳(メタデータ) (2026-06-30T01:56:41Z) - From Extrinsic to Intrinsic: Geodesic-Guided Representation Learning for 3D Geometric Data [56.41479248637621]
我々は,textbfPreトレーニングのための新しい3D表現学習パラダイムであるtextbfPRISMを紹介した。
PRISMは textbfIntrinsic textbfSurface geodesic textbfMetric を検索して埋め込みを学習する。
提案手法は測地線距離予測において, 良好な精度, 堅牢性, 高効率性を示す。
論文 参考訳(メタデータ) (2026-06-01T13:54:26Z) - Geo$^\textbf{2}$: Geometry-Guided Cross-view Geo-Localization and Image Synthesis [12.868037364314953]
クロスビュー地理空間学習は、クロスビュージオローカライゼーション(CVGL)とクロスビュー画像合成(CVIS)の2つの重要なタスクからなる。
論文 参考訳(メタデータ) (2026-03-26T18:36:09Z) - Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning [72.13218601075958]
textbfWanderBenchは,具体的シナリオにおける行動可能な位置情報推論のための,最初のオープンアクセスグローバルジオロケーションベンチマークである。
我々は,下線Action of UnderlineThoughを用いた下線Geolocationフレームワークである textbfGeoAoT (Action of Thought) を提案する。
19個の大規模マルチモーダルモデルによる実験により、GeoAoTは動的環境におけるより優れた微細な局所化とより強力な一般化を実現することが示された。
論文 参考訳(メタデータ) (2026-03-11T06:24:10Z) - Wrivinder: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery [28.971555127858334]
Wrivinderは、複数の地上写真を集め、衛星画像に合わせるためのフレームワークである。
また、多視点地上画像とジオ登録された衛星タイルを様々な屋外環境に接続するキュレートデータセットMC-Satもリリースした。
ゼロショット実験では、Wrivinderは密度と大面積の両方のシーンで30m未満の位置決め精度を達成している。
論文 参考訳(メタデータ) (2026-02-16T17:06:54Z) - GeoDistill: Geometry-Guided Self-Distillation for Weakly Supervised Cross-View Localization [70.65458151146767]
クロスビューのローカライゼーションは、自律ナビゲーションや拡張現実のような大規模な屋外アプリケーションにとって不可欠である。
既存の手法は、しばしば完全に教師付き学習に依存している。
本研究では,FoV(Field-of-View)ベースのマスキングを用いた教師学習フレームワークGeoDistillを提案する。
論文 参考訳(メタデータ) (2025-07-15T03:00:15Z) - Camera-based 3D Semantic Scene Completion with Sparse Guidance Network [18.415854443539786]
本稿では,SGNと呼ばれるカメラベースのセマンティックシーン補完フレームワークを提案する。
SGNは空間幾何学的手がかりに基づいてセマンティック・アウェア・シード・ボクセルからシーン全体へのセマンティクスの伝播を行う。
実験の結果,既存の最先端手法よりもSGNの方が優れていることが示された。
論文 参考訳(メタデータ) (2023-12-10T04:17:27Z) - Accurate 3-DoF Camera Geo-Localization via Ground-to-Satellite Image
Matching [102.39635336450262]
地上で取得したクエリ画像とジオタグ付き衛星画像の大規模データベースとをマッチングすることにより、地上から衛星画像のジオローカライズの問題に対処する。
我々の新しい手法は、衛星画像のピクセルサイズの精度まで、クエリー画像のきめ細かい位置を達成できる。
論文 参考訳(メタデータ) (2022-03-26T20:10:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。