論文の概要: GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning
- arxiv url: http://arxiv.org/abs/2603.19137v1
- Date: Thu, 19 Mar 2026 16:55:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.280001
- Title: GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning
- Title(参考訳): GSMem:Zero-Shot Embodied Exploration and Reasoningにおける空間記憶としての3次元ガウススプラッティング
- Authors: Yiren Lu, Yi Du, Disheng Liu, Yunlai Zhou, Chen Wang, Yu Yin,
- Abstract要約: GSMemは3Dガウススプラッティング(3DGS)上に構築されたゼロショット型探査・推論フレームワーク
連続幾何と密接な外観を明示的にパラメータ化することにより、3DGSは持続的な空間記憶として機能し、エージェントにtextitSpatial Recollection を付与する。
本稿では,VLMによるセマンティックスコアリングと3DGSに基づくカバレッジ目標を組み合わせ,タスク認識探索と幾何学的カバレッジのバランスをとるハイブリッド探索戦略を提案する。
- 参考スコア(独自算出の注目度): 9.203056739430865
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Effective embodied exploration requires agents to accumulate and retain spatial knowledge over time. However, existing scene representations, such as discrete scene graphs or static view-based snapshots, lack \textit{post-hoc re-observability}. If an initial observation misses a target, the resulting memory omission is often irrecoverable. To bridge this gap, we propose \textbf{GSMem}, a zero-shot embodied exploration and reasoning framework built upon 3D Gaussian Splatting (3DGS). By explicitly parameterizing continuous geometry and dense appearance, 3DGS serves as a persistent spatial memory that endows the agent with \textit{Spatial Recollection}: the ability to render photorealistic novel views from optimal, previously unoccupied viewpoints. To operationalize this, GSMem employs a retrieval mechanism that simultaneously leverages parallel object-level scene graphs and semantic-level language fields. This complementary design robustly localizes target regions, enabling the agent to ``hallucinate'' optimal views for high-fidelity Vision-Language Model (VLM) reasoning. Furthermore, we introduce a hybrid exploration strategy that combines VLM-driven semantic scoring with a 3DGS-based coverage objective, balancing task-aware exploration with geometric coverage. Extensive experiments on embodied question answering and lifelong navigation demonstrate the robustness and effectiveness of our framework
- Abstract(参考訳): 効果的な具体的探索では、エージェントは時間とともに空間的な知識を蓄積し保持する必要がある。
しかし、離散的なシーングラフや静的ビューベースのスナップショットのような既存のシーン表現には、 \textit{post-hoc re-observability}が欠けている。
初期観測が目標を外れた場合、結果として生じるメモリの欠落はしばしば発見できない。
このギャップを埋めるために、3Dガウススプラッティング(3DGS)上に構築されたゼロショットな探索・推論フレームワークである \textbf{GSMem} を提案する。
連続幾何学と密接な外観を明示的にパラメータ化することにより、3DGSは、エージェントに \textit{Spatial Recollection} を付与する永続的な空間記憶として機能する。
これを運用するために、GSMemは並列オブジェクトレベルのシーングラフとセマンティックレベルの言語フィールドを同時に活用する検索メカニズムを採用している。
この相補的な設計は、ターゲット領域をしっかりとローカライズし、エージェントは高忠実度ビジョン・ランゲージ・モデル(VLM)推論のための 'hallucinate' の最適なビューを作成できる。
さらに,VLMによるセマンティックスコアリングと3DGSに基づくカバレッジ目標を組み合わせ,タスク認識探索と幾何学的カバレッジのバランスをとるハイブリッド探索戦略を導入する。
具体的質問応答と生涯ナビゲーションに関する広範囲にわたる実験は、我々の枠組みの堅牢性と有効性を示している
関連論文リスト
- Sparse View Distractor-Free Gaussian Splatting [31.812029183156245]
3D Gaussian Splatting (3DGS) は静的環境における効率的なトレーニングと高速な新しいビューを実現する。
そこで本稿では,よりリッチな事前情報を組み込むことにより,スパースビュー条件下でのイントラクタフリーな3DGSを実現するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-02T08:32:32Z) - 3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting [12.057873540714098]
3DGSNavは、3D Gaussian Splatting (3DGS)を視覚言語モデル(VLM)の永続メモリとして組み込んで空間推論を強化する新しいフレームワークである。
3DGSNavは環境の3DGS表現を段階的に構築し、フロンティア対応のファーストパーソンビューの軌跡誘導自由視点レンダリングを可能にする。
ナビゲーション中、リアルタイムオブジェクト検出器が潜在的なターゲットをフィルタリングし、VLM駆動のアクティブな視点スイッチングがターゲットを再検証する。
論文 参考訳(メタデータ) (2026-02-12T16:41:26Z) - ObjectGS: Object-aware Scene Reconstruction and Scene Understanding via Gaussian Splatting [54.92763171355442]
ObjectGSは3Dシーンをセマンティックな理解と統合するオブジェクト認識フレームワークである。
我々はObjectGSがオープンボキャブラリやパン光学のセグメンテーションタスクにおいて最先端の手法より優れていることを示す実験を通して示す。
論文 参考訳(メタデータ) (2025-07-21T10:06:23Z) - 3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning [65.40458559619303]
エンボディエージェントのための新しい3Dシーンメモリフレームワークである3D-Memを提案する。
3D-Memは、シーンを表現するために、Memory Snapshotsと呼ばれる情報的なマルチビューイメージを使用している。
さらに、Frontier Snapshots-glimpsの未探索領域対応エージェントを導入して、情報的な意思決定を行うことによって、フロンティアベースの探索をさらに統合する。
論文 参考訳(メタデータ) (2024-11-23T09:57:43Z) - HUGS: Holistic Urban 3D Scene Understanding via Gaussian Splatting [53.6394928681237]
RGB画像に基づく都市景観の全体的理解は、難しいが重要な問題である。
我々の主な考え方は、静的な3Dガウスと動的なガウスの組合せを用いた幾何学、外観、意味論、運動の合同最適化である。
提案手法は,2次元および3次元のセマンティック情報を高精度に生成し,新たな視点をリアルタイムに描画する機能を提供する。
論文 参考訳(メタデータ) (2024-03-19T13:39:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。