論文の概要: 3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2605.26500v1
- Date: Tue, 26 May 2026 03:25:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.602428
- Title: 3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
- Title(参考訳): 視覚言語ナビゲーションのためのオープンセットセマンティックグルーピングを用いた3次元ガウスマップ
- Authors: Jianzhe Gao, Rui Liu, Wenguan Wang,
- Abstract要約: 視覚言語ナビゲーション(VLN)は、自然言語命令に基づいて複雑な3D環境を横断するエージェントを必要とする。
この研究は、環境を微分可能な3次元ガウス写像の集合として表す3次元ガウス写像を提案する。
Egocentric Scene Mapは、疎い擬似ライダー点雲から3Dガウシアンを初期化することによって、オンラインで構築されている。
- 参考スコア(独自算出の注目度): 48.641376758484505
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language navigation (VLN) requires an agent to traverse complex 3D environments based on natural language instructions, necessitating a thorough scene understanding. While existing works equip agents with various scene representations to enhance spatial awareness, they often neglect the complex 3D geometry and rich semantics in VLN scenarios, limiting the ability to generalize across diverse and unseen environments. To address these challenges, this work proposes a 3D Gaussian Map that represents the environment as a set of differentiable 3D Gaussians and accordingly develops a navigation strategy for VLN. Specifically, Egocentric Scene Map is constructed online by initializing 3D Gaussians from sparse pseudo-lidar point clouds, providing informative geometric priors for scene understanding. Each Gaussian primitive is further enriched through Open-Set Semantic Grouping operation, which groups 3D Gaussians based on their membership in object instances or stuff categories within the open world, resulting in a unified 3D Gaussian Map. Building on this map, Multi-Level Action Prediction strategy, which combines spatial-semantic cues at multiple granularities, is designed to assist agents in decision-making. Extensive experiments conducted on three public benchmarks (i.e., R2R, R4R, and REVERIE) validate the effectiveness of our method.
- Abstract(参考訳): 視覚言語ナビゲーション(VLN)は、自然言語の指示に基づいて複雑な3D環境を横断するエージェントを必要とする。
既存の作業は、空間的認識を高めるために様々なシーン表現を持つエージェントを装備するが、VLNシナリオにおける複雑な3D幾何学とリッチセマンティクスを無視し、多様な、目に見えない環境にまたがる一般化の能力を制限することがしばしばある。
これらの課題に対処するため、本研究では、環境を微分可能な3Dガウスアンの集合として表現し、VLNのナビゲーション戦略を開発する3Dガウスマップを提案する。
具体的には、Egocentric Scene Mapは、3D Gaussianをスパースな擬ライダー点雲から初期化し、シーン理解のための情報的幾何学的事前情報を提供することによって、オンラインで構築される。
それぞれのガウス原始は、オープンセットのセマンティック・グルーピング(英語版)(Open-Set Semantic Grouping)によってさらに豊かになる。
このマップ上に構築されたマルチレベル行動予測戦略は,複数の粒度の空間意味的手がかりを組み合わせ,エージェントによる意思決定を支援する。
3つの公開ベンチマーク(R2R,R4R,REVERIE)で実施した大規模な実験により,本手法の有効性が検証された。
関連論文リスト
- Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning [33.03611808441931]
本稿では,3つのキーデザインを導入したマルチスケールガウス・ランゲージマップ(GLMap)を提案する。
3Dガウスアンは、タスク関連画像のコンパクトストレージと高速レンダリングを可能にする。
ObjectNav、InstNav、SQAタスクの実験は、GLMapがターゲットナビゲーションとコンテキスト推論を効果的に強化していることを示している。
論文 参考訳(メタデータ) (2026-05-03T06:22:14Z) - ODG: Occupancy Prediction Using Dual Gaussians [38.9869091446875]
活動予測は周囲環境のカメラ画像から微細な3次元形状と意味を推定する。
既存の方法は、シーン表現として高密度グリッドを採用するか、単一のスパースクエリを使用してシーン全体を学習する。
複雑なシーンダイナミクスを効果的に捉えるために,階層的な二重スパースガウス表現であるODGを提案する。
論文 参考訳(メタデータ) (2025-06-11T06:03:03Z) - OVGaussian: Generalizable 3D Gaussian Segmentation with Open Vocabularies [112.80292725951921]
textbfOVGaussianは3D textbfGaussian表現に基づいた、一般化可能なtextbfOpen-textbfVocabulary 3Dセマンティックセマンティックセグメンテーションフレームワークである。
まず,3DGSをベースとした大規模3Dシーンデータセット(textbfSegGaussian)を構築し,ガウス点とマルチビュー画像の両方に対して詳細なセマンティックおよびインスタンスアノテーションを提供する。
シーン間のセマンティック・一般化を促進するために,ジェネリック・セマンティック・ラスタライゼーション(GSR)を導入する。
論文 参考訳(メタデータ) (2024-12-31T07:55:35Z) - GOI: Find 3D Gaussians of Interest with an Optimizable Open-vocabulary Semantic-space Hyperplane [53.388937705785025]
3Dオープンボキャブラリのシーン理解は、拡張現実とロボット応用の推進に不可欠である。
GOIは2次元視覚言語基礎モデルから3次元ガウススプラッティング(3DGS)に意味的特徴を統合するフレームワークである。
提案手法では,特徴空間内の超平面分割として特徴選択処理を扱い,クエリに関連性の高い特徴のみを保持する。
論文 参考訳(メタデータ) (2024-05-27T18:57:18Z) - GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction [70.65250036489128]
3Dのセマンティック占有予測は,周囲のシーンの3Dの微細な形状とセマンティックスを得ることを目的としている。
本稿では,3Dシーンを3Dセマンティック・ガウシアンで表現するオブジェクト中心表現を提案する。
GaussianFormerは17.8%から24.8%のメモリ消費しか持たない最先端のメソッドで同等のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-05-27T17:59:51Z) - Semantic Gaussians: Open-Vocabulary Scene Understanding with 3D Gaussian Splatting [27.974762304763694]
セマンティック・ガウシアン(Semantic Gaussians)は,3次元ガウシアン・スプレイティングをベースとした,新しいオープン語彙シーン理解手法である。
既存の手法とは異なり、様々な2次元意味的特徴を3次元ガウスの新たな意味的構成要素にマッピングする多目的投影手法を設計する。
我々は,高速な推論のために,生の3Dガウスから意味成分を直接予測する3Dセマンティックネットワークを構築した。
論文 参考訳(メタデータ) (2024-03-22T21:28:19Z) - Volumetric Environment Representation for Vision-Language Navigation [66.04379819772764]
視覚言語ナビゲーション(VLN)は、視覚的な観察と自然言語の指示に基づいて、エージェントが3D環境をナビゲートする必要がある。
本研究では,物理世界を3次元構造細胞にボクセル化するボリューム環境表現(VER)を提案する。
VERは3D占有率、3D部屋レイアウト、および3Dバウンディングボックスを共同で予測する。
論文 参考訳(メタデータ) (2024-03-21T06:14:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。