論文の概要: SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation
- arxiv url: http://arxiv.org/abs/2607.14586v1
- Date: Thu, 16 Jul 2026 05:32:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.001686
- Title: SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation
- Title(参考訳): SoftNav:3DシーンのトケインをVLMに注入して身体的ナビゲーション
- Authors: Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li,
- Abstract要約: 現在のアプローチでは、3Dシーン情報をテキストで視覚言語モデル(VLM)に送信している。
軽量プロジェクタによるソフトトークンとして,VLMの隠れた空間にエンティティレベルの3次元連続表現を注入するSoftNavを紹介する。
HM3D-OVONでは、SoftNavは3つの分割で74.2%/68.3%/66.7%のSRを達成した。
- 参考スコア(独自算出の注目度): 11.531613012959959
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In goal-directed embodied navigation, where an agent must locate a specified target in an unseen environment, 3D scene understanding and navigation reasoning must work in concert. Current approaches transmit 3D scene information to vision-language models (VLMs) through text, suggesting a representation gap in our tested configurations; a controlled ablation confirms that direct embedding-level transfer significantly outperforms the evaluated text serialization formats. We introduce SoftNav, which injects entity-level 3D continuous representations -- one token per detected object or frontier -- into a VLM's hidden space as soft tokens through a lightweight projector. With the 3D encoder and VLM frozen, only ~1,200 samples and ~17M trainable parameters are needed. On HM3D-OVON, SoftNav achieves 74.2%/68.3%/66.7% SR across three splits, surpassing all prior methods in both SR and SPL; the same navigation policy transfers zero-shot to GOAT-Bench (67.2% SR), SG3D (47.2% s-SR), and real-world robot deployment without retraining or architectural modification. Injecting 3D scene tokens directly into VLMs bridges the representation gap, enabling transferable navigation with minimal training.
- Abstract(参考訳): 目標指向の具体化ナビゲーションでは、エージェントは見えない環境で特定のターゲットを見つける必要があるが、3Dシーンの理解とナビゲーション推論は協調して動作しなければならない。
現在のアプローチでは、3Dシーン情報をテキストを通して視覚言語モデル(VLM)に送信し、テストされた構成の表現ギャップを示唆している。
我々は、VLMの隠れた空間に、軽量プロジェクタを通じて、エンティティレベルの3D連続表現(検出対象またはフロンティア毎に1トークン)をソフトトークンとして注入するSoftNavを紹介します。
3DエンコーダとVLMを凍結させると、1,200サンプルと17Mのトレーニング可能なパラメータしか必要なくなる。
HM3D-OVONでは、SoftNavは3つの分割で74.2%/68.3%/66.7%のSRを達成し、SRとSPLの両方の以前の手法を全て上回っている。
3DシーントークンをVLMに直接注入すると、表現ギャップがブリッジされ、最小限のトレーニングで移動可能なナビゲーションが可能になる。
関連論文リスト
- OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms [33.40889181799252]
言語誘導型エンボディナビゲーションでは、エージェントがオブジェクト参照命令を解釈し、複数の部屋を探索し、参照されたターゲットをローカライズし、それに対する信頼できる動きを実行する必要がある。
OmniVLNは、全方位3次元知覚とトークン効率の高い階層的推論を、空中と地上の両方で組み合わせたゼロショット視覚言語ナビゲーションフレームワークである。
実験により、提案した階層インタフェースは空間参照精度を77.27%から93.18%に改善し、マルチルームの乱雑な設定で累積的なプロンプトトークンを61.7%削減し、フラットで最大11.68%のナビゲーション成功率向上を実現した。
論文 参考訳(メタデータ) (2026-03-18T04:26:30Z) - 3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting [12.057873540714098]
3DGSNavは、3D Gaussian Splatting (3DGS)を視覚言語モデル(VLM)の永続メモリとして組み込んで空間推論を強化する新しいフレームワークである。
3DGSNavは環境の3DGS表現を段階的に構築し、フロンティア対応のファーストパーソンビューの軌跡誘導自由視点レンダリングを可能にする。
ナビゲーション中、リアルタイムオブジェクト検出器が潜在的なターゲットをフィルタリングし、VLM駆動のアクティブな視点スイッチングがターゲットを再検証する。
論文 参考訳(メタデータ) (2026-02-12T16:41:26Z) - View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs [19.27758108925572]
3Dビジュアルグラウンドは、言語記述から3Dシーン内のオブジェクトを識別する。
既存のゼロショットアプローチでは、3次元空間情報(SI)をVLM処理に変換することで2次元視覚言語モデル(VLM)を利用する。
本稿では,新たなVLM x SIパラダイムを提案する。このパラダイムは3D SIを外部化することで,VLMが推論時に必要なもののみを段階的に取り出すことを可能にする。
論文 参考訳(メタデータ) (2025-12-10T00:59:17Z) - SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding [40.60812160987424]
3Dビジュアルグラウンド(3DVG)は、自然言語による3Dシーンのオブジェクトのローカライズを目的としている。
対象物推論のための空間情報を備えた多視点実写シーン画像を利用する新しいゼロショット3DVGフレームワークであるSeqVLMを提案する。
ScanRefer と Nr3D のベンチマーク実験では、従来のゼロショット法を4.0%、Nr3D で5.2%上回った。
論文 参考訳(メタデータ) (2025-08-28T13:15:37Z) - NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLM [55.79954652783797]
VLN(Vision-and-Language Navigation)は、エージェントを具現化するための重要なスキルであり、自然言語の指示に従って3D環境をナビゲートすることができる。
従来の方法では、トラジェクトリ動画をステップバイステップでデータ拡張の指示に変換するが、そのような指示はユーザの通信スタイルとうまく一致しない。
本稿では,VLNのユーザ要求命令を生成する検索拡張生成フレームワークであるNavRAGを提案する。
論文 参考訳(メタデータ) (2025-02-16T14:17:36Z) - VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding [57.04804711488706]
3Dビジュアルグラウンドティングはロボットにとって不可欠であり、自然言語と3Dシーン理解を統合する必要がある。
VLM-Grounderは視覚言語モデル(VLM)を用いて2次元画像のみに基づくゼロショット3次元視覚グラウンドティングを行う新しいフレームワークである。
論文 参考訳(メタデータ) (2024-10-17T17:59:55Z) - SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation [83.4599149936183]
既存のゼロショットオブジェクトナビゲーション手法は、空間的に閉じたオブジェクトのテキストでLCMをプロンプトする。
本稿では,3次元シーングラフを用いて観察されたシーンを表現することを提案する。
我々は,MP3D,HM3D,RoboTHOR環境において,SG-Navが従来のゼロショット法を10%以上のSRで上回る大規模な実験を行った。
論文 参考訳(メタデータ) (2024-10-10T17:57:19Z) - Learning from Unlabeled 3D Environments for Vision-and-Language
Navigation [87.03299519917019]
視覚言語ナビゲーション(VLN)では、自然言語の指示に従って現実的な3D環境をナビゲートするために、具体的エージェントが必要である。
我々はHM3Dから900の未ラベルの3Dビルディングから大規模VLNデータセットを自動生成することを提案する。
実験により, HM3D-AutoVLNはVLNモデルの一般化能力を著しく向上させることを示した。
論文 参考訳(メタデータ) (2022-08-24T21:50:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。