論文の概要: Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
- arxiv url: http://arxiv.org/abs/2608.17512v2
- Date: Thu, 27 Aug 2026 10:33:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.423317
- Title: Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
- Title(参考訳): Embodied-Navigator:効率的なナビゲーションのためのポイント、思考、記憶、アライン
- Abstract要約: 本稿では,効率的なエンボディナビゲーションのための統合フレームワークであるTAMP-Navを提案する。
まず、ナビゲーションを2次元の視覚座標に再構成するPixel-to-3D Action Formulation(Point)を導入する。
次に,Selective Reasoning and Anchor-Trajectory Memory Mechanism (Think and Memorize)を提案する。
- 参考スコア(独自算出の注目度): 68.02899606570223
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although Large Vision-Language Models (VLMs) have significantly advanced embodied navigation, their direct deployment remains challenging, as existing methods often force VLMs into unnatural action spaces that misalign with their 2D pre-training priors, compounded by rigid reasoning schedules and inefficient memory management. To overcome these limitations, we propose TAMP-Nav, a unified framework for efficient embodied navigation. First, we introduce a Pixel-to-3D Action Formulation (Point) that reformulates navigation into 2D visual prompting. Specifically, the VLM merely selects 2D pixels, which are then projected into 3D coordinates for a low-level SLAM controller. This design naturally aligns embodied execution with the VLM's inherent 2D visual capabilities. Second, we propose an integrated Selective Reasoning and Anchor-Trajectory Memory mechanism (Think and Memorize), which dynamically triggers Chain-of-Thought and retains high-fidelity memory only at critical nodes, compressing redundant trajectories into lightweight Space-Time Indicators, thereby preserving critical historical information and enhancing spatio-temporal perception. Finally, we design an efficient Two-Level Alignment Paradigm (Align) via Group Relative Policy Optimization (GRPO). By superimposing global outcome rewards with fine-grained process rewards, this dense supervision tightly aligns the agent's cognitive planning with physical environmental feedback, endowing the model with adaptive reasoning capabilities. Experiments demonstrate that TAMP-Nav achieves state-of-the-art performance (e.g., 66.2% SR on R2R-CE) with high runtime and sample efficiency (requiring only 90k training trajectories).
- Abstract(参考訳): 大型ビジョン・ランゲージ・モデル(VLM)は、かなり先進的なボディード・ナビゲーションを持つが、既存の手法では、VLMを2D事前学習に不適当な非自然なアクション空間に強制し、厳密な推論スケジュールと非効率なメモリ管理によって合成することが多いため、直接配置は困難である。
これらの制限を克服するために,効率的なエンボディナビゲーションのための統合フレームワークであるTAMP-Navを提案する。
まず、ナビゲーションを2次元視覚的プロンプトに変換するPixel-to-3D Action Formulation(Point)を導入する。
具体的には、VLMは単に2Dピクセルを選択し、低レベルのSLAMコントローラのために3D座標に投影する。
この設計は、自然にVLM固有の2次元視覚能力と具現化された実行を一致させる。
次に,Selective Reasoning and Anchor-Trajectory Memory Mechanism (Think and Memorize) を提案する。これはChain-of-Thoughtを動的にトリガし,臨界ノードのみに高忠実度メモリを保持し,冗長なトラジェクトリを軽量な時空間インジケータに圧縮することにより,重要な歴史的情報を保存し,時空間知覚を高める。
最後に,グループ相対政策最適化(GRPO)を用いて,効率的な2レベルアライメントパラダイム(Align)を設計する。
この厳密な監督は、グローバルな成果報酬をきめ細かなプロセス報酬で重ね合わせることで、エージェントの認知計画と物理的環境フィードバックを密に整合させ、適応的推論能力を持つモデルを与える。
実験により、TAMP-Navは高ランタイムとサンプル効率(90kのトレーニング軌道しか必要としない)で最先端の性能(例えばR2R-CEでは66.2%のSR)を達成することが示された。
関連論文リスト
- MB-Loc: Multi-planar Bird's-eye-view Localization in outdoor LiDAR scenes [2.3666547827177733]
我々は,グローバルLiDARローカライゼーションのための軽量かつ視点ロバストなSCRフレームワークMB-Locを提案する。
Z軸に沿って点雲をスライスし、符号付き深度を離散2次元平面にマッピングすることにより、MB-Locは標準2次元CNNの計算的トラクタビリティを活用しながら必須な3次元幾何学構造を保持する。
我々は、公開可能なNCLTデータセットに関する広範な実験を行い、提案手法が現在の最先端技術よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-06-07T17:25:06Z) - WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation [31.539730066120374]
視覚ナビゲーションは、複雑な幾何学的および物理的制約の下で滑らかで衝突のない軌道を生成する必要がある。
WAM-Navは,視覚ナビゲーションを具体化した潜在世界行動モデルであり,行動生成と潜時視予知を共同で学習する。
論文 参考訳(メタデータ) (2026-06-03T14:05:19Z) - Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN [6.626149978783011]
ゼロショットビジョン・アンド・ランゲージナビゲーション(VLN)は、データ収集コストの最小化と固有の一般化により、大きな注目を集めている。
現行の3D知覚モデルは、厳密な計算限界と、具体化されたナビゲーションによって要求されるリアルタイム効率と直接競合する、ピクセルレベルの精度を優先している。
本稿では,VLNの性能に及ぼす3次元シーン理解能力の影響を定量化する。
論文 参考訳(メタデータ) (2026-05-14T13:12:05Z) - ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation [35.416693138335354]
ゼロショットオブジェクトナビゲーションでは、エージェントは未知のターゲットオブジェクトを未知の環境で見つける必要がある。
視覚言語モデルの最近の進歩は、このタスクに有望な常識推論機能を提供する。
本稿では,パノラマ的セマンティック先行とエピソード記憶をシームレスに統合するReMemNavという新しい階層型ナビゲーションフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-25T09:07:32Z) - AgentVLN: Towards Agentic Vision-and-Language Navigation [78.739525400071]
VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
論文 参考訳(メタデータ) (2026-03-18T12:43:47Z) - 3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting [12.057873540714098]
3DGSNavは、3D Gaussian Splatting (3DGS)を視覚言語モデル(VLM)の永続メモリとして組み込んで空間推論を強化する新しいフレームワークである。
3DGSNavは環境の3DGS表現を段階的に構築し、フロンティア対応のファーストパーソンビューの軌跡誘導自由視点レンダリングを可能にする。
ナビゲーション中、リアルタイムオブジェクト検出器が潜在的なターゲットをフィルタリングし、VLM駆動のアクティブな視点スイッチングがターゲットを再検証する。
論文 参考訳(メタデータ) (2026-02-12T16:41:26Z) - Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving [48.512353531499286]
本稿では,視覚言語モデル(VLM)に2D/3Dシーン理解能力を暗黙的に統合した知覚強調世界認識行動モデルPercept-WAMを紹介する。
我々は,高密度物体知覚のためのグリッド条件付き予測機構を提案し,IoU対応スコアリングと並列自己回帰デコードを導入し,長距離・遠距離・小対象シナリオの安定性を向上させる。
実験により、パーセプションWAMは下流の知覚ベンチマークで古典的な検出器やセグメンタと一致し、2D検出とBEV 3D検出で51.7/58.9 mAPを達成した。
論文 参考訳(メタデータ) (2025-11-24T15:28:25Z) - STRIDER: Navigation via Instruction-Aligned Structural Decision Space Optimization [73.98141357780032]
VLN-CEタスクでは、エージェントはシーン固有のトレーニングなしで自然言語命令を使用して3D環境をナビゲートする必要がある。
既存の方法は、構造化された意思決定の欠如と、以前の行動からのフィードバックの不十分な統合のために、堅牢なナビゲーションを達成できないことが多い。
STRIDERは,空間配置先と動的タスクフィードバックを統合し,エージェントの決定空間を体系的に最適化する新しいフレームワークである。
提案手法では,1)空間構造を介して行動空間を制約する構造的ウェイポイントジェネレータ,2)タスクの進行に応じて行動を調整するタスク調整レギュレータ,そしてナビゲーション全体を通して意味的アライメントを確保する。
論文 参考訳(メタデータ) (2025-10-27T04:37:21Z) - SuperFlow++: Enhanced Spatiotemporal Consistency for Cross-Modal Data Pretraining [62.433137130087445]
SuperFlow++は、連続するカメラペアを使用して事前トレーニングと下流タスクを統合する新しいフレームワークである。
SuperFlow++は様々なタスクや運転条件で最先端のメソッドよりも優れています。
強力な一般化性と計算効率により、SuperFlow++は、自動運転におけるデータ効率の高いLiDARベースの認識のための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2025-03-25T17:59:57Z) - ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions [91.55655961014027]
シーン理解には3次元セマンティック占有とフロー予測が不可欠である。
本稿では,3つの改善点を目標とした視覚ベースのフレームワークを提案する。
我々の純粋な畳み込みアーキテクチャは、セマンティック占有率とジョイントセマンティックフロー予測の両方のために、複数のベンチマーク上で新しいSOTA性能を確立する。
論文 参考訳(メタデータ) (2024-11-12T11:32:56Z) - An Effective Motion-Centric Paradigm for 3D Single Object Tracking in
Point Clouds [50.19288542498838]
LiDARポイントクラウド(LiDAR SOT)における3Dシングルオブジェクトトラッキングは、自動運転において重要な役割を果たす。
現在のアプローチはすべて、外観マッチングに基づくシームズパラダイムに従っている。
我々は新たな視点からLiDAR SOTを扱うための動き中心のパラダイムを導入する。
論文 参考訳(メタデータ) (2023-03-21T17:28:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。