論文の概要: LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
- arxiv url: http://arxiv.org/abs/2608.30935v2
- Date: Wed, 09 Sep 2026 04:40:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.794261
- Title: LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
- Title(参考訳): LightNav-0:一般身体ナビゲーションのためのVLM空間知能の排除
- Authors: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan,
- Abstract要約: エージェントは異質な目標や視覚的な観察をタスク、環境、ロボットの体現物に翻訳する必要がある。
ここでは,タスク固有の予測ヘッドを使わずに,予め訓練されたVLMの空間的知性を取り入れた,コンパクトな一般化型ナビゲーションモデルLightNav-0を提案する。
- 参考スコア(独自算出の注目度): 52.91080323083409
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied navigation requires agents to translate heterogeneous goals and visual observations into actions across tasks, environments, and robot embodiments. Modern vision-language models (VLMs) already encode spatial priors for visual grounding, spatial reasoning, and pointing, but these capabilities are rarely elicited directly for robot control. Existing navigation systems instead rely on task- or embodiment-specific components, fragmenting perception, reasoning, and action while offering limited generalization. Here we present LightNav-0, a compact generalist embodied navigation model that elicits the spatial intelligence of a pretrained VLM and aligns it with navigation, without task-specific prediction heads. LightNav-0 represents diverse navigation tasks through a unified token interface: dual-channel pointing expresses task-, scene-, and embodiment-agnostic spatial intent, while a residual vector-quantized action tokenizer maps this intent to precise, embodiment-specific trajectories. Together with temporally aware visual history compression, ER mid-training, supervised fine-tuning, and reinforcement learning, this formulation supports instruction following, open-vocabulary object navigation, and visual tracking within a single model. The navigation training corpus spans 2K+ scenes and 4K+ hours of embodied navigation data. LightNav-ER, the embodied-reasoning checkpoint used to initialize LightNav-0, attains the highest complete-set average across 8 embodied-reasoning benchmarks, while LightNav-0 achieves state-of-the-art monocular success rates across all 10 public navigation simulation settings. Real-world evaluations further demonstrate zero-shot generalization across robot embodiments, diverse scenes, and static and dynamic targets. These results establish compact VLMs as a unified and transferable backbone for generalist embodied navigation.
- Abstract(参考訳): エージェントは異質な目標や視覚的な観察をタスク、環境、ロボットの体現物に翻訳する必要がある。
現代の視覚言語モデル(VLM)は、すでに視覚的接地、空間的推論、ポインティングの空間的先行を符号化しているが、ロボットの制御に直接適用されることは滅多にない。
既存のナビゲーションシステムは代わりにタスクやエンボディメント固有のコンポーネント、断片化知覚、推論、アクションに依存し、限定的な一般化を提供する。
ここでは,タスク固有の予測ヘッドを使わずに,予め訓練されたVLMの空間的知性を取り入れた,コンパクトな一般化型ナビゲーションモデルLightNav-0を提案する。
デュアルチャネルポインティングはタスク、シーン、およびエンボディメントに依存しない空間的意図を表し、残留ベクトル量子化アクショントークン化器は、この意図を正確なエンボディメント固有の軌道にマッピングする。
時間的に認識された視覚履歴圧縮、ERミッドトレーニング、教師付き微調整、強化学習とともに、この定式化は単一のモデル内での指示追従、オープン語彙オブジェクトナビゲーション、視覚追跡をサポートする。
ナビゲーショントレーニングコーパスは、2K以上のシーンと4K以上のナビゲーションデータにまたがる。
LightNav-ERは、LightNav-0を初期化するために使用されるエボダイドレゾニングチェックポイントで、8つのエボダイドレゾニングベンチマークで最高の完全セット平均を達成する一方、LightNav-0は10の公開ナビゲーションシミュレーション設定すべてで最先端のモノラルな成功率を達成する。
実世界の評価はさらに、ロボットの実施形態、多様なシーン、静的および動的ターゲットをまたいだゼロショットの一般化を実証している。
これらの結果は、汎用的なナビゲーションのための統一的で転送可能なバックボーンとして、コンパクトなVLMを確立する。
関連論文リスト
- Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System [96.69286664036143]
Qwen-RobotNavは、Qwen-RobotNav上に構築されたスケーラブルなナビゲーションモデルである。
156万のサンプルでQwen-RobotNavをトレーニングします。
Qwen-RobotNavは、主要なナビゲーションベンチマークにまたがって、最先端の結果を新たに設定する。
論文 参考訳(メタデータ) (2026-06-16T16:17:44Z) - AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness [5.851139427049915]
連続環境(VLN-CE)におけるゼロショット視覚言語ナビゲーションは,近年,大規模視覚言語モデル(VLM)で実現可能になった。
本稿では,ゼロショットVLN-CEを,VLMと環境とのエージェントインタフェースとして再考する。
我々は、アクション、深さ、メモリを呼び出し可能なツールとして公開する軽量なナビゲーションハーネスであるAgenticNavを紹介します。
論文 参考訳(メタデータ) (2026-06-09T08:43:05Z) - OpenFrontier: General Navigation with Visual-Language Grounded Frontiers [54.661157616245966]
オープンワールドナビゲーションでは、複雑な日常環境においてロボットが意思決定を行う必要がある。
近年の視覚-言語ナビゲーション(VLN)と視覚-言語-アクション(VLA)モデルは、自然言語で条件付けられたエンドツーエンドのポリシーを実現する。
多様な視覚をシームレスに統合するトレーニングフリーナビゲーションフレームワークであるOpenFrontierを提案する。
論文 参考訳(メタデータ) (2026-03-05T17:02:22Z) - AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild [62.47761809929869]
視覚言語ナビゲーション(VLN)は、視覚的観察とともに言語指示を解釈することで、知的エージェントが環境をナビゲートする必要がある。
無人航空機(UAV)の現在のVLN研究は、所定のルートに沿ってUAVを誘導するための詳細な指示に依存している。
本稿では,自律型UAVナビゲーションのためのエンド・ツー・エンドのビジョン・ランゲージ・アクションモデルであるAutoFlyを提案する。
論文 参考訳(メタデータ) (2026-02-10T11:08:07Z) - GOAT-Bench: A Benchmark for Multi-Modal Lifelong Navigation [65.71524410114797]
GOAT-BenchはユニバーサルナビゲーションタスクGO to AnyThing(GOAT)のベンチマークである。
GOATでは、エージェントはカテゴリ名、言語記述、イメージによって指定されたターゲットのシーケンスにナビゲートするように指示される。
我々はGOATタスク上でモノリシックなRLおよびモジュラーメソッドをベンチマークし、その性能をモダリティにわたって分析する。
論文 参考訳(メタデータ) (2024-04-09T20:40:00Z) - NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large
Language Models [17.495162643127003]
我々は,複雑なエンボディシーンにおけるGPTモデルの推論能力を明らかにするために,NavGPTを導入した。
NavGPTは、視覚的な観察、ナビゲーション履歴、将来の探索可能な方向のテキスト記述を入力として、エージェントの現在の状態を推論する。
本研究では,NavGPTが経路に沿った観察や行動から高品質なナビゲーション命令を生成可能であることを示す。
論文 参考訳(メタデータ) (2023-05-26T14:41:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。