論文の概要: VerNav: Verifier-First Low-Latency Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2609.00920v1
- Date: Tue, 01 Sep 2026 08:45:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.485187
- Title: VerNav: Verifier-First Low-Latency Vision-and-Language Navigation
- Title(参考訳): VerNav: Verifier-First Low-Latency Vision-and-Language Navigation
- Authors: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang,
- Abstract要約: VLN(Vision-and-Language Navigation)は、エージェントが自然の遅延指示に従って見えない3D環境をナビゲートする必要がある。
我々は低言語LLMベースのVLNのための検証ファーストフレームワークであるVerNavを提案する。
- 参考スコア(独自算出の注目度): 7.190348268664948
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-and-Language Navigation (VLN) requires an agent to navigate through unseen 3D environments according to natural-language instructions. Explicit reasoning can improve instruction understanding and semantic grounding, but autoregressive generation at every step accumulates large decision-stage latency over multi-step navigation. We propose VerNav, a verifier-first framework for low-latency LLM-based VLN. The verifier reduces decision-stage latency by replacing per-step autoregressive generation with batched action verification, while an entropy-based adaptive generator is invoked only for uncertain decisions to produce compact state evidence. To further improve navigation performance with the verifier, we introduce a two-stage alignment scheme: (i) VPO improves local action-preference alignment in static verifier training, and (ii) step-level reinforcement fine-tuning provides dense progress rewards over multi-step navigation rollouts during dynamic task execution. Experiments on the Room-to-Room (R2R) benchmark show that the verifier-only decision path of VerNav achieves competitive navigation performance among representative LLM-based VLN agents while reducing average decision-stage LLM latency per step by more than $10\times$ compared with autoregressive methods.
- Abstract(参考訳): VLN(Vision-and-Language Navigation)は、エージェントが自然言語の指示に従って見えない3D環境をナビゲートする必要がある。
明示的推論は、命令理解とセマンティックグラウンドを改善することができるが、各ステップでの自己回帰生成は、マルチステップナビゲーションよりも大きな意思決定ステージ遅延を蓄積する。
本稿では,低遅延LLMベースのVLNのための検証ファーストフレームワークであるVerNavを提案する。
検証器は、ステップごとの自己回帰生成をバッチ化された動作検証に置き換えることにより、決定段階のレイテンシを低減する一方、エントロピーベースの適応生成器は、不確実な決定のためにのみ呼び出されて、コンパクトな状態証拠を生成する。
検証器によるナビゲーション性能の向上を目的として,2段階アライメント方式を提案する。
(i)VPOは静的検証器訓練における局所的な行動参照アライメントを改善し、
ステップレベルの強化微調整は、動的タスク実行中の複数ステップのナビゲーションロールアウトに対して、深い進捗報酬を与える。
Room-to-Room (R2R) ベンチマークの実験から,VerNav の検証専用決定パスは,各ステップ毎の平均決定ステージ遅延を,自動回帰法と比較して10ドル以上削減しつつ,代表 LLM ベースの VLN エージェント間の競合ナビゲーション性能を実現することが示された。
関連論文リスト
- CLOSER-VLN: Closed-Loop Self-Verified Retrieval-Augmented Reasoning for Aerial Vision-Language Navigation [10.221757123615786]
視覚言語ナビゲーション(VLN)は、タスク固有のナビゲーションポリシーをトレーニングすることなく、エージェントが見えない環境で自然言語の指示に従うことができる、大規模な言語モデルとマルチモーダルモデルで最近進歩した。
既存のVLNメソッドの多くは、命令や観察から候補アクションが生成されるが、実行前に検証や修正されることは滅多にない、オープンループ決定実行アプローチに依存している。
コンクリート施工前にクローズループ方式で行動推論,信頼性検証,ターゲット検索,行動補正を逐次行う訓練自由度法であるCLOSERを提案する。
論文 参考訳(メタデータ) (2026-06-24T05:57:42Z) - Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation [15.242490558864626]
VLN(Vision-and-Language Navigation)は、エージェントが自然言語の指示に従い、これまで見えなかった環境をナビゲートする必要がある。
本稿では,基礎となる言語モデルの変更や微調整を行うことなく,VLNを改善するための検索拡張フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T17:00:11Z) - SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization [32.785475974900244]
既存のVision-Language Navigation (VLN)エージェントは、しばしば認識エラー、推論エラー、計画エラーに悩まされる。
これらの制限に対処するため、SeeNav-Agentという新しいVLNエージェントフレームワークが提案されている。
Step Reward Group Policy Optimization (SRGPO) は、VLNエージェントのポストトレーニング用に設計されている。
論文 参考訳(メタデータ) (2025-12-02T10:40:46Z) - DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation [73.80968452950854]
Vision-Language Navigation in Continuous Environments (VLN-CE) は、エージェントが自由形式の3D空間を通して自然言語の指示に従う必要がある。
既存のVLN-CEアプローチは通常、2段階のウェイポイント計画フレームワークを使用する。
本稿では,エンドツーエンド最適化VLN-CEポリシとしてDAgger Diffusion Navigation (DifNav)を提案する。
論文 参考訳(メタデータ) (2025-08-13T02:51:43Z) - EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning [145.32076310071434]
EvolveNavは,適応的かつ一般化可能なナビゲーション推論を実現するための,新しい具体的推論パラダイムである。
EvolveNav は,(1) 形式化された CoT 監督ファインチューニング,(2) モデルが自己富化 CoT ラベルとして独自の推論出力で反復的に訓練され,監督の多様性を高めるために,モデルのナビゲーション推論能力を最初に活性化し,同時に推論速度を向上させるための形式化された CoT ラベルを用いてモデルを訓練する。
論文 参考訳(メタデータ) (2025-06-02T11:28:32Z) - NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning [97.88246428240872]
Embodied AIの重要な研究課題であるVision-and-Language Navigation (VLN)は、自然言語の指示に従って複雑な3D環境をナビゲートするために、エンボディエージェントを必要とする。
近年の研究では、ナビゲーションの推論精度と解釈可能性を改善することにより、VLNにおける大きな言語モデル(LLM)の有望な能力を強調している。
本稿では,自己誘導型ナビゲーション決定を実現するために,パラメータ効率の高いドメイン内トレーニングを実現する,Navigational Chain-of-Thought (NavCoT) という新しい戦略を提案する。
論文 参考訳(メタデータ) (2024-03-12T07:27:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。