論文の概要: Goal-oriented Navigation Instruction Generation with Tour Video Priors
- arxiv url: http://arxiv.org/abs/2608.08596v1
- Date: Sun, 09 Aug 2026 09:21:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.878412
- Title: Goal-oriented Navigation Instruction Generation with Tour Video Priors
- Title(参考訳): ツアービデオによるゴール指向ナビゲーションインストラクション生成
- Abstract要約: ナビゲーション命令生成(NIG)は、ナビゲーションガイダンスのためのステップバイステップの自然言語命令を生成することを目的としている。
我々は,エゴ中心のツアービデオからナビゲーション命令を生成する,ゴール指向のビデオグラウンドNIGタスクであるVideoNIGを紹介する。
本稿では,学習を基本動作知覚と長距離ナビゲーション推論に分解する2段階のカリキュラム学習フレームワークを提案する。
- 参考スコア(独自算出の注目度): 3.3906611506156916
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Navigation Instruction Generation (NIG) aims to produce step-by-step natural language instructions for navigation guidance. Existing studies primarily treat NIG as an auxiliary task for vision-andlanguage navigation (VLN), focusing on data augmentation or multi-task learning. However, generating navigation instructions from compact environmental priors requires meticulous spatial reasoning, especially when the target route does not simply follow the demonstrated tour, and remains challenging for current multimodal models. In this work, we introduce VideoNIG, a goal-oriented video-grounded NIG task that generates navigation instructions from ego-centric tour videos, an initial observation, and a textual or visual goal, without relying on intermediate representations such as graphs and maps. We instantiate VideoNIG in a controlled simulator benchmark with 60K tour videos across continuous indoor environments and 37K multimodal prompts with progressive difficulty levels. We further introduce a diagnostic evaluation protocol that combines text similarity, choice-based spatial consistency tests, and downstream navigation execution. To address this task, we propose a two-stage Curriculum Learning framework that decomposes the learning into foundational motion perception and long-horizon navigation reasoning. Specifically, we first employ Action Warmup for spatial action-view alignment, followed by Complexity Progression using trajectories with increasing exploratory difficulty. Extensive experiments show that existing MLLMs struggle with VideoNIG, while our approach significantly improves instruction quality across complementary diagnostic metrics. Finally, integrating VideoNIG-generated instructions with a VLN agent demonstrates the executability of this task formulation for end-to-end navigation.
- Abstract(参考訳): ナビゲーション命令生成(NIG)は、ナビゲーションガイダンスのためのステップバイステップの自然言語命令を生成することを目的としている。
既存の研究は主に、NIGを視覚言語ナビゲーション(VLN)の補助的タスクとして扱い、データ拡張やマルチタスク学習に重点を置いている。
しかし、特に対象経路が単にツアーに従わない場合、特に現在のマルチモーダルモデルでは依然として困難である場合、コンパクトな環境先行からナビゲーション指示を生成するには、微妙な空間的推論が必要である。
本研究では,エゴ中心のツアービデオや初期観察,テキストや視覚的目標からナビゲーション命令を生成する,ゴール指向のNIGタスクであるVideoNIGを紹介する。
我々は,連続屋内環境における60Kツアービデオと,進行難易度の高い37Kマルチモーダルプロンプトを用いた制御されたシミュレータで,VideoNIGをインスタンス化する。
さらに、テキスト類似性、選択に基づく空間整合性テスト、下流ナビゲーション実行を組み合わせた診断評価プロトコルを導入する。
そこで本研究では,学習を基本動作知覚と長距離ナビゲーション推論に分解する2段階のカリキュラム学習フレームワークを提案する。
具体的には、まず、空間的アクション・ビューアライメントにAction Warmupを使用し、続いて、探索困難度が増大する軌跡を用いた複雑化プログレッシションを施行した。
大規模な実験により,既存のMLLMは VideoNIG と競合するが,本手法は相補的な診断指標間で指導品質を著しく向上させる。
最後に、VLNエージェントとVideoNIG生成命令を統合することで、エンドツーエンドナビゲーションのためのタスク定式化の実行可能性を示す。
関連論文リスト
- ABot-N1: Toward a General Visual Language Navigation Foundation Model [27.085429358326504]
ABot-N1は、一般的なVisual Language Navigation基盤モデルへのステップである。
スロービジョン言語推論器は、画素ゴールを生成しながら明示的なChain-of-Thought推論を行う。
新しいベンチマークは、都市規模のナビゲーションの分野を前進させるためにオープンソースとしてリリースされている。
論文 参考訳(メタデータ) (2026-07-11T16:21:03Z) - AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation [78.80536515102305]
VLN(Vision-and-Language Navigation)は、エージェントが視覚環境内の自身の動きに言語命令を接地する必要がある。
本稿では,ナビゲーションモデルに自己認識推論機構を備えた新しいフレームワークであるAwareVLNを提案する。
提案手法は,(1)空間的およびタスク指向の自己認識を促進する構造的推論モジュール,(2)効果的な学習のための進歩分担付き自動データエンジンの2つの重要な革新を特徴とする。
論文 参考訳(メタデータ) (2026-05-21T17:58:26Z) - LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation [96.09246387639006]
LookasideVLNは、より正確な空間推論とより高い計算効率を達成するために、自然言語の方向の手がかりを利用する。
LookasideVLNは、シングルレベルのルックアヘッドでも、最先端のCityNavAgentよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-04-19T01:36:53Z) - AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild [62.47761809929869]
視覚言語ナビゲーション(VLN)は、視覚的観察とともに言語指示を解釈することで、知的エージェントが環境をナビゲートする必要がある。
無人航空機(UAV)の現在のVLN研究は、所定のルートに沿ってUAVを誘導するための詳細な指示に依存している。
本稿では,自律型UAVナビゲーションのためのエンド・ツー・エンドのビジョン・ランゲージ・アクションモデルであるAutoFlyを提案する。
論文 参考訳(メタデータ) (2026-02-10T11:08:07Z) - VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory [43.2995099083993]
VLAモデルは、認識と計画を統合することで、航法を具現化する有望な可能性を示してきた。
既存のVLAモデルは、観察から行動へのリアクティブマッピングに直接依存している。
VLingNav(VLAモデル)を提案する。
論文 参考訳(メタデータ) (2026-01-13T15:43:43Z) - Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments [19.818370526976974]
VLN-CE(Vision Language Navigation in Continuous Environments)は、AIのフロンティアである。
本稿では,VLN-CEタスクに適した大規模言語モデル(LLM)に基づく生成エージェントであるCog-GAを紹介する。
Cog-GAは、人間のような認知過程をエミュレートするための二重戦略を採用している。
論文 参考訳(メタデータ) (2024-09-04T08:30:03Z) - Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs [95.8010627763483]
モビリティVLAは、環境理解と長文VLMの常識推論能力を組み合わせた、階層的なビジョン・ランゲージ・アクション(VLA)ナビゲーションポリシーである。
従来未解決であったマルチモーダル命令に対して,モビリティVLAはエンドツーエンドの成功率が高いことを示す。
論文 参考訳(メタデータ) (2024-07-10T15:49:07Z) - OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation [96.46961207887722]
OVER-NAVは、現在のIVLN技術を超えることを目指している。
解釈されたナビゲーションデータを完全に活用するために、構造化された表現、コード化されたOmnigraphを導入する。
論文 参考訳(メタデータ) (2024-03-26T02:34:48Z) - NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation [23.72290930234063]
NaVidは、ヴィジュアル・アンド・ランゲージナビゲーションのためのビデオベースの大型視覚言語モデル(VLM)である。
NaVidはシミュレーション環境と現実世界で最先端のパフォーマンスを実現し、優れたクロスデータセットとSim2Real転送を実現している。
論文 参考訳(メタデータ) (2024-02-24T16:39:16Z) - $A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting
Vision-and-Language Ability of Foundation Models [89.64729024399634]
本研究では,ゼロショット視覚言語ナビゲーション(ZS-VLN)の課題について検討する。
通常、命令は複雑な文法構造を持ち、しばしば様々な行動記述を含む。
これらのアクション要求を正しく理解し実行する方法は重要な問題であり、アノテーション付きデータがないため、さらに困難になる。
論文 参考訳(メタデータ) (2023-08-15T19:01:19Z) - Learning Vision-and-Language Navigation from YouTube Videos [89.1919348607439]
視覚言語ナビゲーション(VLN)は、自然言語命令を用いて現実的な3D環境をナビゲートするために、具体化されたエージェントを必要とする。
YouTubeには大量のハウスツアービデオがあり、豊富なナビゲーション体験とレイアウト情報を提供している。
住宅ツアービデオから合理的な経路指示ペアとエージェントを事前訓練した大規模データセットを作成する。
論文 参考訳(メタデータ) (2023-07-22T05:26:50Z) - NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large
Language Models [17.495162643127003]
我々は,複雑なエンボディシーンにおけるGPTモデルの推論能力を明らかにするために,NavGPTを導入した。
NavGPTは、視覚的な観察、ナビゲーション履歴、将来の探索可能な方向のテキスト記述を入力として、エージェントの現在の状態を推論する。
本研究では,NavGPTが経路に沿った観察や行動から高品質なナビゲーション命令を生成可能であることを示す。
論文 参考訳(メタデータ) (2023-05-26T14:41:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。