論文の概要: Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.01754v1
- Date: Thu, 02 Jul 2026 06:11:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.693973
- Title: Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation
- Title(参考訳): 視覚・言語ナビゲーションにおける意味探索のためのパスレベルハイビジョンインストラクション
- Authors: Sung June Kim, Sangpil Kim, Honglak Lee,
- Abstract要約: Phi-Navは、後見推論を利用してエージェントの実際の探索旅行と指示を整合させる統合型オン政治フレームワークである。
Phi-Navは、政治的方法に固有の重要な意味的監督のギャップを埋め、意味的にラベルのない動きを密集した訓練信号に変換する。
- 参考スコア(独自算出の注目度): 49.96273402030084
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy exploration is a crucial component for training robust Vision-Language Navigation agents, as it exposes the policy to a broader state distribution. However, such exploration inevitably leads to trajectories that deviate from expert demonstrations, resulting in a semantic mismatch between the executed visual stream and the original language instruction. In this work, we address this challenge by introducing Phi-Nav, a unified on-policy framework that leverages hindsight reasoning to align instructions with the agent's actual exploratory journey. Specifically, Phi-Nav operates through a three-stage dual-supervision cycle: 1) the agent performs oracle-guided on-policy exploration, sampling a trajectory while learning from expert action feedback, 2) a hindsight speaker synthesizes a path-level hindsight instruction grounded in the collected visual observations, and 3) the agent conducts a second imitation pass, treating the synthesized trajectory-instruction pair as an additional expert demonstration. Through this process, Phi-Nav bridges the critical semantic supervision gap inherent in on-policy methods, transforming semantically unlabeled movement into dense training signals. Evaluations on the R2R-CE and RxR-CE benchmarks show that Phi-Nav yields competitive performance while requiring only a fraction of the expert demonstrations used by current baselines. These results underscore the necessity of semantic exploration in VLN, positioning Phi-Nav as an effective solution for training embodied agents with limited data.
- Abstract(参考訳): オンライン調査は、より広範な状態分布にポリシーを公開するため、堅牢なビジョンランゲージナビゲーションエージェントを訓練するための重要なコンポーネントである。
しかし、このような探索は必然的に専門家によるデモンストレーションから逸脱する軌道につながり、実行されたビジュアルストリームと元の言語命令とのセマンティックなミスマッチをもたらす。
本研究は, エージェントの実際の探索行動に照準を合わせるために, 後見推論を活用する統合型オン政治フレームワークであるPhi-Navを導入することで, この課題に対処する。
具体的には、Phi-Navは3段階の二重スーパービジョンサイクルを通している。
1) エージェントは、専門家の行動フィードバックから学びながら、軌道をサンプリングし、オラクル誘導型法探査を行う。
2 後視話者は、収集された視覚観察に基礎を置いたパスレベル後視指示を合成し、
3) 薬剤は第二の模倣パスを実行し、合成された軌道指示対を付加的な専門家のデモンストレーションとして扱う。
このプロセスを通じて、Phi-Navは、オン政治法に固有の重要な意味的監督のギャップを埋め、意味的にラベルのない動きを密集した訓練信号に変換する。
R2R-CEとRxR-CEのベンチマークによる評価は、Phi-Navが競争性能を得る一方で、現在のベースラインで使われる専門家のデモのごく一部しか必要としないことを示している。
これらの結果はVLNにおける意味探索の必要性を浮き彫りにして、Phi-Navを限られたデータでエンボディエージェントを訓練するための効果的なソリューションとして位置づけた。
関連論文リスト
- Towards Deviation-Robust Agent Navigation via Perturbation-Aware
Contrastive Learning [125.61772424068903]
視覚言語ナビゲーション(VLN)は、エージェントに与えられた言語命令に従って実際の3D環境をナビゲートするように要求する。
本稿では,既存のVLNエージェントの一般化能力を高めるために,PROPER(Progressive Perturbation-aware Contrastive Learning)と呼ばれるモデルに依存しない学習パラダイムを提案する。
論文 参考訳(メタデータ) (2024-03-09T02:34:13Z) - Contrastive Instruction-Trajectory Learning for Vision-Language
Navigation [66.16980504844233]
視覚言語ナビゲーション(VLN)タスクでは、エージェントが自然言語の指示でターゲットに到達する必要がある。
先行研究は、命令-軌道対間の類似点と相違点を識別できず、サブ命令の時間的連続性を無視する。
本稿では、類似したデータサンプル間の分散と、異なるデータサンプル間の分散を探索し、ロバストなナビゲーションのための独特な表現を学習するContrastive Instruction-Trajectory Learningフレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-08T06:32:52Z) - Language-guided Navigation via Cross-Modal Grounding and Alternate
Adversarial Learning [66.9937776799536]
新たなビジョン・アンド・ランゲージナビゲーション(VLN)問題は、見えない写真リアリスティック環境において、エージェントがターゲットの場所に向かうことを学習することを目的としている。
VLNの主な課題は、主に2つの側面から生じている: まず、エージェントは動的に変化する視覚環境に対応する言語命令の有意義な段落に出席する必要がある。
そこで本稿では,エージェントにテキストと視覚の対応性を追跡する機能を持たせるために,クロスモーダルグラウンドモジュールを提案する。
論文 参考訳(メタデータ) (2020-11-22T09:13:46Z) - Active Visual Information Gathering for Vision-Language Navigation [115.40768457718325]
視覚言語ナビゲーション(VLN)は、エージェントがフォトリアリスティックな環境の中でナビゲーションの指示を行うためのタスクである。
VLNの重要な課題の1つは、曖昧な指示による不確実性を緩和し、環境の観察を不十分にすることで、堅牢なナビゲーションを行う方法である。
この研究は、人間のナビゲーション行動からインスピレーションを得て、よりインテリジェントなVLNポリシーのためのアクティブな情報収集能力を持つエージェントを提供する。
論文 参考訳(メタデータ) (2020-07-15T23:54:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。