論文の概要: Talk2Escape: Conversational Grounding for Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2609.28296v1
- Date: Wed, 23 Sep 2026 15:41:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.099374
- Title: Talk2Escape: Conversational Grounding for Vision-and-Language Navigation
- Title(参考訳): Talk2Escape:視覚・言語ナビゲーションのための会話グラウンド
- Abstract要約: textitTalk2Escapeは,ナビゲーションをクローズドループ対話プロセスとして再構成する対話処理フレームワークである。
生のエゴセントリックな観察を簡潔で根拠のあるクエリに翻訳し、アルゴリズムの託宣やループ内の人間からのターゲットの修正フィードバックを求める。
経験的に、textitTalk2EscapeはR2R-CE上で66.0%の成功率を達成する。
- 参考スコア(独自算出の注目度): 22.81174149086155
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Vision-and-Language Navigation (VLN) has demonstrated remarkable success, the prevailing single-turn paradigm exposes a fundamental vulnerability: agents operate in a strictly open-loop manner. In practice, factors such as perceptual aliasing, sensor noise, and odometry drift can cause minor deviations to accumulate over time, often leading to catastrophic mission failures with no built-in mechanism for error recovery. To address this, we introduce \textit{Talk2Escape}, a proactive and model-agnostic dialogue intervention framework that reframes navigation as a closed-loop interactive process. At its core, a lightweight vision-language module continuously monitors agent kinematics. Upon detecting localized looping or severe trajectory divergence, it translates raw egocentric observations into concise, grounded queries to solicit targeted corrective feedback from either an algorithmic oracle or a human-in-the-loop. Extensive evaluations in high-fidelity simulators, including R2R-CE, RxR-CE, and VLNVerse, demonstrate that \textit{Talk2Escape} exhibits consistent improvements across diverse base agents. Empirically, \textit{Talk2Escape} achieves a 66.0\% Success Rate on R2R-CE, outperforming the current supervised and zero-shot state-of-the-art methods. We further validate its sim-to-real transfer on a Unitree Go2 quadruped, proving that proactive dialogue drastically improves navigation robustness in physical environments.
- Abstract(参考訳): Vision-and-Language Navigation (VLN) は目覚ましい成功を収めているが、一般的なシングルターンのパラダイムは、エージェントが厳密にオープンループで操作するという根本的な脆弱性を露呈している。
実際には、知覚エイリアス、センサーノイズ、およびドリフトなどの要因は、小さな偏差が時間の経過とともに蓄積され、しばしばエラー回復のための機構が組み込まれていない破滅的なミッション失敗を引き起こす。
そこで本稿では,ナビゲーションをクローズドループ対話プロセスとして再構成する,プロアクティブかつモデルに依存しない対話処理フレームワークである‘textit{Talk2Escape} を紹介する。
コアとなるのは、軽量な視覚言語モジュールで、エージェントキネマティクスを継続的に監視する。
局所的なループや重度の軌道分岐を検出すると、生のエゴセントリックな観察を簡潔で接地されたクエリに変換し、アルゴリズムのオラクルや人間のループからの目標とする修正フィードバックを要請する。
R2R-CE, RxR-CE, VLNVerseを含む高忠実度シミュレータの広範囲な評価は, \textit{Talk2Escape} が多様なベースエージェント間で一貫した改善を示すことを示した。
経験的に、‘textit{Talk2Escape} は R2R-CE 上で66.0 %の成功率を達成する。
さらに、Unitree Go2の4倍体上でのsim-to-real転送を検証し、プロアクティブ対話が物理環境におけるナビゲーションの堅牢性を大幅に改善することを証明する。
関連論文リスト
- Rethinking Embodied Navigation via Relational Inductive Bias [53.72276435022479]
本稿では,DB-Navを提案する。
標的中心の関係を活性化バイアスと抑制バイアスに分類する。
成功率(SR)と成功率(SPL)はパス長さ(SPL)が重み付けされているため、既存の方法よりも著しく優れています。
論文 参考訳(メタデータ) (2026-06-09T02:57:34Z) - WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation [31.539730066120374]
視覚ナビゲーションは、複雑な幾何学的および物理的制約の下で滑らかで衝突のない軌道を生成する必要がある。
WAM-Navは,視覚ナビゲーションを具体化した潜在世界行動モデルであり,行動生成と潜時視予知を共同で学習する。
論文 参考訳(メタデータ) (2026-06-03T14:05:19Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - LEAR: Learning Edge-Aware Representations for Event-to-LiDAR Localization [15.308350522323588]
LEARは、エッジ構造と高密度事象深度流れ場を共同で推定し、知覚とモダリティの分断を橋渡しする。
いくつかの人気があり、挑戦的なデータセットにおいて、LEARは最高の先行メソッドよりも優れたパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-03-02T13:18:25Z) - Nipping the Drift in the Bud: Retrospective Rectification for Robust Vision-Language Navigation [26.497706746023407]
BudVLNは、現在の状態分布に合わせて監視を構築することで、オンラインのロールアウトから学習するオンラインフレームワークである。
BudVLNは、分散シフトを一貫して軽減し、成功率とSPLの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-06T03:36:27Z) - \textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - VOGUE: Guiding Exploration with Visual Uncertainty Improves Multimodal Reasoning [62.09195763860549]
検証可能な報酬(RLVR)による強化学習は、大きな言語モデル(LLM)の推論を改善するが、探索に苦労する。
出力(テキスト)から入力(視覚)空間へ探索をシフトする新しい手法である$textbfVOGUE(Visual Uncertainty Guided Exploration)を紹介した。
本研究は,視覚入力の本質的不確実性における基盤探索が,マルチモーダル推論を改善するための効果的な戦略であることを示す。
論文 参考訳(メタデータ) (2025-10-01T20:32:08Z) - From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning [59.88543114325153]
本稿では,航法基礎モデルの強化学習能力を高めるためのSeeing-to-Experiencingフレームワークを提案する。
S2Eは、ビデオの事前トレーニングとRLによるポストトレーニングの長所を組み合わせたものだ。
実世界のシーンを3DGSで再現した3D画像に基づく総合的なエンドツーエンド評価ベンチマークであるNavBench-GSを構築した。
論文 参考訳(メタデータ) (2025-07-29T17:26:10Z) - Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments [37.20272055902246]
現実世界のナビゲーションは、しばしばドアや移動した物体、予測不可能な実体などの予期せぬ障害に対処する。
本稿では,Unexpected Obstructions (R2R-UNO)を用いたR2R(R2R-UNO)を提案する。
R2R-UNOの実験では、最先端のVLN手法がこのようなミスマッチに直面した場合、必然的に重大な問題に遭遇し、適応的な操作よりも厳格に指示に従うことが示されている。
論文 参考訳(メタデータ) (2024-07-31T08:55:57Z) - Towards Deviation-Robust Agent Navigation via Perturbation-Aware
Contrastive Learning [125.61772424068903]
視覚言語ナビゲーション(VLN)は、エージェントに与えられた言語命令に従って実際の3D環境をナビゲートするように要求する。
本稿では,既存のVLNエージェントの一般化能力を高めるために,PROPER(Progressive Perturbation-aware Contrastive Learning)と呼ばれるモデルに依存しない学習パラダイムを提案する。
論文 参考訳(メタデータ) (2024-03-09T02:34:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。