論文の概要: Nipping the Drift in the Bud: Retrospective Rectification for Robust Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2602.06356v1
- Date: Fri, 06 Feb 2026 03:36:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:41.22042
- Title: Nipping the Drift in the Bud: Retrospective Rectification for Robust Vision-Language Navigation
- Title(参考訳): バッド内のドリフトをニーピングする:ロバスト視線ナビゲーションの回顧的整形
- Abstract要約: BudVLNは、現在の状態分布に合わせて監視を構築することで、オンラインのロールアウトから学習するオンラインフレームワークである。
BudVLNは、分散シフトを一貫して軽減し、成功率とSPLの両方で最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 26.497706746023407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Navigation (VLN) requires embodied agents to interpret natural language instructions and navigate through complex continuous 3D environments. However, the dominant imitation learning paradigm suffers from exposure bias, where minor deviations during inference lead to compounding errors. While DAgger-style approaches attempt to mitigate this by correcting error states, we identify a critical limitation: Instruction-State Misalignment. Forcing an agent to learn recovery actions from off-track states often creates supervision signals that semantically conflict with the original instruction. In response to these challenges, we introduce BudVLN, an online framework that learns from on-policy rollouts by constructing supervision to match the current state distribution. BudVLN performs retrospective rectification via counterfactual re-anchoring and decision-conditioned supervision synthesis, using a geodesic oracle to synthesize corrective trajectories that originate from valid historical states, ensuring semantic consistency. Experiments on the standard R2R-CE and RxR-CE benchmarks demonstrate that BudVLN consistently mitigates distribution shift and achieves state-of-the-art performance in both Success Rate and SPL.
- Abstract(参考訳): Vision-Language Navigation (VLN)は、自然言語命令を解釈し、複雑な連続した3D環境をナビゲートするために、エンボディエージェントを必要とする。
しかし、支配的な模倣学習パラダイムは露光バイアスに悩まされ、推論中の小さな偏差が複雑なエラーを引き起こす。
DAggerスタイルのアプローチは、エラー状態の修正によってこれを緩和しようとするが、重要な制限を識別する。
エージェントがオフトラック状態からリカバリ動作を学ぶように強制すると、しばしばオリジナルの命令と意味的に矛盾する監視信号が生成される。
これらの課題に対応するために、我々は、現在の状態分布に合わせた監督を構築することで、政治上のロールアウトから学習するオンラインフレームワークであるBudVLNを紹介した。
BudVLNは、ジオデシックオラクルを用いて、有効な歴史的状態から派生した修正軌道を合成し、意味的整合性を確保する。
標準R2R-CEとRxR-CEベンチマークの実験では、BudVLNは分散シフトを一貫して緩和し、成功率とSPLの両方で最先端のパフォーマンスを達成する。
関連論文リスト
- Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving [37.533498955258544]
本稿では,インスタンスレベルの残差をクラスレベルの遅延シフトに置き換える単一パス誘導機構を提案する。
我々はLCSがより強力なコマンドアテンデンスを実現しつつ、推論遅延を約50%削減できることを実証した。
論文 参考訳(メタデータ) (2026-07-31T19:32:28Z) - Rethinking State Tracking in Recurrent Models Through Error Control Dynamics [26.942965240880515]
本研究では,アフィン再帰ネットワークが状態表現を保存すると,状態分離部分空間の誤りを訂正できないことを示す。
我々は、ロバストな状態追跡がアーキテクチャの理論的表現性だけでなく、エラー制御によって決定されることを証明した。
論文 参考訳(メタデータ) (2026-05-08T13:59:15Z) - DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation [49.233063630722334]
長距離ナビゲーションにおけるロバストなストリーミング認識と閉ループ制御のためのフレームワークであるDecoVLNを提案する。
本稿では,統合されたスコアリング関数を反復的に最適化することにより,過去の候補プールからフレームを選択する適応的精錬機構を提案する。
また,コンプレックスエラーを軽減するために,状態-作用ペアレベルの補正手法を導入する。
論文 参考訳(メタデータ) (2026-03-13T16:24:37Z) - Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments [38.97818584066075]
VLN-CE(Vision-Language Navigation in Continuous Environments)は、長期にわたる人間のインタラクションから複雑な推論を学ぶためのエージェントである。
現在のトレーニングパラダイムは、一般化能力、エラー回復、トレーニング安定性のバランスをとるのに苦労しています。
本稿では,不完全な軌跡から厳密な監視を抽出するためのフレームワークである,ステップアウェアコントラストアライメント(SACA)を紹介する。
論文 参考訳(メタデータ) (2026-03-10T14:45:50Z) - Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration [24.562540060971273]
VLA(Vision-Language-Action)モデルにより、ロボットは自然言語命令から直接操作タスクを実行することができる。
言語命令がシーンに矛盾する場合でも、VLAポリシーが視覚的に妥当な動作を実行し続ける重要な障害モードを明らかにする。
Instruction-Guided Attention Recalibration (IGAR) を提案する。
論文 参考訳(メタデータ) (2026-03-06T08:01:36Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning [77.34267241692706]
Vision-Language Navigation(VLN)は、エージェントが自然言語命令を使用して現実世界の環境をナビゲートする必要がある、AIの実施における中核的な課題である。
本稿では、LVLM(Large Vision-Language Models)を利用して、エゴセントリックな動画ストリームを連続的なナビゲーションアクションに変換するエンドツーエンドフレームワークであるVLN-R1を提案する。
論文 参考訳(メタデータ) (2025-06-20T17:59:59Z) - Vision-and-Language Navigation via Causal Learning [13.221880074458227]
クロスモーダル因果変換器(Cross-modal causal transformer, GOAT)は因果推論のパラダイムに根ざした先駆的な解である。
BACLおよびFACLモジュールは、潜在的刺激的相関を包括的に緩和することにより、偏見のない学習を促進する。
グローバルな共同創設者の特徴を捉えるために,コントラスト学習によって教師されるクロスモーダル機能プーリングモジュールを提案する。
論文 参考訳(メタデータ) (2024-04-16T02:40:35Z) - Towards Deviation-Robust Agent Navigation via Perturbation-Aware
Contrastive Learning [125.61772424068903]
視覚言語ナビゲーション(VLN)は、エージェントに与えられた言語命令に従って実際の3D環境をナビゲートするように要求する。
本稿では,既存のVLNエージェントの一般化能力を高めるために,PROPER(Progressive Perturbation-aware Contrastive Learning)と呼ばれるモデルに依存しない学習パラダイムを提案する。
論文 参考訳(メタデータ) (2024-03-09T02:34:13Z) - Anticipating the Unseen Discrepancy for Vision and Language Navigation [63.399180481818405]
視覚言語ナビゲーションでは、エージェントは特定のターゲットに到達するために自然言語命令に従う必要がある。
目に見える環境と目に見えない環境の間に大きな違いがあるため、エージェントがうまく一般化することは困難である。
本研究では,テストタイムの視覚的整合性を促進することによって,未知の環境への一般化を学習する,未知の離散性予測ビジョンと言語ナビゲーション(DAVIS)を提案する。
論文 参考訳(メタデータ) (2022-09-10T19:04:40Z) - Contrastive Instruction-Trajectory Learning for Vision-Language
Navigation [66.16980504844233]
視覚言語ナビゲーション(VLN)タスクでは、エージェントが自然言語の指示でターゲットに到達する必要がある。
先行研究は、命令-軌道対間の類似点と相違点を識別できず、サブ命令の時間的連続性を無視する。
本稿では、類似したデータサンプル間の分散と、異なるデータサンプル間の分散を探索し、ロバストなナビゲーションのための独特な表現を学習するContrastive Instruction-Trajectory Learningフレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-08T06:32:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。