論文の概要: Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.18042v1
- Date: Mon, 20 Jul 2026 15:11:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.67174
- Title: Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation
- Title(参考訳): 行動前予想:未来型ビジョンランゲージナビゲーション
- Abstract要約: Future-State-Conditioned VLN (FSC-VLN) は、2つのトレーニングデータ体制の下でストリームVLNスタイルのベースライン上でSR/OSR/SPLを改善する。
- 参考スコア(独自算出の注目度): 10.890622231189043
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: End-to-end vision-language navigation (VLN) with causal vision-language models can map instructions and egocentric observations directly to actions, but standard behavior cloning supervises only the next action and does not explicitly train the policy state to be predictive of future visual outcomes. We first ask a diagnostic question: if the policy is given an expert-trajectory future image as privileged input at training and testing time, is that additional visual evidence useful for choosing the current action? (These expert-trajectory future images are unavailable at test time in real deployment, so we use this setting only as a privileged-input diagnostic.) The answer is yes; this sanity check shows that future observations can provide rich, actionable cues. We then ask a deployable question: without accessing future images at inference, can we still benefit from future information by using a compressed future visual latent only as training supervision? We propose Future-State-Conditioned VLN (FSC-VLN), which adds a future-query token and aligns its hidden state to a frozen visual embedding $Δ$ steps ahead via a training-only target branch that is removed after training. On R2R val-unseen, FSC-VLN improves SR/OSR/SPL over a StreamVLN-style baseline under two training-data regimes, with larger gains on long-horizon episodes; ablations further support the dual-query design (separating future and action queries).
- Abstract(参考訳): 因果的視覚言語モデルを用いたエンドツーエンドの視覚言語ナビゲーション(VLN)は、指示やエゴセントリックな観察を直接行動にマッピングすることができるが、標準的な行動クローニングは次の行動のみを監督し、将来の視覚結果を予測するためにポリシー状態を明示的に訓練しない。
トレーニングやテストの際の特権的な入力として、このポリシーが専門家による将来のイメージとして与えられる場合、現在のアクションを選択するのに、追加の視覚的証拠が有用か?
(これらのエキスパート・トラジェクティブ・フューチャーイメージは実運用ではテスト時に利用できないので、この設定は特権入力診断としてのみ使用します。)
この正当性チェックは、将来の観測が豊かで行動可能な手がかりを提供できることを示している。
将来の画像に推論でアクセスせずに、圧縮された将来の視覚的潜伏をトレーニングの監督としてのみ使うことで、将来的な情報から恩恵を受けられるだろうか?
本稿では,Future-State-Conditioned VLN(FSC-VLN)を提案する。FSC-VLN(Future-State-Conditioned VLN)は,将来のクエリトークンを追加し,学習後に削除されるトレーニング専用ターゲットブランチを通じて,その隠れた状態を凍結したビジュアル埋め込みに調整する。
R2R val-unseenでは、FSC-VLNは2つのトレーニングデータ体制の下で、ストリームVLNスタイルのベースラインよりもSR/OSR/SPLを改良し、ロングホライゾンエピソードに大きな利益を上げている。
関連論文リスト
- Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models [72.02240114225107]
World Action Models (WAM) は、将来の視覚力学をアクション生成に組み込むことでビジョン・ランゲージ・アクション(VLA)モデルを拡張する。
既存のWAMは、実行の進行に限られた適応性を持つ想像上の未来をしばしば利用し、注意散らしや信頼性の低い予測方法を導入する可能性がある。
本稿では,プログレッシブ・コンディションド・ワールド・アクション・モデルであるProWAMを提案する。
論文 参考訳(メタデータ) (2026-09-06T12:46:20Z) - DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation [4.9808826786866405]
航空視覚言語ナビゲーション(VLN)は、時間とともに視覚的エビデンスを統合し、将来のアクションを計画し、それが部分観測可能性の下でナビゲーション目標に到達したかどうかを決定するための実施エージェントを必要とする。
本研究では,Dream-VLA上に構築された拡散型空中VLNフレームワークであるDreamFlyを提案する。
DreamFlyは32.04%/29.46%のSRと28.22%/23.54%のSPLを達成した。
論文 参考訳(メタデータ) (2026-08-12T17:54:33Z) - FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models [21.446753234768824]
既存の視覚的手法は将来の視覚状態を予測するが、明確な動作誘導は欠如している。
本稿では,VLA表現を明示的な時間的監督で拡張するフレームワークであるFoMoVLAを提案する。
論文 参考訳(メタデータ) (2026-07-16T09:04:50Z) - Teaching Vision-Language-Action Models What to See and Where to Look [40.70324197562915]
VLA(Vision-Language-Action)モデルは、エンドツーエンドの自動運転において有望なパラダイムとして登場した。
DriveTeach-VLAは,VLAに何を見るか,どこで見るかを明示的に教えるフレームワークである。
論文 参考訳(メタデータ) (2026-07-02T03:34:32Z) - LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation [5.637033593506126]
マルチステップロボット操作では、シーンがどのように進化するかの不確実性の下で行動する必要がある。
本研究では,短時間のタスク一貫性のある未来のビデオが,制御や強化学習の微調整に有用であるかどうかを考察する。
論文 参考訳(メタデータ) (2026-05-28T12:49:37Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Being-H0.7: A Latent World-Action Model from Egocentric Videos [32.77431338471086]
我々は、VLAスタイルのポリシーに未来を意識した推論をもたらす潜在的世界行動モデルであるBeing-H0.7を提案する。
being-H0.7は、知覚と行動の間の学習可能な遅延クエリを、コンパクトな推論インターフェイスとして挿入する。
論文 参考訳(メタデータ) (2026-04-30T14:16:15Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation [73.80968452950854]
Vision-Language Navigation in Continuous Environments (VLN-CE) は、エージェントが自由形式の3D空間を通して自然言語の指示に従う必要がある。
既存のVLN-CEアプローチは通常、2段階のウェイポイント計画フレームワークを使用する。
本稿では,エンドツーエンド最適化VLN-CEポリシとしてDAgger Diffusion Navigation (DifNav)を提案する。
論文 参考訳(メタデータ) (2025-08-13T02:51:43Z) - OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction [95.6266030753644]
Vision-Language-Action(VLA)モデルは、視覚的な観察と言語指示に基づいてロボット行動を予測することを目的としている。
既存のアプローチでは、視覚的特徴と言語的特徴が独立して下流ポリシーに供給されるため、微調整済みの視覚言語モデル(VLM)が必要である。
本稿では,テキスト認識による視覚的特徴抽出によって既存のアライメントを活用する新しいVLAアーキテクチャOTTERを提案する。
論文 参考訳(メタデータ) (2025-03-05T18:44:48Z) - UnitedVLN: Generalizable Gaussian Splatting for Continuous Vision-Language Navigation [71.97405667493477]
我々は,UnitedVLNと呼ばれる,新しい汎用3DGSベースの事前学習パラダイムを導入する。
エージェントは、高忠実度360度ビジュアルイメージとセマンティック特徴を統一してレンダリングすることで、将来の環境をよりよく探索することができる。
UnitedVLNは既存のVLN-CEベンチマークで最先端の手法より優れている。
論文 参考訳(メタデータ) (2024-11-25T02:44:59Z) - Improving Vision-and-Language Navigation by Generating Future-View Image
Semantics [96.8435716885159]
VLN(Vision-and-Language Navigation)は、自然言語命令に基づいてエージェントが環境をナビゲートする必要があるタスクである。
エージェントのドメイン内事前トレーニングにおける3つのプロキシタスクを提案する: Masked Panorama Modeling (MPM)、 Masked Trajectory Modeling (MTM)、Action Prediction with Image Generation (APIG)。
次に、VLNタスク上のエージェントを補助的損失で微調整し、エージェントが生成するビューセマンティクスと次のステップのグラウンド真実ビューセマンティクスとの差を最小限に抑える。
論文 参考訳(メタデータ) (2023-04-11T00:36:02Z) - HOP: History-and-Order Aware Pre-training for Vision-and-Language
Navigation [33.38079488853708]
以前のVision-and-Language Navigation (VLN)の事前トレーニング手法には、将来のアクションを予測する能力やコンテキストを無視する能力がない。
本稿では,過去の観測を生かし,今後の行動予測を支援する新しい事前学習パラダイムを提案する。
我々のナビゲーション行動予測は、歴史を伴う行動予測のタスクによって強化される。
論文 参考訳(メタデータ) (2022-03-22T10:17:12Z) - Policy Gradients Incorporating the Future [66.20567145291342]
我々はエージェントが明示的に予測することなく「未来を見る」方法を紹介した。
我々は,エージェントが過去の経験を学習中に,その将来に何が起こったのかを観察できるように提案する。
これにより、エージェントは、現在に加えて、将来の軌道力学に関するリッチで有用な情報を利用することができる。
論文 参考訳(メタデータ) (2021-08-04T14:57:11Z) - Learning to Anticipate Egocentric Actions by Imagination [60.21323541219304]
我々は,エゴセントリックなアクション予測タスクについて検討し,エゴセントリックなビデオの再生に先立って,将来のアクション秒を予測する。
本手法は, EPIC Kitchens Action Precipation Challenge の既視テストセットと未確認テストセットの両方において, 従来手法を有意に上回った。
論文 参考訳(メタデータ) (2021-01-13T08:04:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。