論文の概要: SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments
- arxiv url: http://arxiv.org/abs/2608.07548v1
- Date: Sat, 01 Aug 2026 03:17:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.427641
- Title: SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments
- Title(参考訳): SC$^{2}$-WM:連続環境における視覚・言語ナビゲーションのための閉ループフィードバック付き自己補正世界モデル
- Abstract要約: 本稿では,VLN-CEにおける閉ループ決定のための内部フィードバックを導入する自己修正ワールドモデルフレームワークであるSC$2$-WMを提案する。
本手法は,行動実行前の状態レベルの計画改善を行うための,世界モデルからのフィードバックを導出する。
標準的なVLN-CEベンチマークの実験では、ナビゲーションと一般化が改善された。
- 参考スコア(独自算出の注目度): 54.76467884696539
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-and-Language Navigation in Continuous Environments (VLN-CE) requires agents to make fine-grained navigation decisions under partial observability. However, most existing methods rely on open-loop execution, lacking mechanisms to detect and correct internal state drift during inference. We propose SC$^{2}$-WM, a self-correcting world model framework that introduces internal feedback for closed-loop decision making in VLN-CE. Our method derives feedback from world-model foresight to perform state-level plan refinement before action execution. To handle challenging scenarios, we further introduce conditional world-aware adaptation, which enables model-level correction by selectively updating the world model at test time when feedback indicates model capacity insufficiency. Experiments on standard VLN-CE benchmarks demonstrate improved navigation robustness and generalization. Our code is available at https://github.com/sunrise-ikun/SC2_WM.
- Abstract(参考訳): VLN-CE(Vision-and-Language Navigation in Continuous Environments)では、エージェントが部分的な可観測性の下で詳細なナビゲーション決定を行う必要がある。
しかし、既存のほとんどのメソッドはオープンループ実行に依存しており、推論中に内部状態のドリフトを検出し修正するメカニズムが欠如している。
本稿では,VLN-CEにおけるクローズドループ決定のための内部フィードバックを導入する自己修正ワールドモデルフレームワークSC$^{2}$-WMを提案する。
本手法は,行動実行前の状態レベルの計画改善を行うための,世界モデルからのフィードバックを導出する。
そこで本研究では,モデルキャパシティが不十分であることを示す場合,テスト時にワールドモデルを選択的に更新することで,モデルレベルの修正を可能にする条件付きワールドアウェア適応を導入する。
標準VLN-CEベンチマークの実験では、ナビゲーションの堅牢性と一般化が改善された。
私たちのコードはhttps://github.com/sunrise-ikun/SC2_WM.comで利用可能です。
関連論文リスト
- FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation [8.00310534826872]
VLN-CE(Vision-and-Language Navigation in Continuous Environments)では、エージェントが見えないシーンで自然言語の指示に従う必要がある。
本稿では,LMベースのVLN-CEに適した画像復元フレームワークであるFlowDecについて紹介する。
FlowDecは、ナビゲーション精度と生成遅延の両方において、最先端の破壊方法よりも優れています。
論文 参考訳(メタデータ) (2026-06-21T10:24:16Z) - WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation [42.8714305455232]
将来の状態を「想像」する能力は、そのような部分的な可観測性の下での堅牢な意思決定に不可欠である、と我々は主張する。
We propose WorldFly, a novel world-model-based VLA framework that using a dual-branch linked flow matching mechanism to jointly generate future video predictions and navigation action。
論文 参考訳(メタデータ) (2026-06-04T13:23:05Z) - WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform [130.8118909583659]
本稿では,世界モデル評価のための拡張ベンチマークであるWorldArena 2.0を紹介する。
WorldArena 2.0は、モダリティ、機能、プラットフォームという3つの次元で、具現化された世界モデルの評価を体系的に拡張する。
WorldArena 2.0は、標準化されたプロトコルの下で、知覚品質、インタラクティブなユーティリティ、クロスプラットフォームのパフォーマンスを包括的に評価する。
論文 参考訳(メタデータ) (2026-05-18T06:18:21Z) - User-Feedback-Driven Continual Adaptation for Vision-and-Language Navigation [50.51140007672333]
VLN(Vision-and-Language Navigation)は、エージェントが自然言語の指示に従うことで複雑な環境をナビゲートする必要がある。
現在のGSA-VLNフレームワークは、環境暴露の繰り返しによる教師なし適応のみに依存するため、ユーザのフィードバックを除外している。
本稿では,GSA-VLNを拡張したユーザフィードバック型適応フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-11T06:11:45Z) - Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation [16.632191523127865]
Fast-SmartWayは、パノラマビューやウェイポイント予測不要なエンドツーエンドのゼロショットVLN-CEフレームワークである。
提案手法では,3つの正面RGB-D画像と自然言語命令を組み合わせるだけで,MLLMが直接行動を予測することができる。
論文 参考訳(メタデータ) (2025-11-02T13:21:54Z) - VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation [52.00474922315126]
未確認環境のための視覚言語ナビゲーションフレームワークであるVLN-Zeroを提案する。
我々は視覚言語モデルを用いて、記号的なシーングラフを効率的に構築し、ゼロショットのニューロシンボリックナビゲーションを可能にする。
VLN-Zeroは、最先端のゼロショットモデルと比べて2倍の成功率を獲得し、最も微調整されたベースラインを上回り、半分の時間でゴール地点に達する。
論文 参考訳(メタデータ) (2025-09-23T03:23:03Z) - TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning [79.59753528758361]
両足のVLAを促進するために、豊富な車輪付きヒューマノイドデータを活用するクロス・エボディメント・フレームワークであるTrajBoosterを提案する。
私たちのキーとなる考え方は、形態素に依存しないインターフェースとして、エンドエフェクタ・トラジェクトリを使用することです。
以上の結果から,TrajBoosterは既存の車輪付きヒューマノイドデータにより,二足歩行ヒューマノイドVLAの性能を効率的に向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-09-15T12:25:39Z) - View Invariant Learning for Vision-Language Navigation in Continuous Environments [1.2530458935333404]
VLNCE(Vision-Language Navigation in Continuous Environments)は、AIの具体化における重要な研究課題である。
ほとんどのナビゲーションポリシーは、視点の変化、すなわち、エージェントの観察を変えるカメラの高さと視角の変化に敏感である。
カメラ視点の変化に対する既存のナビゲーションポリシーの堅牢性を高めるために,ビュー不変なポストトレーニング戦略であるVIL(View Invariant Learning)を提案する。
論文 参考訳(メタデータ) (2025-07-05T18:04:35Z) - NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous Environments [67.18144414660681]
VLN-CE(Vision-and-Language Navigation in Continuous Environments)は、自然言語命令によって誘導される複雑な環境において、エージェントがシーケンシャルなナビゲーションアクションを実行する必要がある。
人間の認知にインスパイアされたNavMorphは、VLN-CEタスクにおける環境理解と意思決定を強化する自己進化型世界モデルフレームワークである。
論文 参考訳(メタデータ) (2025-06-30T02:20:00Z) - VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning [77.34267241692706]
Vision-Language Navigation(VLN)は、エージェントが自然言語命令を使用して現実世界の環境をナビゲートする必要がある、AIの実施における中核的な課題である。
本稿では、LVLM(Large Vision-Language Models)を利用して、エゴセントリックな動画ストリームを連続的なナビゲーションアクションに変換するエンドツーエンドフレームワークであるVLN-R1を提案する。
論文 参考訳(メタデータ) (2025-06-20T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。