論文の概要: A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.09792v1
- Date: Thu, 09 Jul 2026 05:13:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.196191
- Title: A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation
- Title(参考訳): 身体視・言語ナビゲーションの総合的実態調査とシステム的実世界評価
- Authors: Liuyi Wang, Kai Sheng, Zongtao He, Jinlong Li, Yongrui Qin, Haojie Dai, Xiangyi Wang, Jingwei Yang, Qingqing Yan, Chengju Liu, Qijun Chen,
- Abstract要約: ビジョン・アンド・ランゲージ・ナビゲーション(VLN)は、ロボットが自然言語理解と視覚的知覚をデータ駆動で統合できるようにすることで、有望な方向を提供する。
VLNは研究の注目を惹きつけており、体系的な方法論分類と現実世界の検証は依然として限られている。
- 参考スコア(独自算出の注目度): 30.633945298226163
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Navigation is a fundamental capability of autonomous systems, yet most existing approaches rely on highly structured models and strong prior assumptions, limiting their robustness in open and uncertain real-world environments. Vision-and-Language Navigation (VLN) offers a promising direction by enabling robots to integrate natural language understanding with visual perception in a data-driven manner. Although VLN has attracted increasing research attention, systematic methodological taxonomy and real-world validation remain limited. This survey presents a comprehensive review of VLN research. Specifically, state-of-the-art methods are organized along two orthogonal dimensions: action paradigms, including hierarchical and monolithic frameworks, and model paradigms, including discriminative and generative approaches. A critical analysis of their respective strengths and limitations is provided. Additionally, we conduct a systematic real-world evaluation of representative VLN system configurations on a physical robotic platform. Experiments across ten diverse real-world scenes show a substantial performance gap between simulation and real-world deployment under the tested configurations: a representative monolithic RGB-only method achieves 61% success in simulation but drops to 22% in real-world deployment, while a hierarchical framework achieves a higher real-world success rate of 51%, suggesting stronger robustness in our evaluation setting. Finally, we highlight key challenges in perception, decision-making, and control that must be addressed in future research.
- Abstract(参考訳): ナビゲーションは自律システムの基本的な能力であるが、既存のほとんどのアプローチは高度に構造化されたモデルと強い事前仮定に依存しており、オープンで不確実な現実世界環境での堅牢性を制限する。
ビジョン・アンド・ランゲージ・ナビゲーション(VLN)は、ロボットが自然言語理解と視覚的知覚をデータ駆動で統合できるようにすることで、有望な方向を提供する。
VLNは研究の注目を集めているが、体系的な分類学と実世界の検証は依然として限られている。
本調査はVLN研究の総合的なレビューである。
具体的には、最先端の手法は、階層的およびモノリシックなフレームワークを含むアクションパラダイムと、差別的および生成的アプローチを含むモデルパラダイムの2つの直交次元に沿って編成される。
それぞれの強みと限界を批判的に分析する。
さらに,物理ロボットプラットフォーム上でのVLNシステム構成のシステマティックな実環境評価を行う。
代表的なモノリシックなRGBオンリーの手法はシミュレーションにおいて61%の成功を達成しているが、実際のデプロイメントでは22%に低下する一方、階層的なフレームワークは51%のより高い実世界の成功率を達成し、我々の評価設定では強い堅牢性を示している。
最後に、今後の研究で対処しなければならない認識、意思決定、制御における重要な課題を強調します。
関連論文リスト
- World Action Models: The Next Frontier in Embodied AI [123.5787299299832]
VLA(Vision-Language-Action)モデルは、具体的政策学習のための強力なセマンティックな一般化を実現している。
彼らは、物理的な世界が介入の下でどのように進化するかを明示的にモデル化することなく、リアクティブな観察から行動へのマッピングを学ぶ。
成長するこの制限には、世界モデル、環境ダイナミクスの予測モデル、アクション生成パイプラインを統合することで対処する。
論文 参考訳(メタデータ) (2026-05-12T13:10:52Z) - Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap [10.048113624715151]
UAV-VLN (Vision-and-Language Navigation for Unmanned Aerial Vehicles) は、人工知能において重要な課題である。
本稿では,その形式的タスク定義から現状まで,その分野を包括的かつ構造化した調査を行う。
論文 参考訳(メタデータ) (2026-04-15T09:20:02Z) - ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation [66.02142169323521]
Vision-Language-ActionモデルとWorld Modelは最近、汎用ロボットインテリジェンスのための有望なパラダイムとして登場した。
既存のベンチマークは、主にシミュレータ中心であり、制御性を提供するが、知覚ノイズによって引き起こされる現実のギャップを捉えることができない。
シミュレーションと実世界の実行を橋渡しする標準化された評価フレームワークであるManipArenaを紹介する。
論文 参考訳(メタデータ) (2026-03-30T15:06:41Z) - LEGS-POMDP: Language and Gesture-Guided Object Search in Partially Observable Environments [7.458277072199384]
部分観測可能環境(LEGS-POMDP)におけるLanguagEとgesture-Guided Object Search
本稿では,LanguagE と Gesture-Guided Object Search in partially Observable Environments (LEGS-POMDP)を紹介した。
シミュレーションでは、マルチモーダル融合は単調なベースラインを著しく上回り、挑戦的な環境や対象カテゴリーで平均89%の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-05T01:04:23Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation [61.82502719679122]
本稿では,Versatile, Embodied, Realistic Simulation, EvaluationのベンチマークであるVLNVerseを紹介する。
VLNVerseは、スケーラブルでフルスタックのAI問題としてVLNを再定義する。
ベンチマーク内の全てのタスクに対処できる新しいマルチタスクモデルを提案する。
論文 参考訳(メタデータ) (2025-12-22T04:27:26Z) - LTD-Bench: Evaluating Large Language Models by Letting Them Draw [57.237152905238084]
LTD-Benchは、大規模言語モデル(LLM)のブレークスルーベンチマークである。
LLMの評価を抽象的なスコアから直接観察可能な視覚出力に変換する。
LTD-Benchの視覚出力は強力な診断分析を可能にし、モデル類似性を調べるための潜在的アプローチを提供する。
論文 参考訳(メタデータ) (2025-11-04T08:11:23Z) - Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation [54.3628937181904]
内部世界モデル(英語版)(WM)は、エージェントが世界の状態を理解し、遷移を予測することを可能にする。
近年,OpenAI o3, GPT-4o, Geminiなどの大規模視覚言語モデル(VLM)は汎用的なWMとしての可能性を示している。
論文 参考訳(メタデータ) (2025-06-27T03:24:29Z) - WHALE: Towards Generalizable and Scalable World Models for Embodied Decision-making [40.53824201182517]
本稿では、一般化可能な世界モデルを学ぶためのフレームワークであるWHALEを紹介する。
Whale-STは、拡張一般化性を備えた時空間変圧器を用いたスケーラブルな世界モデルである。
また、Open X-Embodimentデータセットから970K軌道上でトレーニングされた414MパラメータワールドモデルであるWhale-Xを提案する。
論文 参考訳(メタデータ) (2024-11-08T15:01:27Z) - A Survey of Automatic Hallucination Evaluation on Natural Language Generation [21.37538215193138]
LLM(Large Language Models)の急速な進歩は、モデルの信頼性を保証するために、幻覚を確実に評価する方法という、大きな課題をもたらしました。
本調査は105の評価手法を体系的に分析し,77.1%がLLMを対象としていることを明らかにする。
基礎的なデータセットとベンチマークの調査と評価方法論の分類に基づいて、フィールドを整理するための構造化された枠組みを定式化する。
論文 参考訳(メタデータ) (2024-04-18T09:52:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。