論文の概要: GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2609.18581v2
- Date: Tue, 22 Sep 2026 11:52:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.849829
- Title: GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation
- Title(参考訳): 接地VLN:視覚言語ナビゲーションのための接地による推論と動作
- Abstract要約: 視覚言語ナビゲーション(VLN)エージェントは、意味論的推論と空間的実行を結びつけるのに苦労する。
本研究では,視覚的グラウンドを推論と行動の共有インターフェースとして用いるグラウンドングVLNを提案する。
以上の結果から,GroundingVLNはR2R-CEで69.9%SR,RxR-CEで75.1%SRの最先端性能を高いサンプル効率で達成できることが示唆された。
- 参考スコア(独自算出の注目度): 31.389521894383833
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although vision-language models (VLMs) possess strong visual understanding and reasoning capabilities, existing vision-and-language navigation (VLN) agents struggle to connect semantic reasoning with spatial execution. Two coupled gaps remain in this connection, as intermediate reasoning is not explicitly anchored to visual evidence and high-level decisions lack precise spatial goals to guide low-level motion. Cognitive science suggests that human navigation bridges these levels hierarchically by anchoring cognition to relevant landmarks and guiding locomotion toward spatial goals. Motivated by this principle, we propose GroundingVLN, which uses visual grounding as a shared interface between reasoning and action. GroundingVLN first reasons with grounding by anchoring task-relevant visual evidence to precise image locations throughout structured reasoning. It then acts through grounding by predicting a progress-aligned pixel goal that a geometric planner translates into primitive actions. To learn these capabilities, we construct GroundingCOTVLN-188K, a dataset of temporally aligned grounded reasoning traces, and introduce Grounded and Execution-Aware Reinforcement Learning (GEAR), which aligns grounded reasoning and spatial decisions with downstream execution. Experiments demonstrate that GroundingVLN achieves state-of-the-art performance (69.9% SR on R2R-CE and 75.1% SR on RxR-CE) with high sample efficiency, using just 0.9% as much training data as the strongest baseline. It also generalizes strongly across datasets, attaining 59.9% SR on RxR-CE when trained solely on R2R, a gain of 20.1% over the strongest baseline. Code and models will be released after review.
- Abstract(参考訳): 視覚言語モデル(VLM)には強力な視覚的理解と推論能力があるが、既存の視覚言語ナビゲーション(VLN)エージェントは意味論的推論と空間的実行を結びつけるのに苦労している。
中間的推論は視覚的証拠に明示的に固定されておらず、高レベルの決定は低レベルの動きを導くための正確な空間目標を欠いている。
認知科学は、人間のナビゲーションがこれらのレベルを階層的に橋渡しし、認知を関連するランドマークに固定し、空間目標に向かって移動を導くことを示唆している。
この原理により,視覚的グラウンドティングを推論と行動の共有インターフェースとして用いるグラウンドリングVLNを提案する。
グラウンドングVLNは、まず、タスク関連視覚的証拠を構造化推論全体を通して正確な画像位置に固定することによるグラウンドングの理由である。
すると、幾何学的プランナーが原始的なアクションに変換するプログレス整列画素のゴールを予測することによって、グラウンド化によって作用する。
これらの特徴を学習するために,時間的に整合した基礎的推論トレースのデータセットである GroundingCOTVLN-188K を構築し,基礎的推論と空間的決定を下流実行と整合させる Grounded and Execution-Aware Reinforcement Learning (GEAR) を導入する。
GroundingVLNは、R2R-CEで69.9%のSR、RxR-CEで75.1%のSRを高いサンプル効率で達成している。
また、データセットをまたいで強く一般化し、RxR-CEで59.9%のSRを達成した。
コードとモデルはレビュー後にリリースされる。
関連論文リスト
- GRAVA: Grounded Reasoning-to-Action Representation and Learning for Autonomous Driving [19.900072085040794]
GRAVAはGRA( Grounded Reasoning-to-Action)を中心に構築されたフレームワークである。
GRAは、アクション関連言語参照を2次元視覚領域とエゴ中心の物理的状態にリンクし、オブジェクトの相互作用と決定を軌跡アンコールされた型付きグラフで整理し、この構造を基底的推論にシリアライズする。
プログレッシブ・トレーニング・ストラテジーは、事前学習を通じて基礎的な認知を発達させ、模倣によって推論と行動のインターフェースを確立し、強化学習と探索を通じて運転行動を改善する。
論文 参考訳(メタデータ) (2026-09-14T07:55:04Z) - Grounding Isn't Knowing: Do VLMs Need Object Localization for Spatial Reasoning? [24.02857259963021]
視覚言語モデル(VLM)は空間的疑問に答えることができるが、物体の接地と空間的推論を結びつけるメカニズムは理解されていない。
本研究では,LLaVA-1.5とQwen2.5-VLの2つの代表的なモデルファミリについて,機械的解釈可能性ツール群を用いて検討する。
空間的関係予測は、厳密なバウンディングボックス境界を必要とせず、オブジェクト整列トークンが粗いターゲット参照アンカーを確立する段階的なグラウンド・ツー・レゾン化プロセスに従う。
論文 参考訳(メタデータ) (2026-08-24T10:26:15Z) - GSR: Learning Structured Reasoning for Embodied Manipulation [10.756456261056867]
グラウンドド・シーングラフ推論(グラウンドド・シーングラフ・レアソニング、英語: Grounded Scene-graph Reasoning、GSR)は、セマンティックグラウンドド・シーングラフ上の遷移として、世界状態の進化を明示的にモデル化する構造的推論パラダイムである。
GSRは、物理的に接地された空間における行動条件、結果、および目標満足度に関する明確な推論を可能にする。
論文 参考訳(メタデータ) (2026-02-02T06:07:42Z) - Detect Anything via Next Point Prediction [51.55967987350882]
Rex-Omniは最先端の物体認識性能を実現する3BスケールのMLLMである。
COCOやLVISのようなベンチマークでは、Rex-Omniは回帰ベースのモデルに匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2025-10-14T17:59:54Z) - Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning [96.01617809845396]
Ground-R1は、明示的なエビデンスや合理的アノテーションを必要とせずに、基礎的な視覚的推論を可能にする強化学習フレームワークである。
グラウンドR1は優れた性能を示し、不確実性認識、空間認識、反復的洗練などの創発的な認知行動を示す。
論文 参考訳(メタデータ) (2025-05-26T17:51:47Z) - Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas [69.56484419619919]
機械的解釈可能性のレンズによる空間的推論の課題について検討する。
空間的推論の成功は、実際の物体の位置と注意を一致させるモデルの能力と強く相関している。
本研究の目的は,ADAPTVISを用いて,信頼性の高い地域への注意を喚起することである。
論文 参考訳(メタデータ) (2025-03-03T17:57:03Z) - SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models [15.50826328938879]
視覚言語モデル(VLM)の空間的推論能力を評価するためのベンチマークであるSURDSを紹介する。
nuScenesデータセットに基づいて構築されたSURDSは、41,080の視覚要求回答トレーニングインスタンスと9,250の評価サンプルで構成されている。
本研究では,空間的に接地された報酬信号を利用した強化学習に基づくアライメント手法を提案する。
論文 参考訳(メタデータ) (2024-11-20T08:14:01Z) - Locate Anything on Earth: Advancing Open-Vocabulary Object Detection for Remote Sensing Community [58.417475846791234]
LAEタスクのための最初のオープンボキャブラリ基礎オブジェクト検出器であるLAE-DINOモデルを提案し,訓練する。
我々は、確立されたリモートセンシングベンチマークDIOR、DOTAv2.0、および新たに発表された80クラスのLEE-80Cベンチマークについて実験を行った。
その結果, LAE-1Mデータセットの利点と, LAE-DINO法の有効性が示された。
論文 参考訳(メタデータ) (2024-08-17T06:24:43Z) - Improving Vision-and-Language Reasoning via Spatial Relations Modeling [30.477235227733928]
ビジュアルコモンセンス推論(VCR)は、難しいマルチモーダルタスクである。
提案手法は,より空間的な文脈を維持するために表現を導くことができる。
VCRと他の2つの視覚・言語推論タスクであるVQAとNLVRについて、最先端の結果を得る。
論文 参考訳(メタデータ) (2023-11-09T11:54:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。