論文の概要: From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.03792v1
- Date: Sat, 04 Jul 2026 09:44:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.722781
- Title: From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation
- Title(参考訳): 視覚・言語ナビゲーションにおける地域順からインスタンスレベルグラウンドへ
- Abstract要約: 我々は、Last-3-Meter Grounding Gapを形式化し、3つのインスタンス中心のメトリクスを導入し、近接精度、目標視認性、最終ビューのグラウンド化を定量化する。
このギャップを緩和するために、長い水平航法から接近する微粒なターゲットを分離する、プラグアンドプレイでアーキテクチャに依存しない改良モジュールREALMを提案する。
- 参考スコア(独自算出の注目度): 17.248079131598058
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-and-Language Navigation (VLN) agents may satisfy conventional success criteria while still failing to establish reliable object-level grounding, because current evaluation protocols mainly reward stopping within a 3-meter radius and largely ignore the agent's final orientation and target visibility. We formalize this limitation as the Last-3-Meter Grounding Gap and introduce three instance-centric metrics to quantify proximity precision, target visibility, and final-view grounding. To mitigate this gap, we propose REALM (Region-to-Entity Alignment for Last-3-Meter Navigation), a plug-and-play, architecture-agnostic refinement module that decouples fine-grained target approaching from long-horizon navigation. REALM uses a visibility-aware stopping strategy to reduce premature termination and improve final viewpoint alignment. We further construct REVERIE-AIM, which provides object-instance-level goals and 180K short-horizon training samples for final-stage target approaching. Extensive evaluations across four diverse VLN backbones show that REALM consistently improves proximity precision and visual grounding success, demonstrating its broad applicability.
- Abstract(参考訳): VLN(Vision-and-Language Navigation)エージェントは、現在の評価プロトコルは、主に半径3m以内で停止し、エージェントの最終向きと目標視認性を無視しているため、信頼性の高いオブジェクトレベルのグラウンドを確立するのに失敗しながら、従来の成功基準を満たす可能性がある。
我々は、この制限をLast-3-Meter Grounding Gapとして定式化し、近接精度、目標視認性、最終ビューグラウンド化を定量化するための3つのインスタンス中心メトリクスを導入する。
このギャップを緩和するために,長い水平ナビゲーションから接近する微粒なターゲットを分離するプラグイン・アンド・プレイ・アーキテクチャに依存しない改良モジュールであるREALM(Region-to-Entity Alignment for Last-3-Meter Navigation)を提案する。
REALMは、可視性を考慮した停止戦略を使用して、未熟な終了を減らし、最終的な視点アライメントを改善する。
さらに,最終段階の目標接近のための目標目標値と180K短距離トレーニングサンプルを提供するREVERIE-AIMを構築した。
4つの異なるVLNバックボーンの広範囲な評価は、REALMが常に近接精度と視覚的接地の成功を改善し、その広範囲な適用性を示していることを示している。
関連論文リスト
- Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation [23.72068584471195]
シー・アンド・リーチ・ナビゲーションでは、航空エージェントが初期ビューで見える言語指定のターゲットに接近し、その近くで確実に停止する必要がある。
既存の手法は通常、中間的な細粒度の空間決定を明示的にモデル化することなく、視覚言語表現を直接アクション出力にマッピングする。
そこで我々は,経路ポイント生成に先立って,視覚誘導型空間的議論を明示的に導入する,視覚言語による経路ポイント予測フレームワークDBFlyを提案する。
論文 参考訳(メタデータ) (2026-08-05T13:27:07Z) - See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View [22.860978565302233]
UAV-VLN (UAV Vision-Language Navigation) は、一般に総合的な探索と到達の問題として定式化されている。
UAV-VLN-FOVは,視線と視線を分離した目標視認可能なナビゲーションタスクである。
3DG-VLNは動的3次元方向の手がかりによって導かれる視覚言語ウェイポイント予測フレームワークである。
論文 参考訳(メタデータ) (2026-06-18T10:21:42Z) - RELO: Reinforcement Learning to Localize for Visual Object Tracking [70.27265738642956]
視覚的物体追跡のためのReinforcement-learning-to-LOcalize法であるRELOを紹介する。
RELOは、手作りの空間先行を空間的位置から学習した局所化ポリシーに置き換える。
我々は、RELOがテンプレート更新なしでLaSOText上で57.5%のAUCを達成することを示す。
論文 参考訳(メタデータ) (2026-05-08T07:34:29Z) - Multi-stage Planning for Multi-target Surveillance using Aircrafts Equipped with Synthetic Aperture Radars Aware of Target Visibility [40.94744872735617]
本稿では,合成開口レーダ(SAR)搭載航空機の軌道生成システムについて述べる。
深部強化学習で訓練された新しいニューラルネットワークを用いて、3次元地形に応じて目標視認性を最大化するストレート飛行セグメントを予測する。
このシステムは,3次元地形と目標視認性,リアルタイム性能を意識した高品質なマルチターゲットSAR画像取得を実現する。
論文 参考訳(メタデータ) (2026-04-18T11:04:25Z) - AgentVLN: Towards Agentic Vision-and-Language Navigation [78.739525400071]
VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
論文 参考訳(メタデータ) (2026-03-18T12:43:47Z) - IoUCert: Robustness Verification for Anchor-based Object Detectors [58.35703549470485]
IoUCertは、アンカーベースのオブジェクト検出アーキテクチャにおいて、これらのボトルネックを克服するために設計された、新しい形式的検証フレームワークである。
本手法は, SSD, YOLOv2, YOLOv3など, 現実的なアンカーベースモデルの各種入力摂動に対するロバスト性検証を可能にする。
論文 参考訳(メタデータ) (2026-03-03T14:36:46Z) - 3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting [12.057873540714098]
3DGSNavは、3D Gaussian Splatting (3DGS)を視覚言語モデル(VLM)の永続メモリとして組み込んで空間推論を強化する新しいフレームワークである。
3DGSNavは環境の3DGS表現を段階的に構築し、フロンティア対応のファーストパーソンビューの軌跡誘導自由視点レンダリングを可能にする。
ナビゲーション中、リアルタイムオブジェクト検出器が潜在的なターゲットをフィルタリングし、VLM駆動のアクティブな視点スイッチングがターゲットを再検証する。
論文 参考訳(メタデータ) (2026-02-12T16:41:26Z) - TransBridge: Boost 3D Object Detection by Scene-Level Completion with Transformer Decoder [66.22997415145467]
本稿では,スパース領域における検出機能を改善する共同補完・検出フレームワークを提案する。
具体的には,トランスブリッジ(TransBridge)を提案する。トランスブリッジ(TransBridge)はトランスフォーマーをベースとした新しいアップサンプリングブロックである。
その結果,本フレームワークは,各手法の平均精度(mAP)が0.7から1.5の範囲で,エンドツーエンドの3Dオブジェクト検出を一貫して改善していることがわかった。
論文 参考訳(メタデータ) (2025-12-12T00:08:03Z) - Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation [54.04601077224252]
身近なシーン理解には、視覚空間情報の理解だけでなく、3D物理世界における次の探索場所の決定も必要である。
アンダーラインテキストbf3D視覚言語学習は、エンボディエージェントが環境を効果的に探索し理解することを可能にする。
モデルの汎用性は、カテゴリ、言語記述、参照イメージなど、多様な入力モダリティを使ったナビゲーションを可能にする。
論文 参考訳(メタデータ) (2025-07-05T14:15:52Z) - SemNav: A Model-Based Planner for Zero-Shot Object Goal Navigation Using Vision-Foundation Models [10.671262416557704]
Vision Foundation Models (VFM) は視覚的理解と推論に強力な機能を提供する。
本稿では,VFMの知覚的強度をモデルベースプランナと統合したゼロショットオブジェクトゴールナビゲーションフレームワークを提案する。
本研究では,Habitatシミュレータを用いてHM3Dデータセットに対するアプローチを評価し,提案手法が最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2025-06-04T03:04:54Z) - Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation [64.84996994779443]
本稿では,連続視覚言語ナビゲーション(VLN)タスクのためのAffordances-Oriented Plannerを提案する。
我々のAO-Plannerは、様々な基礎モデルを統合して、アベイランス指向の低レベルな動き計画とハイレベルな意思決定を実現する。
挑戦的なR2R-CEデータセットとRxR-CEデータセットの実験は、AO-Plannerが最先端のゼロショットのパフォーマンスを達成したことを示している。
論文 参考訳(メタデータ) (2024-07-08T12:52:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。