論文の概要: LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2605.09053v1
- Date: Sat, 09 May 2026 16:56:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.044572
- Title: LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation
- Title(参考訳): LCGNav:視覚言語ナビゲーションにおける一般位相計画のための局所的候補認識幾何学的拡張
- Abstract要約: トポロジカルVLNのためのモジュラー局所幾何拡張フレームワーク LCGNav を提案する。
LCGNavは、候補深度ビューを3Dポイントの雲に明示的に変換し、エージェントの到達範囲に基づいて物理的切り離しを適用する。
R2R-CEとRxR-CEの実験により、LCGNavは効果的なクロスアーキテクチャ拡張モジュールとして機能することが示された。
- 参考スコア(独自算出の注目度): 23.91940180651174
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Online topological planning has become an effective paradigm for Vision-Language Navigation in Continuous Environments (VLN-CE), but existing methods still suffer from two limitations: redundant local depth information and weakened focus on current frontier candidates as the topological graph grows. To address this, we propose LCGNav, a modular local geometric enhancement framework for topological VLN. LCGNav explicitly converts candidate depth views into 3D point clouds and applies physical truncation based on the agent's reachable range, enabling more compact local geometric modeling. It further introduces a dimension-preserving local fusion strategy with transient state degradation, so that geometric enhancement is applied only to the currently relevant ghost nodes without changing the original planner interface. Experiments on R2R-CE and RxR-CE show that LCGNav serves as an effective cross-architecture enhancement module, consistently improving multiple key metrics of representative online topological baselines with low additional training cost. When integrated with ETP-R1, LCGNav achieves the best performance among the compared online topological methods on the val-unseen splits of the R2R-CE and RxR-CE benchmarks. The code is available at https://github.com/shannanshouyin/LCGNav.
- Abstract(参考訳): オンライントポロジ計画(英語版)は、連続環境におけるビジョンランゲージナビゲーション(VLN-CE)の効果的なパラダイムとなっているが、既存の手法には、冗長な局所深度情報と、トポロジグラフが大きくなるにつれて現在のフロンティア候補へのフォーカスが弱まるという2つの制限がある。
そこで我々は,位相VLNのためのモジュラー局所幾何拡張フレームワーク LCGNav を提案する。
LCGNavは、候補の深度ビューを3Dポイントの雲に明示的に変換し、エージェントの到達範囲に基づいて物理的トランケーションを適用し、よりコンパクトな局所幾何学的モデリングを可能にする。
さらに、過渡状態劣化を伴う次元保存型局所核融合戦略を導入し、元のプランナーインタフェースを変更することなく、現在関連するゴーストノードのみに幾何的拡張を適用する。
R2R-CEとRxR-CEの実験では、LCGNavは効果的なクロスアーキテクチャ拡張モジュールとして機能し、オンライントポロジカルベースラインの代表的指標を継続的に改善し、トレーニングコストを下げている。
ETP-R1と統合されると、LCGNavはR2R-CEとRxR-CEのベンチマークで比較したオンライントポロジカル手法の中で最高の性能を達成する。
コードはhttps://github.com/shannanshouyin/LCGNavで公開されている。
関連論文リスト
- WGDnet: Wishart-guided Geometric-aware Deep Network for PolSAR Image Classification [19.620751108472216]
We propose WGDNet, a Wishart-guided geometry-aware deep network。
学習可能なウィッシュアート畳み込みと、多スケールの統計的エッジ特徴抽出のための方向性カーネルとの畳み込み、(2)方向のウィッシュアート出力を適応的に洗練するために支配的な局所方向と信頼を推定する方向優先アグリゲーションモジュール、(3)スケール指向適応型幾何認識畳み込みで、サンプリンググリッドを動的に再現し、異方性地形をモデル化し、細部を詳細に保持するGAnetという3つのコア設計を統合している。
4つの実PollSARデータセットによる評価により、WGDNetは分類精度と境界における既存の最先端アプローチを超えている。
論文 参考訳(メタデータ) (2026-07-26T13:04:02Z) - Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation [32.02017382315305]
Vision-Language Navigation (VLN) は、エンボディエージェントが言語命令に従うことで、見えない環境でターゲットの場所に到達することを可能にする。
近年の視覚言語モデル(VLM)の進歩にもかかわらず、重要な意味幾何学的ギャップが残っている。
本稿では3次元幾何学情報をVLMと互換性のある構造化表現に変換する階層型意味幾何学マップ(HSGM)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:53:21Z) - LG-HCC: Local Geometry-Aware Hierarchical Context Compression for 3D Gaussian Splatting [77.81227097905865]
アンカーベースの3DGS圧縮スキームは、いくつかの高度な文脈モデルを通してガウスの冗長性を減少させる。
本稿では, アンカープルーニングとエントロピー符号化にアンカー幾何学的相関を組み込んだ3DGSのための局所幾何学的階層型コンテキスト圧縮フレームワークを提案する。
実験の結果、LG-HCCは構造保存の問題を効果的に緩和し、Mip-NeRF360データセット上のScaffold-GSベースラインと比較して最大30.85倍のストレージを削減した。
論文 参考訳(メタデータ) (2026-03-30T13:39:35Z) - SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments [49.966170814478915]
UAV VLNのための幾何学誘導空間表現フレームワークを提案する。
明示的な3次元再構成を伴わないRGB観測において、SpatialFlyは幾何学誘導2次元表示アライメント機構を導入する。
実験結果から、SpatialFlyは現状のUAV VLNベースラインを目に見える環境と見えない環境の両方で一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-22T03:56:58Z) - AgentVLN: Towards Agentic Vision-and-Language Navigation [78.739525400071]
VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
論文 参考訳(メタデータ) (2026-03-18T12:43:47Z) - GeoGR: A Generative Retrieval Framework for Spatio-Temporal Aware POI Recommendation [15.009742536403763]
GeoGRはAMAPのようなナビゲーションベースのLBSに適した地理的生成レコメンデーションフレームワークである。
ユーザのコンテキスト状態の変化を認識し,意図を意識したPOIレコメンデーションを可能にする。
複数の実世界のデータセットに対する大規模な実験は、GeoGRが最先端のベースラインよりも優れていることを示している。
論文 参考訳(メタデータ) (2026-02-11T01:48:27Z) - Fly0: Decoupling Semantic Grounding from Geometric Planning for Zero-Shot Aerial Navigation [14.466092698477858]
現在のVisual-Language Navigation (VLN) 手法はセマンティック理解と制御精度のトレードオフに直面している。
幾何学的計画から意味論的推論を分離するフレームワークFly0を提案する。
Fly0は計算オーバーヘッドを減らし、システムの安定性を向上させる。
論文 参考訳(メタデータ) (2026-02-02T09:06:50Z) - USS-Nav: Unified Spatio-Semantic Scene Graph for Lightweight UAV Zero-Shot Object Navigation [10.934912400963588]
USS-Navは、Unified Spatio-Semanticのシーングラフをインクリメンタルに構築する軽量フレームワークである。
未知環境での効率的なLarge Language Model (LLM)拡張Zero-Shot Object Navigationを可能にする。
我々のフレームワークは、計算効率とリアルタイム更新頻度の点で最先端の手法より優れています。
論文 参考訳(メタデータ) (2026-01-31T13:10:02Z) - Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation [22.876516699004814]
VLN-CE(Vision-Language Navigation in Continuous Environments)は、高レベルの言語命令を正確で安全で長期の空間行動に基礎付けるという、中核的な課題を提示している。
露骨なトポロジカルマップは、そのようなタスクにおいて堅牢な空間記憶を提供するための重要な解決策であることが証明されている。
既存のトポロジカルプランニング手法は、"Granularity Rigidity"問題に悩まされている。
本研究では,動的トポロジカルナビゲーションのためのフレームワークであるDGNavを提案する。
論文 参考訳(メタデータ) (2026-01-29T14:06:23Z) - MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation [59.75554954111619]
マルチビュー3D参照表現(MV-3DRES)を導入し、モデルがシーン構造を復元し、参照対象をスパースなマルチビュー画像から直接セグメント化する必要がある。
本稿では,言語情報をスパースビュー幾何学的推論に組み込む,効率的なエンドツーエンドフレームワークであるMultimodal Visual Geometry Grounded Transformer (MVGGT)を提案する。
実験により、MVGGTは最初の強力なベースラインを確立し、高精度かつ高速な推論を達成し、既存の選択肢よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-01-11T11:44:07Z) - ETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous Environments [24.809501651450223]
VLN-CE(Vision-Language Navigation in Continuous Environments)は、連続環境においてターゲットに向かって移動するために、エンボディエージェントを必要とする。
現在のグラフベースの手法は、環境をトポロジマップに抽象化し、アクション空間をウェイポイント選択に単純化することで、効率的で構造化されたアプローチを提供する。
グラフベースのVLN-CEモデルにデータスケーリングと強化ファインチューニング(RFT)のパラダイムを適用するフレームワークであるETP-R1を紹介する。
論文 参考訳(メタデータ) (2025-12-24T04:53:03Z) - Boosting Cross-Domain Point Classification via Distilling Relational Priors from 2D Transformers [59.0181939916084]
従来の3Dネットワークは主に局所幾何学的詳細に焦点を当て、局所幾何学間の位相構造を無視する。
そこで本稿では,大規模画像上においてよく訓練されたトランスフォーマーから前駆体を抽出する,新しい先駆体蒸留法を提案する。
PointDA-10とSim-to-Realデータセットの実験は、提案手法が点クラウド分類におけるUDAの最先端性能を一貫して達成していることを検証する。
論文 参考訳(メタデータ) (2024-07-26T06:29:09Z) - Think Global, Act Local: Dual-scale Graph Transformer for
Vision-and-Language Navigation [87.03299519917019]
本稿では,2次元グラフ変換器 (DUET) を提案する。
我々は,グローバルな行動空間における効率的な探索を可能にするために,トポロジカルマップをオンザフライで構築する。
提案手法であるDUETは、目標指向の視覚・言語ナビゲーションベンチマークにおいて最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2022-02-23T19:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。