論文の概要: CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation
- arxiv url: http://arxiv.org/abs/2608.29114v1
- Date: Sat, 29 Aug 2026 07:54:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.842829
- Title: CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation
- Title(参考訳): CGFM-Nav:セマンティックガイド型マルチモーダル・エボダイドナビゲーションのための認知グラフフィールドメモリ
- Authors: Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti,
- Abstract要約: VLN(Vision-and-Language Navigation)は、未確認領域を継続的に探索しながら、蓄積した観測をエージェントが推論する必要がある。
我々は,永続的なマルチモーダルシーン表現である認知グラフフィールドメモリ(CGFM)を提案する。
CGFM上に構築されたCGFM-Navは,生涯にわたるマルチモーダルナビゲーションのための基盤モデルに基づくフレームワークである。
- 参考スコア(独自算出の注目度): 15.24487734405541
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-and-Language Navigation (VLN) requires agents to reason over accumulated observations while continuously exploring unseen regions. However, existing environment representations often struggle to jointly support explicit semantic memory and continuous exploration guidance. To address this challenge, we propose Cognitive Graph-Field Memory (CGFM), a persistent multimodal scene representation that couples explicit relational memory with continuous spatial intuition. CGFM organizes objects, spatial relations, and visual observations into a multimodal scene graph, enabling target retrieval and long-horizon reasoning across navigation tasks. When no reliable target match is identified, graph-based evidence is projected into a goal-conditioned semantic-frontier field to guide exploration toward semantically promising frontiers and regions. Building upon CGFM, we introduce CGFM-Nav, a foundation-model-based framework for lifelong multimodal navigation that integrates task-relevant subgraph selection, VLM reasoning, and verification feedback into a closed decision loop. Preliminary experiments on GOAT-Bench show that, under the same Qwen3-VL-8B backbone, CGFM-Nav improves the overall success rate from 53.2% to 63.0% and SPL from 30.0% to 39.6%, demonstrating the effectiveness of combining explicit semantic memory with semantic-guided exploration.
- Abstract(参考訳): VLN(Vision-and-Language Navigation)は、未確認領域を継続的に探索しながら、蓄積した観測をエージェントが推論する必要がある。
しかしながら、既存の環境表現は、明示的なセマンティックメモリと継続的な探索ガイダンスを共同でサポートするのに苦労することが多い。
この課題に対処するために、連続空間直観と明示的リレーショナルメモリを結合した永続的マルチモーダルシーン表現であるコグニティブグラフフィールドメモリ(CGFM)を提案する。
CGFMは、オブジェクト、空間的関係、視覚的な観察をマルチモーダルなシーングラフに整理し、ナビゲーションタスク間のターゲット検索と長距離推論を可能にする。
信頼できるターゲットマッチングが特定されない場合、グラフベースのエビデンスをゴール条件付きセマンティックフロンティアフィールドに投影し、セマンティックに有望なフロンティアや領域への探索を導く。
CGFM上に構築されたCGFM-Navは,タスク関連サブグラフの選択,VLM推論,検証フィードバックを閉決定ループに統合した,生涯にわたるマルチモーダルナビゲーションのための基盤モデルに基づくフレームワークである。
GOAT-Benchの予備実験では、同じQwen3-VL-8Bバックボーンの下でCGFM-Navは、全体的な成功率を53.2%から63.0%に改善し、SPLは30.0%から39.6%に改善し、セマンティックガイドによる探索と明示的なセマンティックメモリの組み合わせの有効性を示した。
関連論文リスト
- STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation [17.685326212060716]
本研究では,従来のシーングラフを相補的空間軸,時間軸に沿ってイベントグラフに拡張する学習自由フレームワークを提案する。
STEGNavは、GOAT-Benchで66.3%のSRと39.7のSPL、HM3D1とHM3Dv2でそれぞれ64.0%と69.4%を達成している。
論文 参考訳(メタデータ) (2026-08-28T12:42:16Z) - From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation [40.51712647240084]
UAVビジョン言語ナビゲーション(UAV-VLN)は、空のエージェントがオープンな3D環境で自然言語の指示に従うことを可能にすることに焦点を当てている。
現在のアプローチは、視覚的な観察における命令関連ランドマークの弱い接地、長距離履歴の不十分な活用、局所的なトラップや反復的な探索による不安定な決定の3つの複合的な問題に悩まされている。
これらの問題に対処する統合的意味決定フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-10T12:59:50Z) - VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation [55.45263611374435]
エージェントが同じシーンで繰り返し操作し、自己獲得経験のみを保持し、モデルパラメータを固定するクロスエポソードオブジェクトゴールナビゲーションを提案する。
経験の再利用を支援するために,永続的階層型ビジュアルトポロジカルメモリ(VTM)を用いたトレーニング不要なVLMナビゲーションフレームワークを提案する。
提案手法は,3つのベンチマークすべてで最高のパフォーマンスを実現し,データセット間の構造化視覚トポロジカルエクスペリエンスの再利用の有効性と堅牢性を示す。
論文 参考訳(メタデータ) (2026-07-16T03:11:37Z) - Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory [69.51256305550844]
PSC-AVDNは3段階のParsing-Search-Confirmation推論パイプラインを構造化空間記憶と密結合する学習自由フレームワークである。
PSC-AVDNは、トレーニング不要の設定、マッチング、あるいはいくつかの微調整されたメソッドの超越において、新しい最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-07-13T13:14:20Z) - IGV-RRT: Prior-Real-Time Observation Fusion for Active Object Search in Changing Environments [10.748685496551067]
本研究では,不確実性を認識したシーン先行状況とオンライン目標関連度推定を組み合わせた確率的計画手法を提案する。
このフレームワークは、2層セマンティックマッピングモジュールとリアルタイムプランナーを含んでいる。
提案手法は, 対象再配置の影響を効果的に軽減し, 探索効率の向上と成功率の向上を実現する。
論文 参考訳(メタデータ) (2026-03-23T12:14:26Z) - Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation [54.04601077224252]
身近なシーン理解には、視覚空間情報の理解だけでなく、3D物理世界における次の探索場所の決定も必要である。
アンダーラインテキストbf3D視覚言語学習は、エンボディエージェントが環境を効果的に探索し理解することを可能にする。
モデルの汎用性は、カテゴリ、言語記述、参照イメージなど、多様な入力モダリティを使ったナビゲーションを可能にする。
論文 参考訳(メタデータ) (2025-07-05T14:15:52Z) - Object Navigation with Structure-Semantic Reasoning-Based Multi-level Map and Multimodal Decision-Making LLM [18.406869393228813]
環境属性マップ(EAM)とMLLM階層推論モジュール(MHR)を用いたアクティブオブジェクトナビゲーションフレームワークを提案する。
EAMは、観測された環境をSBERTで推論し、観測されていない環境を拡散で予測することによって構築される。
MHRはEAMにインスパイアされてフロンティア探索決定を行い、長距離シナリオにおける回路軌道を避けて経路効率を向上させる。
論文 参考訳(メタデータ) (2025-06-06T09:08:40Z) - DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation [55.888688171010365]
DORAEMONは、人間のナビゲーション機能を模倣したVentralとDorsal Streamsで構成される、認知にインスパイアされたフレームワークである。
我々は,DORAEMONをHM3D,MP3D,GOATのデータセット上で評価し,成功率(SR)と成功度(SPL)の測定値の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-28T04:46:13Z) - Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation [1.2473780585666772]
多くのVision-and-Language Navigation (VLN)アルゴリズムは、視覚的常識の欠如と限られた推論能力のために不正確な決定をする傾向がある。
本稿では,階層的空間近接の知識基盤構築を支援するために,階層的空間近接推論(HSPR)手法を提案する。
我々は、REVERIE、SOON、R2R、R4Rなどの公開データセットで実験を行い、我々のアプローチを検証する。
論文 参考訳(メタデータ) (2024-03-18T07:51:22Z) - Structured Scene Memory for Vision-Language Navigation [155.63025602722712]
視覚言語ナビゲーション(VLN)のための重要なアーキテクチャを提案する。
ナビゲーション中に知覚を正確に記憶できるほど区画化されている。
また、環境内の視覚的および幾何学的な手がかりを捉え、取り除く、構造化されたシーン表現としても機能する。
論文 参考訳(メタデータ) (2021-03-05T03:41:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。