論文の概要: Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.23181v1
- Date: Sat, 25 Jul 2026 12:26:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.009043
- Title: Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation
- Title(参考訳): 視覚言語ナビゲーションのための2脳最小表現に向けて
- Abstract要約: BrainNavはMinimum Sufficiencyの原則に基づくナビゲーションフレームワークである。
BrainNavは、3つのコンポーネントで構成されている: 命令対応の選択的知覚を実装する論理アンカーモデル、ミニマリスト制約アライメントモジュール、圧縮ワールドモデル。
実験の結果、BrainNavはR2R-CE val-unseenではSR/SPLで2.0%/1.0、RxR-CE val-unseenでは0.94%/0.78の改善が見られた。
- 参考スコア(独自算出の注目度): 32.00869718735648
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-and-Language Navigation in continuous environments (VLN-CE) requires an agent to ground language in egocentric observations and plan in unseen scenes. Although recent multimodal large models and world-model-based methods have improved navigation, they often preserve excessive task-irrelevant detail, weakening generalization and increasing computational burden. We propose BrainNav, a navigation framework grounded in the Principle of Minimal Sufficiency. BrainNav consists of three components: a Logical Anchor Model that implements instruction-aware selective perception to suppress environmental noise, a Minimalist Constraint Alignment module that serves as a compact cross-modal bottleneck, efficiently synchronizing discrete linguistic intent with continuous latent dynamics while filtering out redundant information, and a Compression World Model that predicts action-conditioned states within a condensed, low-rank latent space. These modules align semantic intent with spatial perception, enhancing the agent's robustness and efficiency in complex tasks. Experiments show that BrainNav improves over prior SOTA by 2.0 % / 1.0 in SR/SPL on R2R-CE val-unseen and 0.94 % / 0.78 on RxR-CE val-unseen. These results indicate that minimally sufficient world representations provide an effective foundation for robust VLN.
- Abstract(参考訳): VLN-CE (Vision-and-Language Navigation in Continuous Environment) では、エゴセントリックな観察や、見えない場面での計画において、エージェントが言語を接地させる必要がある。
近年のマルチモーダルな大規模モデルや世界モデルに基づく手法はナビゲーションを改善しているが、過剰なタスク関連の詳細を保存し、一般化を弱め、計算負荷を増大させることが多い。
本稿では,最小充足原理に基づくナビゲーションフレームワークBrainNavを提案する。
BrainNavは、3つのコンポーネントで構成されている: 環境ノイズを抑制するために命令対応の選択的知覚を実装する論理アンカーモデル、コンパクトなクロスモーダルボトルネックとして機能するミニマリスト制約アライメントモジュール。
これらのモジュールは意味的意図を空間的知覚と一致させ、複雑なタスクにおけるエージェントの堅牢性と効率を高める。
実験の結果、BrainNavはR2R-CE val-unseenではSR/SPLで2.0%/1.0、RxR-CE val-unseenでは0.94%/0.78の改善が見られた。
これらの結果は、最小限に十分な世界表現がロバストなVLNの有効基盤となることを示している。
関連論文リスト
- Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation [68.02899606570223]
本稿では,効率的なエンボディナビゲーションのための統合フレームワークであるTAMP-Navを提案する。
まず、ナビゲーションを2次元の視覚座標に再構成するPixel-to-3D Action Formulation(Point)を導入する。
次に,Selective Reasoning and Anchor-Trajectory Memory Mechanism (Think and Memorize)を提案する。
論文 参考訳(メタデータ) (2026-08-18T08:37:08Z) - Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation [15.851694572297612]
VLN-CE(Vision-Language Navigation in Continuous Environments)は、自律的なエージェントに深刻な課題をもたらす。
既存のアプローチは、シーン理解の制限、非効率な計画、堅牢な意思決定フレームワークの欠如など、長期的なタスクでしばしば失敗する。
我々は、VLN-CEを3つの相乗的革新によって再定義する画期的なアプローチである textbfHierarchical Semantic-Augmented Navigation (HSAN) フレームワークを紹介した。
論文 参考訳(メタデータ) (2026-06-01T02:11:01Z) - What Limits Vision-and-Language Navigation ? [18.423144111320592]
StereoNavは、現実世界のナビゲーションの一貫性を高めるために設計された、堅牢なVision-Language-Actionフレームワークである。
R2R-CEとRxR-CEの実験は、StereoNavが最先端のエゴセントリックなRGB性能を達成することを示した。
論文 参考訳(メタデータ) (2026-05-13T10:41:24Z) - FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation [20.13280678867453]
FineCog-Navは、ナビゲーションを言語処理、知覚、注意、記憶、想像、推論、意思決定のためのきめ細かいモジュールに整理する。
FineCog-Navは、命令順守、長期計画、そして目に見えない環境への一般化において、ゼロショットベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-17T17:59:48Z) - AgentVLN: Towards Agentic Vision-and-Language Navigation [78.739525400071]
VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
論文 参考訳(メタデータ) (2026-03-18T12:43:47Z) - AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control [20.1849703990752]
無人航空機(UAV)のための視覚言語ナビゲーション(VLN)は複雑な視覚的解釈と3D環境の連続的な制御を必要とする。
AerialVLAは、生の視覚観察とファジィ言語指示を直接連続的な物理制御信号にマッピングする、最小限のエンドツーエンドビジョン・ランゲージ・アクション・フレームワークである。
論文 参考訳(メタデータ) (2026-03-15T13:02:13Z) - One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation [18.529673835965745]
ナビゲート可能なエージェントは、高いレベルの意味的指示と正確な空間知覚の両方を理解する必要がある。
本稿では,低レベルの空間状態推定と高レベルのセマンティックプランニングを分離する疎結合設計を提案する。
我々はシミュレートされた環境と実世界の環境の両方で包括的な実験を行う。
論文 参考訳(メタデータ) (2026-02-17T07:13:48Z) - AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild [62.47761809929869]
視覚言語ナビゲーション(VLN)は、視覚的観察とともに言語指示を解釈することで、知的エージェントが環境をナビゲートする必要がある。
無人航空機(UAV)の現在のVLN研究は、所定のルートに沿ってUAVを誘導するための詳細な指示に依存している。
本稿では,自律型UAVナビゲーションのためのエンド・ツー・エンドのビジョン・ランゲージ・アクションモデルであるAutoFlyを提案する。
論文 参考訳(メタデータ) (2026-02-10T11:08:07Z) - VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation [52.00474922315126]
未確認環境のための視覚言語ナビゲーションフレームワークであるVLN-Zeroを提案する。
我々は視覚言語モデルを用いて、記号的なシーングラフを効率的に構築し、ゼロショットのニューロシンボリックナビゲーションを可能にする。
VLN-Zeroは、最先端のゼロショットモデルと比べて2倍の成功率を獲得し、最も微調整されたベースラインを上回り、半分の時間でゴール地点に達する。
論文 参考訳(メタデータ) (2025-09-23T03:23:03Z) - NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning [97.88246428240872]
Embodied AIの重要な研究課題であるVision-and-Language Navigation (VLN)は、自然言語の指示に従って複雑な3D環境をナビゲートするために、エンボディエージェントを必要とする。
近年の研究では、ナビゲーションの推論精度と解釈可能性を改善することにより、VLNにおける大きな言語モデル(LLM)の有望な能力を強調している。
本稿では,自己誘導型ナビゲーション決定を実現するために,パラメータ効率の高いドメイン内トレーニングを実現する,Navigational Chain-of-Thought (NavCoT) という新しい戦略を提案する。
論文 参考訳(メタデータ) (2024-03-12T07:27:02Z) - CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation [73.78984332354636]
CorNavは視覚・言語ナビゲーションのための新しいゼロショットフレームワークである。
将来の計画の見直しや行動調整のための環境フィードバックが組み込まれている。
ゼロショットマルチタスク設定ですべてのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2023-06-17T11:44:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。