論文の概要: EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness
- arxiv url: http://arxiv.org/abs/2607.19880v2
- Date: Wed, 29 Jul 2026 15:29:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 16:47:49.714168
- Title: EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness
- Title(参考訳): EA-Nav: 身体認識による安全なビジュアルナビゲーションポリシーの学習
- Abstract要約: クロス・エボディメント・ナビゲーションは、インテリジェンスにとって重要な課題である。
本稿では,モジュール型マルチステージ設計を用いた模倣学習型エボディメント対応ナビゲーションフレームワークを提案する。
実験の結果,提案手法は異なる実施環境におけるナビゲーション性能を効果的に向上することが示された。
- 参考スコア(独自算出の注目度): 22.656430784852404
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-embodiment navigation is a key challenge in embodied intelligence. Due to differences in embodiment, the same visual observation may imply different actions for different agents, making prediction ambiguous when relying solely on vision. Existing studies mainly rely on reinforcement learning, which requires large-scale interaction and careful reward design, making it difficult to support scalable pretraining and real-world adaptation. In contrast, imitation-learning-based approaches remain limited. To address these challenges, we propose an imitation-learning-based embodiment-aware navigation framework with a modular multi-stage design. In pretraining, we construct a cross-embodiment navigation dataset from Internet videos and introduce embodiment geometry as conditional tokens to reduce action ambiguity under the same observation. In fine-tuning, we design a multimodal information injection mechanism based on a decoupled architecture. Specifically, we design a trajectory augmentation strategy to generate high-risk samples, which are used to train spatial perception and risk-aware correction separately, thereby explicitly incorporating embodiment geometry for safe navigation. Experimental results show that the proposed method effectively improves navigation performance across different embodiment settings, demonstrating the effectiveness of incorporating embodiment geometry into embodied navigation.
- Abstract(参考訳): クロス・エボディメント・ナビゲーションは、インテリジェンスにとって重要な課題である。
実施形態の違いにより、同じ視覚的観察は異なるエージェントに対して異なる行動を示す可能性があり、視覚のみに依存すると予測が曖昧になる。
既存の研究は主に強化学習に依存しており、大規模な相互作用と注意深い報酬設計を必要とするため、スケーラブルな事前学習と実世界の適応を支援することは困難である。
対照的に、模倣学習に基づくアプローチは依然として限られている。
これらの課題に対処するために,モジュール型多段階設計による模倣学習に基づく実施型ナビゲーションフレームワークを提案する。
プレトレーニングでは,インターネットビデオからのクロスボデーメントナビゲーションデータセットを構築し,同じ観察下での動作のあいまいさを軽減するために,条件付きトークンとして具体化幾何学を導入する。
微調整では、疎結合アーキテクチャに基づくマルチモーダル情報注入機構を設計する。
具体的には、空間認識とリスク認識補正を個別に訓練するために使用される高リスクサンプルを生成するための軌道拡張戦略を設計し、安全ナビゲーションのためのエンボディメント幾何を明示的に取り入れる。
実験の結果, 提案手法は, 異なる実施環境におけるナビゲーション性能を効果的に向上し, 実施ナビゲーションにエンボディメント幾何を組み込むことの有効性を実証した。
関連論文リスト
- Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning [45.2217589644315]
PointGoalナビゲーションにおける視覚表現学習のためのセンサ誘導適応型コントラスト学習フレームワークを提案する。
トレーニング中、特権付きLiDARセンシングは、幾何学的類似度メトリックと適応温度スケーリングを通じて、対照的な目標を導出する。
得られたエンコーダは、独立して事前訓練され、凍結され、強化学習のバックボーンとして使用される。
論文 参考訳(メタデータ) (2026-06-03T23:15:50Z) - \textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - Less Is More: Scalable Visual Navigation from Limited Data [19.38572888745551]
古典的幾何学的プランナーをいかに利用して,コストのかかる人間の実証を補完する合成軌道を生成するかを示す。
我々は、トランスフォーマーベースのビジュアルナビゲーションポリシーであるLess is More (LiMo)を訓練し、プランナーが生成する監督による限られた専門家によるデモンストレーションが、かなりのパフォーマンス向上をもたらすことを発見した。
論文 参考訳(メタデータ) (2026-01-25T12:44:23Z) - VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory [43.2995099083993]
VLAモデルは、認識と計画を統合することで、航法を具現化する有望な可能性を示してきた。
既存のVLAモデルは、観察から行動へのリアクティブマッピングに直接依存している。
VLingNav(VLAモデル)を提案する。
論文 参考訳(メタデータ) (2026-01-13T15:43:43Z) - From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning [59.88543114325153]
本稿では,航法基礎モデルの強化学習能力を高めるためのSeeing-to-Experiencingフレームワークを提案する。
S2Eは、ビデオの事前トレーニングとRLによるポストトレーニングの長所を組み合わせたものだ。
実世界のシーンを3DGSで再現した3D画像に基づく総合的なエンドツーエンド評価ベンチマークであるNavBench-GSを構築した。
論文 参考訳(メタデータ) (2025-07-29T17:26:10Z) - RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation [57.197881161006904]
近年のイメージゴールナビゲーション(ImageNav)手法は,目標と自我中心の画像の意味的特徴を別々に捉え,知覚行動ポリシーを学習している。
本稿では,目標と現在の観測値の空間的関係をナビゲーションガイダンスとして考慮する,シンプルで効果的な手法であるRSRNavを提案する。
論文 参考訳(メタデータ) (2025-04-25T00:22:17Z) - Virtual Guidance as a Mid-level Representation for Navigation with Augmented Reality [7.873411316161205]
視覚的でない命令信号を視覚的に表現する「仮想誘導」技術を紹介する。
これらの視覚的手がかりは、エージェントのカメラビューにオーバーレイされ、分かりやすいナビゲーション誘導信号として機能する。
論文 参考訳(メタデータ) (2023-03-05T17:55:15Z) - Contrastive Instruction-Trajectory Learning for Vision-Language
Navigation [66.16980504844233]
視覚言語ナビゲーション(VLN)タスクでは、エージェントが自然言語の指示でターゲットに到達する必要がある。
先行研究は、命令-軌道対間の類似点と相違点を識別できず、サブ命令の時間的連続性を無視する。
本稿では、類似したデータサンプル間の分散と、異なるデータサンプル間の分散を探索し、ロバストなナビゲーションのための独特な表現を学習するContrastive Instruction-Trajectory Learningフレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-08T06:32:52Z) - Congestion-aware Multi-agent Trajectory Prediction for Collision
Avoidance [110.63037190641414]
渋滞パターンを明示的に学習し、新しい「センス--学習--Reason--予測」フレームワークを考案する。
学習段階を2段階に分解することで、「学生」は「教師」から文脈的手がかりを学習し、衝突のない軌跡を生成する。
実験では,提案モデルが合成データセットにおいて衝突のない軌道予測を生成できることを実証する。
論文 参考訳(メタデータ) (2021-03-26T02:42:33Z) - Language-guided Navigation via Cross-Modal Grounding and Alternate
Adversarial Learning [66.9937776799536]
新たなビジョン・アンド・ランゲージナビゲーション(VLN)問題は、見えない写真リアリスティック環境において、エージェントがターゲットの場所に向かうことを学習することを目的としている。
VLNの主な課題は、主に2つの側面から生じている: まず、エージェントは動的に変化する視覚環境に対応する言語命令の有意義な段落に出席する必要がある。
そこで本稿では,エージェントにテキストと視覚の対応性を追跡する機能を持たせるために,クロスモーダルグラウンドモジュールを提案する。
論文 参考訳(メタデータ) (2020-11-22T09:13:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。