論文の概要: Air-Ground Collaborative Vision-and-Language Navigation via Shared Bird's-Eye Maps
- arxiv url: http://arxiv.org/abs/2609.03483v3
- Date: Tue, 08 Sep 2026 08:06:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.864794
- Title: Air-Ground Collaborative Vision-and-Language Navigation via Shared Bird's-Eye Maps
- Title(参考訳): 共有した鳥のEyeマップによる空域協調型視覚・言語ナビゲーション
- Authors: Shuning Zhang, Liang Li, Yunheng Wang, Tao Wang, Yihang Kang, Renjing Xu,
- Abstract要約: VLN(Var-ground collaborative Vision-and-Language Navigation)は、無人航空機(UAV)とグローバルな鳥眼ビュー、無人地上車両(UGV)と、ローカルなファーストパーソンビューのペアである。
AGC-VLN(Air-Ground Collaborative VLN, Air-Ground Collaborative VLN)は,空対地共同VLNのためのトレーニングフリーベースラインである。
CARLA-Air's Town10HDシーンにおける100回の閉ループエピソードにおいて、AGC-VLNは77.0%のジョイント成功率に達し、より弱い個々のエージェントに対して+27.0%のコラボレーションゲインを得た。
- 参考スコア(独自算出の注目度): 23.62701600758693
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Air-ground collaborative Vision-and-Language Navigation (VLN) pairs an unmanned aerial vehicle (UAV) with a global bird's-eye view and an unmanned ground vehicle (UGV) with a local first-person view, yet the setting remains largely unexplored: existing training-free methods solve single-agent tasks but offer no collaboration mechanism, and a recent CARLA-Air evaluation found no stable cooperative behavior across five state-of-the-art VLA models; naive semantic communication or bidirectional coupling even degrades performance. We establish AGC-VLN (Air-Ground Collaborative VLN), the first training-free baseline for air-ground collaborative VLN. The key insight is that training-free methods decompose navigation into VLM-based semantic reasoning and deterministic geometric execution, exposing a collaboration interface: the UAV's global view, over which it renders the UGV's reported pose and the VLM-anchored target as CAR/GOAL markers with distance labels, yielding a shared bird's-eye map. From this map, the UGV acquires global spatial context its first-person view cannot provide, plans a road-following path with a frozen VLM, and executes it under closed-loop control; in parallel, the UAV runs 3D-SPF, a spatial-search upgrade of SPF that localizes the target in the downward view and flies toward it. On 100 closed-loop episodes in CARLA-Air's Town10HD scene, AGC-VLN reaches a 77.0% joint success rate, a collaboration gain of +27.0% over the weaker individual agent (the UAV, 50.0%), and exceeds the strongest published single-agent baseline (Travel UAV, 53.0%) by 24.0 points, stemming from the complementarity of the UAV's global view and the UGV's road-following execution. Project page: https://github.com/ZSN2024/AGC-VLN.
- Abstract(参考訳): VLN(Var-ground collaborative Vision-and-Language Navigation)は、無人航空機(UAV)とグローバルな鳥眼ビュー(UGV)とローカルなファーストパーソンビュー(UGV)をペアリングするが、既存のトレーニング不要の手法は単一エージェントタスクを解決しているが協調メカニズムは提供せず、最近のCARLA-Air評価では、5つの最先端VLAモデル間で安定した協調動作は見つからず、ナイーブなセマンティックコミュニケーションや双方向結合は性能を低下させる。
AGC-VLN(Air-Ground Collaborative VLN, Air-Ground Collaborative VLN)は,空対地共同VLNのためのトレーニングフリーベースラインである。
重要な洞察は、トレーニングフリーメソッドがナビゲーションをVLMベースのセマンティック推論と決定論的幾何学的実行に分解し、UGVの報告されたポーズをレンダリングするUAVのグローバルビューと、距離ラベル付きCAR/GOALマーカーとしてVLMアンカレッドターゲットとして表示し、共有された鳥眼マップを生成する、協調インターフェースを公開することである。
このマップから、UGVは、その一人称視点では提供できないグローバル空間コンテキストを取得し、凍結したVLMで道路追従経路を計画し、クローズドループ制御の下で実行し、同時に、UAVは3D-SPF(SPFの空間探索アップグレード)を実行し、下向きの視野でターゲットをローカライズし、それに向かって飛行する。
CARLA-Air's Town10HDの100回のクローズループエピソードでは、AGC-VLNは77.0%のジョイント成功率、より弱い個々のエージェント(UAV:50.0%)よりも+27.0%のコラボレーションゲインに達し、UAVのグローバルビューとUGVのロードフォロー実行の相補性から、最も強力なシングルエージェントベースライン(Travel UAV:53.0%)を24.0ポイント越えている。
プロジェクトページ:https://github.com/ZSN2024/AGC-VLN。
関連論文リスト
- AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning [28.18995637655191]
地上共同推論における視覚言語モデル(VLM)の評価のためのベンチマークであるAeroGroundを紹介する。
AeroGroundは、様々なオープン環境から約29,000のマルチモーダル観測グループを含む、模擬空中地上データセット上に構築されている。
実験では、現在のモデルと人間のパフォーマンスの間に大きなギャップがあり、最良のモデルの平均精度は54.4%、人間は93.3%に達する。
論文 参考訳(メタデータ) (2026-08-12T07:31:15Z) - CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning [36.051483242181014]
航空プラットフォーム上の目標指向の視覚・言語ナビゲーション(VLN)は、災害救助、インフラ検査、セキュリティパトロールといったミッションに注目が集まっている。
ここでは,高高度リーダと低高度従者の間のStackelbergゲームとしてタスクを明示的にモデル化するCoNav-UAVを提案する。
論文 参考訳(メタデータ) (2026-08-03T07:10:38Z) - Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air [2.061094726550731]
単UAV能力が地上協力に移行できるかどうかについて検討する。
1つのUnreal Engineランタイム内にCARLAとAirSimを統合するシングルプロセス評価環境であるCARLA-Airを使用する。
その結果、現在の航空VLAモデルは、しばしば地上のパートナーを追跡したり追ったりすることができるが、この単一エージェントの能力を安定した協調行動に変換するのに苦労していることがわかった。
論文 参考訳(メタデータ) (2026-05-29T09:36:08Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation [51.286599397552756]
本稿では,UAVの絶対位置と近距離からの進路を共同で予測する視覚駆動型クロスビューナビゲーション手法であるBering-UAVを提案する。
我々はまた、クロスビューのローカライゼーションとナビゲーションを評価するベンチマークである Bearing-UAV-90k も提示する。
論文 参考訳(メタデータ) (2026-03-23T16:17:39Z) - AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation [34.63571674882289]
航空ビジョン・アンド・ランゲージナビゲーション(Aerial Vision-and-Language Navigation、VLN)は、無人航空機(Unmanned Aerial Vehicles、UAV)が自然言語命令と視覚的手がかりを用いて屋外環境をナビゲートすることを可能にする新しいタスクである。
我々はDuAl-VLN(DuAl-VLN)と呼ばれる新しいタスクを導入する。
このタスクでは、2つのUAVが異なる高度で運用される: 広範囲の環境推論に責任を負う高高度UAVと、正確なナビゲーションを行う低高度UAVである。
論文 参考訳(メタデータ) (2025-08-21T04:43:35Z) - AGC-Drive: A Large-Scale Dataset for Real-World Aerial-Ground Collaboration in Driving Scenarios [68.84774511206797]
AGC-DriveはAerial-Ground Cooperativeの3D知覚のための最初の大規模実世界のデータセットである。
AGC-Driveには350のシーンがあり、それぞれ約100のフレームと13のオブジェクトカテゴリをカバーする完全な注釈付き3Dバウンディングボックスがある。
車両間協調認識と車両間協調認識の2つの3次元タスクのベンチマークを提供する。
論文 参考訳(メタデータ) (2025-06-19T14:48:43Z) - Exploring the best way for UAV visual localization under Low-altitude Multi-view Observation Condition: a Benchmark [6.693781685584959]
高度の低い多視点UAV AVLは、極端な視点の変化による大きな課題を提示する。
このベンチマークでは、低高度多視点UAV AVLの課題を明らかにし、将来の研究に貴重なガイダンスを提供した。
論文 参考訳(メタデータ) (2025-03-12T03:29:27Z) - A Multi-UAV System for Exploration and Target Finding in Cluttered and
GPS-Denied Environments [68.31522961125589]
複雑なGPSを用いた複雑な環境において,UAVのチームが協調して目標を探索し,発見するための枠組みを提案する。
UAVのチームは自律的にナビゲートし、探索し、検出し、既知の地図で散らばった環境でターゲットを見つける。
その結果, 提案方式は, 時間的コスト, 調査対象地域の割合, 捜索・救助ミッションの成功率などの面で改善されていることがわかった。
論文 参考訳(メタデータ) (2021-07-19T12:54:04Z) - Attention-based Reinforcement Learning for Real-Time UAV Semantic
Communication [53.46235596543596]
移動地利用者に対する空対地超信頼性・低遅延通信(URLLC)の問題点について検討する。
グラフアテンション交換ネットワーク(GAXNet)を用いたマルチエージェント深層強化学習フレームワークを提案する。
GAXNetは、最先端のベースラインフレームワークと比較して、0.0000001エラー率で6.5倍のレイテンシを実現している。
論文 参考訳(メタデータ) (2021-05-22T12:43:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。