論文の概要: AirNav: A Large-Scale Real-World UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions
- arxiv url: http://arxiv.org/abs/2601.03707v1
- Date: Wed, 07 Jan 2026 08:46:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-09 02:15:23.380196
- Title: AirNav: A Large-Scale Real-World UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions
- Title(参考訳): AirNav: 自然と多角的インストラクションを備えた大規模実世界のUAVビジョン・アンド・ランゲージナビゲーションデータセット
- Authors: Hengxing Cai, Yijie Rao, Ligang Huang, Zanyang Zhong, Jinhan Dong, Jingjun Tan, Wenhao Lu, Renxin Zhong,
- Abstract要約: 本研究では,実際の都市大気データから構築した大規模UAV VLNベンチマークであるAirNavを提案する。
また, スーパービジョンファインチューニングと強化ファインチューニングを組み合わせたAirVLN-R1を導入し, 性能向上と一般化を行った。
- 参考スコア(独自算出の注目度): 6.369522034276603
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing Unmanned Aerial Vehicle (UAV) Vision-Language Navigation (VLN) datasets face issues such as dependence on virtual environments, lack of naturalness in instructions, and limited scale. To address these challenges, we propose AirNav, a large-scale UAV VLN benchmark constructed from real urban aerial data, rather than synthetic environments, with natural and diverse instructions. Additionally, we introduce the AirVLN-R1, which combines Supervised Fine-Tuning and Reinforcement Fine-Tuning to enhance performance and generalization. The feasibility of the model is preliminarily evaluated through real-world tests. Our dataset and code are publicly available.
- Abstract(参考訳): 既存の無人航空機(UAV)ビジョンランゲージナビゲーション(VLN)データセットは、仮想環境への依存、指示の自然性の欠如、限定的なスケールといった問題に直面している。
これらの課題に対処するため,合成環境ではなく実際の都市大気データから構築した大規模UAV VLNベンチマークであるAirNavを提案する。
さらに, スーパービジョンファインチューニングと強化ファインチューニングを組み合わせたAirVLN-R1を導入し, 性能向上と一般化を行った。
モデルの有効性は、実世界のテストを通じて予備的に評価される。
データセットとコードは公開されています。
関連論文リスト
- History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation [64.51891404034164]
Aerial Vision-and-Language Navigation (AVLN) は、大規模都市環境でターゲットをローカライズするために無人航空機(UAV)のエージェントを必要とする。
既存のUAVエージェントは通常、これらの2つの側面のバランスに苦しむ単粒度フレームワークを採用する。
この研究は、粗いナビゲーションパイプラインを通じて2つの側面を統合するヒストリ強化2段階トランスフォーマー(HETT)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-16T09:16:07Z) - SkyVLN: Vision-and-Language Navigation and NMPC Control for UAVs in Urban Environments [7.251041314934871]
無人航空機(UAV)は、移動性と適応性によって、様々な分野にまたがって多用途のツールとして登場した。
本稿では,複雑な都市環境下でのUAV自律性を高めるために,VLNとモデル予測制御(NMPC)を統合した新しいフレームワークであるSkyVLNを紹介する。
論文 参考訳(メタデータ) (2025-07-09T05:38:32Z) - VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning [77.34267241692706]
Vision-Language Navigation(VLN)は、エージェントが自然言語命令を使用して現実世界の環境をナビゲートする必要がある、AIの実施における中核的な課題である。
本稿では、LVLM(Large Vision-Language Models)を利用して、エゴセントリックな動画ストリームを連続的なナビゲーションアクションに変換するエンドツーエンドフレームワークであるVLN-R1を提案する。
論文 参考訳(メタデータ) (2025-06-20T17:59:59Z) - OpenFly: A Comprehensive Platform for Aerial Vision-Language Navigation [49.697035403548966]
Vision-Language Navigation (VLN)は、言語命令と視覚的手がかりを活用してエージェントを誘導することを目的としており、AIの具体化において重要な役割を果たす。
各種レンダリングエンジン,多用途ツールチェーン,航空VLNの大規模ベンチマークからなるプラットフォームであるOpenFlyを提案する。
我々は、100kの軌跡を持つ大規模な航空VLNデータセットを構築し、18のシーンにまたがる様々な高さと長さをカバーした。
論文 参考訳(メタデータ) (2025-02-25T09:57:18Z) - CityNav: A Large-Scale Dataset for Real-World Aerial Navigation [25.51740922661166]
航空VLNのための最初の大規模実世界のデータセットであるCityNavを紹介する。
我々のデータセットは32,637人の実証軌道で構成されており、それぞれに自然言語の記述が組み合わされている。
ナビゲーション中に補助的なモダリティ入力として使用できる地理意味マップを作成する方法を提案する。
論文 参考訳(メタデータ) (2024-06-20T12:08:27Z) - NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation [23.72290930234063]
NaVidは、ヴィジュアル・アンド・ランゲージナビゲーションのためのビデオベースの大型視覚言語モデル(VLM)である。
NaVidはシミュレーション環境と現実世界で最先端のパフォーマンスを実現し、優れたクロスデータセットとSim2Real転送を実現している。
論文 参考訳(メタデータ) (2024-02-24T16:39:16Z) - AerialVLN: Vision-and-Language Navigation for UAVs [23.40363176320464]
AerialVLNという,UAVをベースとした,屋外環境に向けた新しいタスクを提案する。
都市レベル25のシナリオをほぼリアルに表現した3次元シミュレータを開発した。
AerialVLNが新しい課題であることを示唆するベースラインモデルと人的パフォーマンスの間にはまだ大きなギャップがある。
論文 参考訳(メタデータ) (2023-08-13T09:55:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。