論文の概要: Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation
- arxiv url: http://arxiv.org/abs/2608.04825v1
- Date: Wed, 05 Aug 2026 13:27:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.939082
- Title: Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation
- Title(参考訳): 飛行前に検討:UAVシー・アンド・リーチナビゲーションのための視覚ガイド付き空間検討
- Authors: Fanfu Xue, En Yu, Bohang Liu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun,
- Abstract要約: シー・アンド・リーチ・ナビゲーションでは、航空エージェントが初期ビューで見える言語指定のターゲットに接近し、その近くで確実に停止する必要がある。
既存の手法は通常、中間的な細粒度の空間決定を明示的にモデル化することなく、視覚言語表現を直接アクション出力にマッピングする。
そこで我々は,経路ポイント生成に先立って,視覚誘導型空間的議論を明示的に導入する,視覚言語による経路ポイント予測フレームワークDBFlyを提案する。
- 参考スコア(独自算出の注目度): 23.72068584471195
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: UAV see-and-reach navigation requires an aerial agent to approach a language-specified target visible in its initial view and stop reliably near it. Existing methods typically map vision-language representations directly to action outputs without explicitly modeling intermediate fine-grained spatial decisions. This direct mapping causes semantic-control misalignment, leading to inconsistent maneuvers and unreliable termination. To address this issue, we propose DBFly, a vision-language waypoint prediction framework that introduces explicit vision-guided spatial deliberation before waypoint generation. Specifically, DBFly introduces a spatial maneuver decision chain that progressively performs target-direction anchoring, spatial diagnosis, and maneuver decision, enabling high-level maneuver intent to explicitly guide continuous waypoint generation. DBFly further constructs an implicit flight corridor by transforming the initial target-direction prior into a persistent geometric reference and deriving an online corridor state from the UAV's current position, thereby providing soft geometric guidance for spatial diagnosis and maneuver correction. In addition, DBFly develops a terminal-convergence-aware stopping strategy that characterizes terminal states through both target proximity and short-horizon motion convergence, enabling more reliable stopping near the target. Extensive experiments across seen, unseen-object, and unseen-scene test sets demonstrate that DBFly improves the success rate over the SOTA baseline by an average of 25.07 percentage points. The project homepage is available at https://xuefanfu.github.io/DBFly-Page.
- Abstract(参考訳): UAVシー・アンド・リーチナビゲーションでは、航空エージェントが初期ビューで見える言語指定のターゲットに接近し、その近くで確実に停止する必要がある。
既存の手法は通常、中間的な細粒度の空間決定を明示的にモデル化することなく、視覚言語表現を直接アクション出力にマッピングする。
この直接的なマッピングは意味制御のミスアライメントを引き起こし、一貫性のない操作と信頼性の低い終了につながる。
この問題に対処するため,我々は,経路ポイント生成に先立って視覚誘導型空間論を明示的に導入する,視覚言語による経路ポイント予測フレームワークであるDBFlyを提案する。
特に、DBFlyは、目標方向アンカー、空間診断、操作決定を段階的に行う空間的操作決定チェーンを導入し、高レベルな操作意図で連続的な経路ポイント生成を明示的に導くことができる。
さらにDBFlyは、初期目標方向を永続的な幾何学的基準に前もって変換し、UAVの現在の位置からオンラインの廊下状態を引き出すことにより、空間診断と操作補正のためのソフトな幾何学的ガイダンスを提供することにより、暗黙の飛行回廊を構築する。
さらに、DBFlyは、目標近傍と短水平運動収束の両方を通して端末状態を特徴付ける端末収束対応停止戦略を開発し、目標付近でより信頼性の高い停止を可能にする。
観察された、目に見えない、目に見えないテストセットにわたる大規模な実験は、DBFlyがSOTAベースラインでの成功率を平均25.07ポイント改善することを示した。
プロジェクトのホームページはhttps://xuefanfu.github.io/DBFly-Page.comで公開されている。
関連論文リスト
- See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View [22.860978565302233]
UAV-VLN (UAV Vision-Language Navigation) は、一般に総合的な探索と到達の問題として定式化されている。
UAV-VLN-FOVは,視線と視線を分離した目標視認可能なナビゲーションタスクである。
3DG-VLNは動的3次元方向の手がかりによって導かれる視覚言語ウェイポイント予測フレームワークである。
論文 参考訳(メタデータ) (2026-06-18T10:21:42Z) - Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation [79.12557132788139]
VLN-CE(Vision-Language Navigation in Continuous Environments)では、エージェントが現実世界のような環境でナビゲートしながら自然言語の指示に従う必要がある。
ほとんどのVLN-CEアプローチでは、ウェイポイント予測器がウェイポイントを提案し、ナビゲータが最良のウェイポイントを選択する。
提案手法は,各候補の経路点を実行可能な軌道に配置する,トラジェクトリ・ウェイポイントという新しいパラダイムを導入する。
論文 参考訳(メタデータ) (2026-06-05T13:11:39Z) - AgenticDiffusion: Agentic Diffusion-based Path Planning for Vision-Based UAV Navigation [2.186077977059593]
屋内UAVナビゲーションは、視野の限られた観測下での効率的な探索、シーン理解、信頼性の高い軌道実行を必要とする。
本稿では,多視点UAVナビゲーションフレームワークであるAgenticDiffusionを提案する。
このフレームワークは、適応的な視点選択、多段階のミッション実行、長距離ナビゲーション、安全な着陸場所選択を含む4つの現実のUAVナビゲーションシナリオで検証された。
論文 参考訳(メタデータ) (2026-06-02T18:18:35Z) - Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation [51.286599397552756]
本稿では,UAVの絶対位置と近距離からの進路を共同で予測する視覚駆動型クロスビューナビゲーション手法であるBering-UAVを提案する。
我々はまた、クロスビューのローカライゼーションとナビゲーションを評価するベンチマークである Bearing-UAV-90k も提示する。
論文 参考訳(メタデータ) (2026-03-23T16:17:39Z) - Seeing Where to Deploy: Metric RGB-Based Traversability Analysis for Aerial-to-Ground Hidden Space Inspection [48.120690574682875]
本稿では,RGBを用いた幾何学的意味的再構成と,空中から地上への隠れ空間検査のためのトラベル可能性解析フレームワークを提案する。
テザリングされたUAV-UGVプラットフォームでの実験では、隠れた空間シナリオにおける信頼性の高いデプロイメントゾーンの識別が示されている。
論文 参考訳(メタデータ) (2026-03-15T22:20:59Z) - Eva-Tracker: ESDF-update-free, Visibility-aware Planning with Target Reacquisition for Robust Aerial Tracking [51.06229328990625]
Eva-Trackerは、航空追跡のための可視性を考慮した軌道計画フレームワークである。
ESDF更新を排除し、リカバリ可能なパス生成メソッドを組み込んで、ターゲット再取得を行う。
提案手法は,従来の最先端手法よりも計算労力の少ないロバストな追跡結果を提供する。
論文 参考訳(メタデータ) (2026-02-13T02:56:34Z) - DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation [73.80968452950854]
Vision-Language Navigation in Continuous Environments (VLN-CE) は、エージェントが自由形式の3D空間を通して自然言語の指示に従う必要がある。
既存のVLN-CEアプローチは通常、2段階のウェイポイント計画フレームワークを使用する。
本稿では,エンドツーエンド最適化VLN-CEポリシとしてDAgger Diffusion Navigation (DifNav)を提案する。
論文 参考訳(メタデータ) (2025-08-13T02:51:43Z) - How To Not Train Your Dragon: Training-free Embodied Object Goal
Navigation with Semantic Frontiers [94.46825166907831]
Embodied AIにおけるオブジェクトゴールナビゲーション問題に対処するためのトレーニング不要のソリューションを提案する。
本手法は,古典的な視覚的同時ローカライゼーションとマッピング(V-SLAM)フレームワークに基づく,構造化されたシーン表現を構築する。
本手法は,言語先行情報とシーン統計に基づいてシーングラフのセマンティクスを伝搬し,幾何学的フロンティアに意味知識を導入する。
論文 参考訳(メタデータ) (2023-05-26T13:38:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。