論文の概要: Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach
- arxiv url: http://arxiv.org/abs/2607.04352v1
- Date: Sun, 05 Jul 2026 15:16:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.906753
- Title: Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach
- Title(参考訳): UAVの高精度ナビゲーション:拡散精細空中サーボ手法
- Abstract要約: UAVの高精度ナビゲーションは、スケールのあいまいさ、回転の不連続性、微粒な空間推論の必要性により困難である。
広帯域拡散精細空中サーボフレームワークDreamNavを提案する。
実験では、DreamNavは強力なビジュアルサーボと基礎モデルベースラインを精度と一般化で上回り、ゼロショットは見えないシーンに転送される。
- 参考スコア(独自算出の注目度): 18.42619895752036
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this work, we study the last-meter precision navigation for UAVs, e.g., autonomously reaching a target within the final 10 meters using monocular vision. This task is challenging due to scale ambiguity, rotation discontinuities, and the need for fine-grained spatial reasoning. Existing methods often fail under large viewpoint changes or lack generalization to unseen environments. To this end, we propose DreamNav, a coarse-to-fine diffusion-refined aerial visual servoing framework. In the first coarse-estimation stage, a robust regression policy employs a trigonometric parameterization to predict rotation by jointly modeling sine and cosine components, effectively mitigating optimization instabilities caused by angular periodicity. Given this coarse estimate, the second diffusion-refined stage utilizes a pre-trained world model to simulate future visual observations for candidate actions, selecting the trajectory that minimizes visual discrepancy with the target through a process of visual imagination. To support rigorous evaluation, we contribute PairUAV, a large-scale benchmark comprising 4.8 million image pairs across 72 scenes, curated from the University-1652 dataset. Extensive experiments show DreamNav outperforms strong visual servoing and foundation model baselines in accuracy and generalization, with zero-shot transfer to unseen scenes.
- Abstract(参考訳): 本研究では,単眼視を用いて,UAVの最終精度ナビゲーション,例えば,最終10m以内の目標を自律的に到達させることについて検討した。
この課題は、スケールのあいまいさ、回転の不連続性、およびきめ細かい空間的推論の必要性により困難である。
既存の手法は多くの場合、大きな視点の変化の下で失敗するか、目に見えない環境への一般化が欠如している。
この目的のために,広帯域拡散精細空中サーボフレームワークDreamNavを提案する。
第1の粗い推定段階において、ロバスト回帰政策は、正弦成分と正弦成分を併用して回転を予測するために三角法パラメータ化を用いて、角周期性に起因する最適化不安定性を効果的に緩和する。
この粗い推定を前提として、第2拡散精製段階は、事前学習された世界モデルを用いて、将来の視覚的な行動の観察をシミュレートし、視覚的想像力のプロセスを通じて目標との視覚的不一致を最小限に抑える軌跡を選択する。
厳密な評価を支援するため、72の場面で480万枚の画像対からなる大規模なベンチマークであるPairUAVを、University-1652データセットからキュレートした。
大規模な実験では、DreamNavは強力なビジュアルサーボと基礎モデルベースラインを精度と一般化で上回り、ゼロショットは見えないシーンに転送される。
関連論文リスト
- AirAlign: Geometry-Aware Relative Pose Alignment for UAV Last-Meter Navigation [20.21278599561095]
AirAlignは、UAVのためのRGBのみの画像対相対ポーズアライメントのためのフレームワークである。
AirAlignは、トレーニング済みの視覚的幾何再構成モデルをバックボーンとして使用している。
PairUAVチャレンジの実験は,本手法の有効性とロバスト性を示した。
論文 参考訳(メタデータ) (2026-08-22T11:32:41Z) - Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation [24.310993695214094]
SWAM(Spatial-Perceiving World Action Model)は,タスク中心の共同観測行動生成フレームワークである。
スタートとゴールのRGB観測が与えられた場合、SWAMはシングルパス推論を行い、中間のRGB-Dシーケンスと対応するアクショントラジェクトリを同時に生成する。
SWAMは、成功率、軌道精度、推論効率において、最先端の2段階プランナーを著しく上回っている。
論文 参考訳(メタデータ) (2026-06-29T07:43:47Z) - WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation [31.539730066120374]
視覚ナビゲーションは、複雑な幾何学的および物理的制約の下で滑らかで衝突のない軌道を生成する必要がある。
WAM-Navは,視覚ナビゲーションを具体化した潜在世界行動モデルであり,行動生成と潜時視予知を共同で学習する。
論文 参考訳(メタデータ) (2026-06-03T14:05:19Z) - AgenticDiffusion: Agentic Diffusion-based Path Planning for Vision-Based UAV Navigation [2.186077977059593]
屋内UAVナビゲーションは、視野の限られた観測下での効率的な探索、シーン理解、信頼性の高い軌道実行を必要とする。
本稿では,多視点UAVナビゲーションフレームワークであるAgenticDiffusionを提案する。
このフレームワークは、適応的な視点選択、多段階のミッション実行、長距離ナビゲーション、安全な着陸場所選択を含む4つの現実のUAVナビゲーションシナリオで検証された。
論文 参考訳(メタデータ) (2026-06-02T18:18:35Z) - Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation [51.286599397552756]
本稿では,UAVの絶対位置と近距離からの進路を共同で予測する視覚駆動型クロスビューナビゲーション手法であるBering-UAVを提案する。
我々はまた、クロスビューのローカライゼーションとナビゲーションを評価するベンチマークである Bearing-UAV-90k も提示する。
論文 参考訳(メタデータ) (2026-03-23T16:17:39Z) - Visual Autoregressive Modelling for Monocular Depth Estimation [69.01449528371916]
本稿では,視覚的自己回帰(VAR)に基づく単眼深度推定手法を提案する。
提案手法は,大規模テキスト・画像VARモデルに適応し,スケールワイド・コンディショナル・アップサンプリング機構を導入する。
本研究では,屋内ベンチマークにおける制約付きトレーニング条件下での最先端性能と,屋外データセットに適用した場合の強い性能について報告する。
論文 参考訳(メタデータ) (2025-12-27T17:08:03Z) - Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space [48.19308247102762]
本稿では,過去のフレームや行動に照らされた将来の視覚的観察を予測する航空ナビゲーションワールドモデルANWMを提案する。
ANWMは4-DoF UAV軌道で訓練され、物理学にインスパイアされたモジュールであるFuture Frame Projectionを導入した。
実験により、ANWMは長距離視覚予測において既存の世界を著しく上回り、大規模環境でのUAV航法成功率を向上させることが示された。
論文 参考訳(メタデータ) (2025-12-26T06:22:39Z) - Extrapolated Urban View Synthesis Benchmark [53.657271730352214]
光シミュレーターは視覚中心型自動運転車(AV)の訓練と評価に不可欠である
中心となるのはノベルビュー合成(英語版)(NVS)であり、これはAVの広範かつ連続的なポーズ分布に対応するために、様々な目に見えない視点を生成する能力である。
近年の3次元ガウス・スプラッティングのような放射場の発展は、リアルタイムなリアルタイムレンダリングを実現し、大規模ドライビングシーンのモデリングに広く利用されている。
自動運転車と都市ロボットシミュレーション技術の進歩を支援するために、データを公開します。
論文 参考訳(メタデータ) (2024-12-06T18:41:39Z) - Open-World Drone Active Tracking with Goal-Centered Rewards [62.21394499788672]
Drone Visual Active Trackingは、視覚的な観察に基づいてモーションシステムを制御することで、対象物を自律的に追跡することを目的としている。
DATは,世界初となるエア・ツー・グラウンド・トラッキング・ベンチマークである。
また,複雑なシナリオにおけるドローン追跡目標の性能向上を目的としたGC-VATを提案する。
論文 参考訳(メタデータ) (2024-12-01T09:37:46Z) - Vectorized Representation Dreamer (VRD): Dreaming-Assisted Multi-Agent Motion-Forecasting [2.2020053359163305]
マルチエージェント動作予測問題に対するベクトル化された世界モデルに基づくアプローチであるVRDを紹介する。
本手法では,従来のオープンループトレーニングシステムと,新しい夢のクローズループトレーニングパイプラインを組み合わせる。
本モデルでは,1つの予測ミスレート測定値に対して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-06-20T15:34:17Z) - RadOcc: Learning Cross-Modality Occupancy Knowledge through Rendering
Assisted Distillation [50.35403070279804]
マルチビュー画像を用いた3次元シーンの占有状況とセマンティクスを推定することを目的とした,新たな課題である3D占有予測手法を提案する。
本稿では,RandOccを提案する。Rendering Assisted distillation paradigm for 3D Occupancy prediction。
論文 参考訳(メタデータ) (2023-12-19T03:39:56Z) - Distributed Variable-Baseline Stereo SLAM from two UAVs [17.513645771137178]
本稿では,単眼カメラを1台,IMUを1台搭載した2台のUAVを用いて,視界の重なりと相対距離の測定を行った。
本稿では,glsuavエージェントを自律的に制御するために,分散協調推定方式を提案する。
我々は,高度160mまでの飛行におけるアプローチの有効性を実証し,最先端のVIO手法の能力を大きく超えている。
論文 参考訳(メタデータ) (2020-09-10T12:16:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。