論文の概要: SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion
- arxiv url: http://arxiv.org/abs/2606.27876v2
- Date: Tue, 30 Jun 2026 06:25:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.707154
- Title: SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion
- Title(参考訳): 空間UAV:低高度UAV知覚・協調・運動のための空間知能のベンチマーク
- Abstract要約: 空間知能は、低高度無人航空機(UAV)の認識、協調、航行に不可欠である。
本研究では,実際の低高度UAVベンチマークであるSpatialUAVを紹介した。
現状のモデルは, クロスビュー・アソシエーション, 構造的グラウンドリング, 幾何学的推論, 時間的視点理解において, 明らかなボトルネックを伴って, 人間のレベル・パフォーマンスから遠ざかっていることを示す。
- 参考スコア(独自算出の注目度): 76.8430169655641
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spatial intelligence is essential for low-altitude unmanned aerial vehicle (UAV) perception, collaboration, and navigation. However, existing UAV benchmarks often emphasize image-level recognition, single-view understanding, or narrow answer formats, leaving 3D spatial inference, multi-view collaboration, scene dynamics, and diverse task formulations insufficiently evaluated. To address these gaps, we introduce SpatialUAV, a real low-altitude UAV benchmark comprising 4,331 curated instances across 14 fine-grained task types, covering semantic discrimination, spatial relation, aerial--aerial collaboration, aerial--ground collaboration, and motion understanding. SpatialUAV organizes all samples into a unified visual-input--question--answer schema, while supporting seven input configurations and nine answer formats, including option labels, region identifiers, geometric values, cross-view correspondences, and free-form motion descriptions. To ensure reliable and grounded evaluation, our data construction pipeline integrates detector-assisted regions, depth supervision, metadata-derived rules, extensive manual annotation, blind filtering, and multi-turn human validation, together with task-specific metrics for heterogeneous outputs. Evaluating representative vision-language models across three categories, we show that current models remain far from human-level performance, with pronounced bottlenecks in cross-view association, structured grounding, geometric reasoning, and temporal viewpoint understanding. These results offer empirical guidance for advancing low-altitude UAV spatial intelligence. Code and data are available at https://github.com/Hyu-Zhang/SpatialUAV.
- Abstract(参考訳): 空間知能は、低高度無人航空機(UAV)の認識、協調、航行に不可欠である。
しかし、既存のUAVベンチマークでは画像レベルの認識、単一ビューの理解、狭い回答形式が強調され、3次元空間推論、複数ビューの協調、シーンダイナミクス、多様なタスクの定式化が不十分である。
これらのギャップに対処するために,SpatialUAVという,14種類のきめ細かなタスクタイプにまたがる4,331個のキュレートされたインスタンスからなる,実際の低高度UAVベンチマークを紹介した。
SpaceUAVは、すべてのサンプルを統合されたビジュアル・インプット・クエリー・スキーマにまとめ、オプションラベル、リージョン識別子、幾何学的値、クロスビュー対応、自由形式のモーション記述を含む7つの入力設定と9つの応答形式をサポートする。
信頼性と基盤的評価を確保するため,データ構築パイプラインは,検出支援領域,深度管理,メタデータ由来のルール,広範な手動アノテーション,ブラインドフィルタリング,マルチターン人体検証を,異種出力のためのタスク固有の指標とともに統合する。
3つのカテゴリにまたがる代表的視覚言語モデルを評価することで、現在のモデルが人間レベルの性能からかけ離れており、クロスビューアソシエーション、構造的グラウンドディング、幾何学的推論、時間的視点理解のボトルネックが顕著であることを示す。
これらの結果は、低高度UAV空間知能向上のための実証的なガイダンスを提供する。
コードとデータはhttps://github.com/Hyu-Zhang/SpatialUAV.comで公開されている。
関連論文リスト
- Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory [69.51256305550844]
PSC-AVDNは3段階のParsing-Search-Confirmation推論パイプラインを構造化空間記憶と密結合する学習自由フレームワークである。
PSC-AVDNは、トレーニング不要の設定、マッチング、あるいはいくつかの微調整されたメソッドの超越において、新しい最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-07-13T13:14:20Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks [73.62053624331227]
Huge-Benchは高レベルUAVビジョンランゲージ・アクションのベンチマークである。
4つの現実世界のデジタルツインシーン、8つのハイレベルタスク、2.56mの軌跡からなる。
プロセスの忠実度、終端精度、安全性を評価するために、プロセス指向および衝突認識メトリクスを導入する。
論文 参考訳(メタデータ) (2026-03-20T10:08:42Z) - UAVScenes: A Multi-Modal Dataset for UAVs [45.752766099526525]
UAVScenesは2Dと3Dの両方のモードでさまざまなタスクをベンチマークするために設計された大規模なデータセットである。
我々は、フレームワイド画像とLiDARポイントクラウドの両方に対して、手動でラベル付けされたセマンティックアノテーションを提供することにより、このデータセットを強化する。
これらの追加により、セグメンテーション、深さ推定、6-DoFローカライゼーション、位置認識、新しいビュー合成など、幅広いUAV認識タスクが可能になる。
論文 参考訳(メタデータ) (2025-07-30T06:29:52Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z) - More Clear, More Flexible, More Precise: A Comprehensive Oriented Object Detection benchmark for UAV [58.89234732689013]
CODroneは、現実の状況を正確に反映した、UAVのための包括的なオブジェクト指向オブジェクト検出データセットである。
また、下流のタスク要求に合わせて設計された新しいベンチマークとしても機能する。
我々は、CODroneを厳格に評価するために、22の古典的またはSOTA法に基づく一連の実験を行う。
論文 参考訳(メタデータ) (2025-04-28T17:56:02Z) - AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations [51.44608822712786]
ビジュアルグラウンドイングは、自然言語記述に基づいたイメージ内のターゲットオブジェクトのローカライズを目的としている。
AerialVGは、例えば外見に基づく接地は、複数の視覚的に類似した物体を識別するには不十分である。
5Kの空中画像,50Kの注釈付き記述,103Kのオブジェクトからなる,最初のAerialVGデータセットを紹介した。
論文 参考訳(メタデータ) (2025-04-10T15:13:00Z) - Griffin: Aerial-Ground Cooperative Detection and Tracking Dataset and Benchmark [15.405137983083875]
航空と地上の協力は、UAVの空中視界と地上の車両の局部的な観測を統合することで、有望な解決策を提供する。
本稿では,3つの重要な貢献を通じて,地上3次元協調認識のための包括的ソリューションを提案する。
論文 参考訳(メタデータ) (2025-03-10T07:00:07Z) - UAVDB: Point-Guided Masks for UAV Detection and Segmentation [0.03464344220266879]
UAVの検出とセグメンテーションのための新しいベンチマークデータセットであるUAVDBを提案する。
ポイント誘導の弱い監視パイプライン上に構築されている。
UAVDBは、可視オブジェクトからほぼ1ピクセルのインスタンスまで、さまざまなスケールでUAVをキャプチャする。
論文 参考訳(メタデータ) (2024-09-09T13:27:53Z) - UCDNet: Multi-UAV Collaborative 3D Object Detection Network by Reliable Feature Mapping [14.401624713578737]
マルチUAVコラボレーティブな3Dオブジェクト検出は複雑な環境を知覚し理解することができる。
カメラによる複数UAV協調3Dオブジェクト検出のパラダイムであるUCDNetを提案する。
本手法は, ベースラインに比べて4.7%, 10%mAPの増加を示した。
論文 参考訳(メタデータ) (2024-06-07T05:27:32Z) - Self-aligned Spatial Feature Extraction Network for UAV Vehicle
Re-identification [3.449626476434765]
同じ色とタイプを持つ車両は、UAVの観点から非常に類似した外観を示している。
最近の研究は、地域的特徴と構成要素的特徴によって区別される情報を抽出する傾向がある。
効率的なきめ細かい特徴を抽出し、退屈な注釈付け作業を避けるために、この手紙は教師なしの自己整合ネットワークを開発する。
論文 参考訳(メタデータ) (2022-01-08T14:25:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。