論文の概要: AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience
- arxiv url: http://arxiv.org/abs/2606.31467v1
- Date: Tue, 30 Jun 2026 10:46:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.183059
- Title: AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience
- Title(参考訳): AeroVerse-SatAgent: UAV-Satellite Collaborative Space Reasoning : 認知神経科学のデュアル・ビジュアル・パスウェイ理論にヒントを得た研究
- Abstract要約: 本稿では,UAV-サテライト共同空間推論モデルであるSatAgentを提案する。
SatAgentは衛星とUAVの視点を活用することで、複雑な都市環境で堅牢で正確な推論を可能にする。
大規模なUAV-サテライト共同空間推論データセットであるSatAgent-SR130Kを構築した。
- 参考スコア(独自算出の注目度): 32.90229217189434
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the rapid advancement of aerospace embodied intelligence, enabling Unmanned Aerial Vehicles (UAVs) to autonomously understand and reason about complex environments has become increasingly important. However, existing UAV-based spatial reasoning approaches face critical limitations: single-view perception renders them vulnerable to occlusions and perspective distortions, while most VLMs lack explicit geometric modeling, relying on semantic cues and yielding inconsistent reasoning under viewpoint and scale variations. To address these challenges, we propose SatAgent, a UAV-Satellite collaborative spatial reasoning model inspired by the dual-pathway mechanism of the human visual system. By jointly leveraging satellite and UAV perspectives, SatAgent enables robust, accurate reasoning in complex urban environments. We first introduce a Geometric-Aware 3D Reconstruction Encoder that elevates 2D UAV features into explicit 3D spatial representations. Next, we design a multi-view topology-semantic alignment module integrating cross-view features within a unified BEV coordinate system. We further introduce a multi-view consistency loss encouraging viewpoint-invariant representations. Finally, we construct SatAgent-SR130K, the first large-scale UAV-Satellite collaborative multi-view spatial reasoning dataset. Experiments show SatAgent outperforms state-of-the-art general-purpose foundation models and specialized spatial reasoning models by 25.91\% and 11.69\%, respectively, across diverse tasks, achieving particularly high accuracy in complex geometric relationship reasoning.
- Abstract(参考訳): 航空宇宙の急速な進歩により、無人航空機(UAV)が複雑な環境について自律的に理解し、推論できることがますます重要になっている。
しかし、既存のUAVベースの空間推論アプローチは重要な制限に直面している: 単一視点知覚は、それらがオクルージョンや視点歪みに対して脆弱であるのに対して、ほとんどのVLMは明示的な幾何学的モデリングを欠いており、意味的な手がかりに依存し、視点とスケールのバリエーションの下で一貫性のない推論をもたらす。
これらの課題に対処するため,UAV-サテライト共同空間推論モデルであるSatAgentを提案する。
SatAgentは衛星とUAVの視点を併用することで、複雑な都市環境で堅牢で正確な推論を可能にする。
まず,2次元UAV特徴を明示的な3次元空間表現に高める幾何学的3次元再構成エンコーダを提案する。
次に,BEV座標系にクロスビュー機能を組み込んだ多視点トポロジ・セマンティックアライメントモジュールを設計する。
さらに、視点不変表現を奨励する多視点一貫性損失を導入する。
最後に,大規模なUAV-サテライト共同空間推論データセットであるSatAgent-SR130Kを構築した。
実験の結果、SatAgentは最先端の汎用基盤モデルと特殊空間推論モデルをそれぞれ25.91\%と11.69\%で上回り、複雑な幾何学的関係推論において特に高い精度を達成している。
関連論文リスト
- AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration [22.635145889984273]
UAV-UGVコラボレーションにおける多視点空間インテリジェンス評価のための診断ベンチマークであるAirGroundBenchを提案する。
AirGroundBenchは、11の高忠実なシミュレート環境と1,021のシンクロナイズドエアグラウンド観測ペアで構成されている。
10のタスクタイプを4つの段階的に要求される機能ディメンションに分類する。
論文 参考訳(メタデータ) (2026-06-26T12:51:22Z) - Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence [107.79496500634691]
LinkS$2$Benchは、ダイナミックUAV映像の1,022分を200km$2$の高解像度衛星画像とリンクする。
LMMを用いたパイプラインと厳密な人間のアノテーションを用いて17.9kの高品質な質問応答ペアを構築した。
評価は、人間のベースラインとはかなりの差を示し、正確なクロスビューのダイナミックアライメントを重要なボトルネックと特定する。
論文 参考訳(メタデータ) (2026-04-02T13:22:57Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments [49.966170814478915]
UAV VLNのための幾何学誘導空間表現フレームワークを提案する。
明示的な3次元再構成を伴わないRGB観測において、SpatialFlyは幾何学誘導2次元表示アライメント機構を導入する。
実験結果から、SpatialFlyは現状のUAV VLNベースラインを目に見える環境と見えない環境の両方で一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-22T03:56:58Z) - Enhancing Cross-View UAV Geolocalization via LVLM-Driven Relational Modeling [31.36539752384395]
クロスビューUAVジオローカライゼーションは、ドローンが捉えた画像の正確な空間座標を、地理的に参照された広範囲な衛星データベースと整列させることを目的としている。
改良されたUAV-Satellite画像マッチングのための共同関係モデリングを明示的に行うために設計された,新しいプラグアンドプレイランキングアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-03-09T07:57:29Z) - AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios [64.51320327698231]
UAVシナリオにおける最初の大規模RMOTベンチマークであるAerialMindを紹介する。
我々は、革新的な半自動協調型エージェントベースラベリングアシスタントフレームワークを開発した。
また,視覚言語表現学習を協調的に強化する新しい手法であるHawkEyeTrackを提案する。
論文 参考訳(メタデータ) (2025-11-26T04:44:27Z) - ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models [68.46716645478661]
視覚言語モデル (VLM) は視覚的内容の理解と推論において顕著な能力を示した。
現在のVLMは、主に自我中心の空間的推論(カメラの観点から)に優れるが、同中心の視点に一般化することができない。
マルチ視点空間位置認識評価に特化して設計された,初の総合的なベンチマークであるViewSpatial-Benchを紹介する。
論文 参考訳(メタデータ) (2025-05-27T17:59:26Z) - Space Non-cooperative Object Active Tracking with Deep Reinforcement
Learning [1.212848031108815]
DRLAVTと命名されたDQNアルゴリズムに基づくエンドツーエンドのアクティブなトラッキング手法を提案する。
追尾宇宙船のアプローチを、色やRGBD画像にのみ依存した任意の空間の非協力目標に導くことができる。
位置ベースのビジュアルサーボベースラインアルゴリズムでは、最先端の2DモノクロトラッカーであるSiamRPNをはるかに上回っている。
論文 参考訳(メタデータ) (2021-12-18T06:12:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。