論文の概要: Enhancing Cross-View UAV Geolocalization via LVLM-Driven Relational Modeling
- arxiv url: http://arxiv.org/abs/2603.08063v1
- Date: Mon, 09 Mar 2026 07:57:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-10 15:13:15.63545
- Title: Enhancing Cross-View UAV Geolocalization via LVLM-Driven Relational Modeling
- Title(参考訳): LVLM駆動リレーショナルモデリングによる全天球UAV測地化の促進
- Abstract要約: クロスビューUAVジオローカライゼーションは、ドローンが捉えた画像の正確な空間座標を、地理的に参照された広範囲な衛星データベースと整列させることを目的としている。
改良されたUAV-Satellite画像マッチングのための共同関係モデリングを明示的に行うために設計された,新しいプラグアンドプレイランキングアーキテクチャを提案する。
- 参考スコア(独自算出の注目度): 31.36539752384395
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The primary objective of cross-view UAV geolocalization is to identify the exact spatial coordinates of drone-captured imagery by aligning it with extensive, geo-referenced satellite databases. Current approaches typically extract features independently from each perspective and rely on basic heuristics to compute similarity, thereby failing to explicitly capture the essential interactions between different views. To address this limitation, we introduce a novel, plug-and-play ranking architecture designed to explicitly perform joint relational modeling for improved UAV-to-satellite image matching. By harnessing the capabilities of a Large Vision-Language Model (LVLM), our framework effectively learns the deep visual-semantic correlations linking UAV and satellite imagery. Furthermore, we present a novel relational-aware loss function to optimize the training phase. By employing soft labels, this loss provides fine-grained supervision that avoids overly penalizing near-positive matches, ultimately boosting both the model's discriminative power and training stability. Comprehensive evaluations across various baseline architectures and standard benchmarks reveal that the proposed method substantially boosts the retrieval accuracy of existing models, yielding superior performance even under highly demanding conditions.
- Abstract(参考訳): クロスビューUAVジオローカライゼーションの主な目的は、ドローンが捉えた画像の正確な空間座標を、地理的に参照された広範囲な衛星データベースと整列させることである。
現在のアプローチは通常、各視点から特徴を独立に抽出し、類似性を計算するための基本的なヒューリスティックに依存しているため、異なる視点間の本質的な相互作用を明示的に捉えることができない。
この制限に対処するために,UAV-to-Satellite画像マッチングの改善のための共同関係モデリングを明示的に行うために設計された,新しいプラグアンドプレイランキングアーキテクチャを導入する。
LVLM(Large Vision-Language Model)の機能を利用することで,UAVと衛星画像の深い視覚・意味的相関を効果的に学習する。
さらに,トレーニングフェーズを最適化する新たなリレーショナル・アウェア・ロス関数を提案する。
ソフトラベルを採用することで、この損失は微妙な監督を提供し、ほぼ正の一致を過度に罰することを避け、最終的にモデルの識別力と訓練安定性を増強する。
各種ベースラインアーキテクチャと標準ベンチマークの総合評価により,提案手法は既存モデルの検索精度を大幅に向上させ,高い要求条件下でも性能が向上することを明らかにした。
関連論文リスト
- Reinforcement Learning-Guided Evolutionary Policy Optimization for Preference-Adjustable Heterogeneous Agile Earth Observation Satellite Scheduling [50.176885352114674]
異質なアジャイル地球観測衛星(AEOS)のスケジューリングには、タスクの選択、衛星の割り当て、および観測シークエンシングが必要である。
本稿では、優先調整可能な重み付け目的を用いた異種AEOSスケジューリングのための進化的ポリシー最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-25T12:16:28Z) - OffNadirLoc: Benchmark and Framework for Challenging UAV-to-Satellite Geo-Localization under Large Off-Nadir Views [10.815476560469916]
我々はOFNadirLocを紹介した。OFNadirUAV-to-satellite大局地局所化のための新しいベンチマークである。
ONLocには構造対応のコンテキスト重み付け機構が組み込まれており、信頼性の高い局所的特徴を動的に強調する。
我々は、複数のビューから1つの衛星画像と対応するUAV画像を結合的セマンティックグループとして扱うビューコヒーレント学習戦略を設計する。
論文 参考訳(メタデータ) (2026-07-22T09:27:50Z) - STEAM: Stable Self-Training with Elastic Matching and Adaptive Purification [7.7693155858168295]
クロスビュージオローカライゼーション(CVGL)は、ドローンビュー画像と対応する衛星ビュー画像とをマッチングすることにより、GPSフリーなローカライゼーションを実現することを目的としている。
既存の教師付き手法は、手動で手動で注釈付けされたクロスビュー画像ペアに依存しており、コストがかかり拡張が困難である。
STEAMは、実際のドローンや衛星画像上で直接自己学習を行う、エンドツーエンドの非教師なしジオローカライゼーションフレームワークである。
論文 参考訳(メタデータ) (2026-07-10T02:56:34Z) - SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion [76.8430169655641]
空間知能は、低高度無人航空機(UAV)の認識、協調、航行に不可欠である。
本研究では,実際の低高度UAVベンチマークであるSpatialUAVを紹介した。
現状のモデルは, クロスビュー・アソシエーション, 構造的グラウンドリング, 幾何学的推論, 時間的視点理解において, 明らかなボトルネックを伴って, 人間のレベル・パフォーマンスから遠ざかっていることを示す。
論文 参考訳(メタデータ) (2026-06-26T09:16:55Z) - Boosting Robust AIGI Detection with LoRA-based Pairwise Training [55.076681464804636]
現在のAIGI検出器はクリーンなデータセットで良好に動作しますが、その検出性能は"野生"に展開すると低下します。
本稿では,高度歪み下でのAIGIの堅牢な検出を実現するために,Lo-based Pairwise Training (RA) 戦略を提案する。
論文 参考訳(メタデータ) (2026-04-14T05:35:32Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - Enhancing Gradient Inversion Attacks in Federated Learning via Hierarchical Feature Optimization [56.95448807869383]
フェデレートラーニング(FL)は、プライバシを保存する分散機械学習の魅力的なパラダイムとして登場した。
近年の研究では、FLシステムで交換される勾配もプライバシー漏洩に弱いことが報告されている。
我々は textbfGradient textbfInversion over textbfFeature textbfDomains (GIFD) を提案する。
論文 参考訳(メタデータ) (2026-04-01T14:32:15Z) - TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation [70.23578202012048]
Vision-Language Navigation (VLN) は、アーキテクチャ上のミスマッチのため、大きなビジョン-Language Models (VLM) に固有の課題を提示している。
我々は,VLMのバックボーンにトポロジ構造を明示的に注入するエンドツーエンドフレームワークであるTagaVLM(トポロジ・アウェア・グローバルアクション推論)を提案する。
トポロジ的ノード情報を強化するため、Interleaved Navigation Promptはノードレベルのビジュアルテキストアライメントを強化する。
埋め込みトポロジグラフでは、このモデルはグローバルな行動推論が可能であり、堅牢な経路補正を可能にする。
論文 参考訳(メタデータ) (2026-03-03T13:28:07Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning [61.84363374647606]
リモートセンシングビジュアルグラウンドディング(RSVG)は、自然言語記述に基づく大規模空中画像における対象物体のローカライズを目的としている。
これらの記述はしばしば位置的手がかりに大きく依存しており、空間的推論においてMLLM(Multimodal Large Language Models)に固有の課題を提起している。
空間理解の高度化を図るために,textbfRSGround-R1 と呼ばれる推論誘導型位置認識後学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T12:35:57Z) - Object Detection as an Optional Basis: A Graph Matching Network for Cross-View UAV Localization [17.908597896653045]
本稿では,対象物検出によるマップマッチングを行うUAVローカライゼーションフレームワークを提案する。
典型的なパイプラインでは、UAVの視覚的ローカライゼーションは画像検索の問題として定式化されている。
本手法は, グラフベースノード類似度測定法を用いて, 高精度な検索とローカライズ性能を実現する。
論文 参考訳(メタデータ) (2025-11-04T11:25:31Z) - Hierarchical Image Matching for UAV Absolute Visual Localization via Semantic and Structural Constraints [10.639191465547517]
無人航空機(UAV)には絶対的な位置決めが不可欠であるが、グローバルナビゲーション衛星システム(GNSS)信号が利用できない場合には困難である。
視線に基づく絶対的位置決め手法は、UAVの現在の視界を基準衛星マップで推定し、その位置を推定する手法として人気を博している。
既存の手法は主に従来の画像マッチングと低レベルの画像マッチングに依存しており、ソース間の相違や時間的変動による大きな違いによって困難に悩まされている。
セマンティック・アウェアと統合したUAV絶対位置推定のための階層的クロスソース画像マッチング手法を提案する。
論文 参考訳(メタデータ) (2025-06-11T13:53:03Z) - AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations [51.44608822712786]
ビジュアルグラウンドイングは、自然言語記述に基づいたイメージ内のターゲットオブジェクトのローカライズを目的としている。
AerialVGは、例えば外見に基づく接地は、複数の視覚的に類似した物体を識別するには不十分である。
5Kの空中画像,50Kの注釈付き記述,103Kのオブジェクトからなる,最初のAerialVGデータセットを紹介した。
論文 参考訳(メタデータ) (2025-04-10T15:13:00Z) - Without Paired Labeled Data: End-to-End Self-Supervised Learning for Drone-view Geo-Localization [20.603433987118837]
ドローンビュージオローカライゼーション(DVGL)は、GPSタグ付き衛星画像を取得することで、ドローンの正確なローカライゼーションを実現することを目的としている。
既存の手法は、教師あり学習のために、厳密にペアリングされたドローン衛星画像に大きく依存している。
浅いバックボーンネットワークを用いたエンドツーエンドの自己教師付き学習手法を提案する。
論文 参考訳(メタデータ) (2025-02-17T02:53:08Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - Unified Visual Relationship Detection with Vision and Language Models [89.77838890788638]
この研究は、複数のデータセットからラベル空間の結合を予測する単一の視覚的関係検出器のトレーニングに焦点を当てている。
視覚と言語モデルを活用した統合視覚関係検出のための新しいボトムアップ手法UniVRDを提案する。
人物体間相互作用検出とシーングラフ生成の双方による実験結果から,本モデルの競合性能が示された。
論文 参考訳(メタデータ) (2023-03-16T00:06:28Z) - Co-visual pattern augmented generative transformer learning for
automobile geo-localization [12.449657263683337]
クロスビュージオローカライゼーション(CVGL)は、地上カメラの地理的位置を、巨大なジオタグ付き空中画像とマッチングすることによって推定することを目的としている。
CVGLのための相互生成型トランスフォーマー学習(MGTL)という,トランスフォーマーと組み合わせたクロスビュー知識生成技術を用いた新しい手法を提案する。
論文 参考訳(メタデータ) (2022-03-17T07:29:02Z) - Vision-Based UAV Self-Positioning in Low-Altitude Urban Environments [20.69412701553767]
無人航空機(UAV)は安定した位置決めのために衛星システムに依存している。
このような状況下では、視覚に基づく技術が代替手段として機能し、UAVの自己配置能力を確実にする。
本稿では,UAV自己配置タスク用に設計された最初の公開データセットであるDenseUAVを提案する。
論文 参考訳(メタデータ) (2022-01-23T07:18:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。