論文の概要: LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching
- arxiv url: http://arxiv.org/abs/2608.04106v1
- Date: Tue, 04 Aug 2026 18:02:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.576391
- Title: LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching
- Title(参考訳): LoRetta: グローバルなリモートセンシングDense画像マッチングのための基礎モデルと拡張データセット
- Authors: Siwei Yu, Han Guo, Zhenwei Shi, Zhengxia Zou,
- Abstract要約: 一致可能性を考慮したアフィンの局所化と高密度登録を導出する基礎モデルであるLoRettaを提案する。
また、LEVIR-GMは、データセット固有のマッチング性ラベルを持つグローバルスケールの多時間光マッチングベンチマークである。
LEVIR-GMでは、ローレッタは曲線(AUC)の83.3%の領域を達成し、最強のベースラインであるRoMa v2を1.6ポイント上回っている。
- 参考スコア(独自算出の注目度): 39.25581475845445
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dense image matching establishes pixel-wise correspondences and underpins broad applications in computer vision and photogrammetry. However, extending dense matching to global-scale remote sensing remains challenging because image pairs may differ in acquisition time, season, viewpoint, spatial resolution, and land-cover state. The resulting large geometric offsets, partial overlap, and intrinsically unmatchable regions make direct dense correspondence prediction unreliable and inefficient. We thus reformulate dense matching as localization-and-registration: first localizing the matchable overlap and affine geometry, then refining dense residuals within the aligned frame. Based on this formulation, we propose LoRetta, a foundation model coupling matchability-aware affine localization with guided dense registration. We also introduce LEVIR-GM, a global-scale multi-temporal optical matching benchmark with dataset-native matchability labels (103K aligned, 827K augmented pairs, six continents, five years, 0.5-1024 m resolution). We further establish a unified evaluation protocol for sparse, semi-dense, and dense matchers. On LEVIR-GM, LoRetta achieves an area under the curve (AUC) of 83.3%, outperforming the strongest baseline RoMa v2 by 1.6 points, with larger percentage of correct keypoints (PCK) gains of 6.5 and 8.2 points at 1 and 2 pixels, while reducing inference latency by 47.8%. Astronaut-to-satellite and unmanned aerial vehicle (UAV)-to-satellite geolocalization experiments further demonstrate its transferability as a reusable geometric aligner.
- Abstract(参考訳): ディエンス画像マッチングはピクセルワイド対応を確立し、コンピュータビジョンやフォトグラムの幅広い応用を支えている。
しかし、画像ペアは、取得時間、季節、視点、空間分解能、土地被覆状態が異なる可能性があるため、地球規模リモートセンシングへの密マッチングの拡張は依然として困難である。
結果として生じる大きな幾何学的オフセット、部分的な重なり合い、本質的な不整合領域は、直接密接な対応予測を信頼性なく非効率にする。
まず、マッチング可能なオーバーラップとアフィン幾何の局所化を行い、次に整列フレーム内で密な残差を精製する。
この定式化に基づいて,高密度登録と整合性を考慮したアフィン局在とを結合した基礎モデルであるLoRettaを提案する。
また、LEVIR-GMは、データセットネイティブなマッチング性ラベル(103Kのアライメント、827Kのアライメントペア、6大陸、5年、0.5-1024mの解像度)を備えた、グローバルスケールの多時間光マッチングベンチマークである。
さらに,スパース,セミセンス,密集型マーカの統一評価プロトコルを構築した。
LEVIR-GMでは、LoRettaは曲線(AUC)の83.3%の領域を達成し、最強のベースラインであるRoMa v2を1.6ポイント上回り、正しいキーポイント(PCK)が1と2で6.5と8.2ポイント上昇し、推論遅延を47.8%削減した。
宇宙飛行士-衛星/無人航空機(UAV)-衛星間ジオローカライゼーション実験は、再利用可能な幾何学的整合器としての転送可能性をさらに証明している。
関連論文リスト
- RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs [8.321575653158094]
リモートセンシング参照マップを用いた無人航空機(UAV)のグローバルな視覚的位置推定が注目されている。
Google 3D TilesのUAVビューポイント参照ビューを、位置、高度、方向にわたってサンプリングすることで、これらのシフトに対処する。
2段階のクロスドメインファインチューニングレシピは、SALADをポーズ・ニア・ポジティブと地理的に離れたハード・ネガティブを使って適用し、局所的な幾何学的整合性はトップK候補を再ランク付けする。
適応したDINOv2-Bレトリバーを凍結し、トークンフィールドを再利用するローカルディスクリプタデコーダを除去するRetrieval-In-Matching (RIM)を提案する。
論文 参考訳(メタデータ) (2026-07-22T13:20:26Z) - FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry [52.232826445242644]
FoundationGeoは空間キャリブレーションと原則データ設計による相対的および計量的予測を橋渡しする。
ステージ1は DINOv3 で初期化することで高忠実なアフィン不変幾何モデルを学ぶ。
ステージ2は、メートル法推定のためのピクセルワイドキャリブレーションフィールドを導入することで、グローバルなスケーリングを越えている。
論文 参考訳(メタデータ) (2026-07-13T14:10:01Z) - Globally Localizing Lunar Rover in Pixels via Graph Alignment [8.734737017643416]
クロスビューローカライゼーションは、ローバービューと衛星ビューの画像とをマッチングすることにより、ドリフトフリーなグローバルソリューションを提供する。
統合グラフ学習と再計画グラフマッチングを併用し、堅牢なクロスビューアライメントを実現するフレームワークであるウォープアライメント・オブ・リジェンドグラフ(WARG)を提案する。
論文 参考訳(メタデータ) (2026-06-09T09:04:54Z) - Slum Detection and Density Mapping with AlphaEarth Foundations: A Representation Learning Evaluation Across 12 Global Cities [9.982796078979648]
画素レベルのスラムマッピングは、長い間、限られた都市間一般化によって制約されてきた。
AlphaEarth Foundationsは、軽量スラムモニタリングのための新しい分析可能なベースを提供する。
我々は,12都市と69都市年対のスラム分類とサブピクセル密度推定についてAFFを評価した。
論文 参考訳(メタデータ) (2026-05-11T05:54:15Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - iMatcher: Improve matching in point cloud registration via local-to-global geometric consistency learning [2.3985192761907643]
iMatcherは、ポイントクラウド登録における機能マッチングのためのフレームワークである。
局所的および大域的整合性を用いて、ポイントワイドマッチング確率を予測する。
KITTIでは95%-97%、KITTI-360では94%-97%、3DMatchでは81.1%である。
論文 参考訳(メタデータ) (2025-09-10T20:25:57Z) - SGAD: Semantic and Geometric-aware Descriptor for Local Feature Matching [16.683203139962153]
本稿では,領域ベースのマッチングを根本的に再考するSemantic and Geometric-aware Descriptor Network (SGAD)を紹介する。
SGADは、複雑なグラフの最適化なしに直接マッチングを可能にする、高度に識別可能な領域記述子を生成する。
我々は、領域マッチングタスクを分類とランク付けサブタスクに分解する新しい監督戦略により、領域マッチングの性能をさらに改善する。
論文 参考訳(メタデータ) (2025-08-04T10:46:53Z) - AffineGlue: Joint Matching and Robust Estimation [74.04609046690913]
AffineGlue, 連立2視点特徴マッチングとロバストな推定法を提案する。
AffineGlueは、最小限のモデルを推定するために、1対多の対応から潜在的なマッチを選択する。
ガイドマッチングはモデルと一致した一致を見つけるために使用され、1対1の一致の曖昧さに悩まされる。
論文 参考訳(メタデータ) (2023-07-28T08:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。