論文の概要: GeoFF3D: Coordinate-Anchored Feed-Forward Reconstruction for Large-Scale UAV Mapping
- arxiv url: http://arxiv.org/abs/2608.28288v2
- Date: Mon, 31 Aug 2026 04:12:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.411538
- Title: GeoFF3D: Coordinate-Anchored Feed-Forward Reconstruction for Large-Scale UAV Mapping
- Title(参考訳): GeoFF3D:大規模UAVマッピングのための協調型フィードフォワード再構成
- Abstract要約: 座標アンコールモデルと空間的大規模再構成フレームワーク(SLRF)を組み合わせたGeoFF3Dを提案する。
SLRFは画像を空間的に重なり合うチャンクに分割し、共有ビューの事前を伝播し、局所的な再構築を階層的に集約する。
GeoFF3Dは2000枚の画像を約5分で再構築し、スケーラブルで堅牢な大規模UAV再構成を実証している。
- 参考スコア(独自算出の注目度): 13.249995785743993
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing feed-forward 3D reconstruction methods typically process a bounded number of images and recover cameras and geometry in local or internally normalized frames. Extending them to large-scale UAV mapping requires scalable multi-chunk processing and reliable aggregation, while full Sim(3) alignment can become unstable for near collinear trajectories. We present GeoFF3D, which combines a coordinate-anchored model with a spatial large-scale reconstruction framework (SLRF). The model uses georeferenced camera translations and optional geometric priors to predict camera poses and dense point maps directly in a gravity-aligned Z-up metric frame. SLRF partitions images into spatially overlapping chunks, propagates shared-view priors, and aggregates local reconstructions hierarchically, while remaining applicable to different bounded-view models. Across nine aerial mapping blocks, GeoFF3D achieves the best average reconstruction quality, improving F@5 from 0.829 for Pi3X + SLRF to 0.877. On long UAVScenes sequences, it reaches 0.848, compared with 0.687 for Pi3X + SLRF and 0.451 for the strongest evaluated SLAM/streaming baseline. GeoFF3D reconstructs 2,000 images in approximately five minutes, demonstrating scalable and robust large-scale UAV reconstruction.The code is available at https://github.com/yanxian-ll/GeoFF3D.
- Abstract(参考訳): 既存のフィードフォワード3D再構成法は、通常、境界の多数の画像を処理し、ローカルまたは内部の正規化されたフレームでカメラと幾何学を復元する。
大規模UAVマッピングに拡張するには、スケーラブルなマルチチャンク処理と信頼性の高いアグリゲーションが必要である。
座標アンコールモデルと空間的大規模再構成フレームワーク(SLRF)を組み合わせたGeoFF3Dを提案する。
このモデルは、ジオリフレクションされたカメラの翻訳とオプションの幾何学的事前情報を用いて、重力に整合したZアップ計量フレームにおいて、カメラのポーズと密度の高い点マップを直接予測する。
SLRFは、画像を空間的に重なり合うチャンクに分割し、共有ビューを伝播し、局所的な再構成を階層的に集約する。
9つの空中マッピングブロックでGeoFF3Dは最高の平均再構成品質を達成し、F@5をPi3X+SLRFの0.829から0.877に改善した。
長いUAVScenes配列では0.848であり、Pi3X+SLRFは0.687、SLAM/ストリーミングベースラインは0.451である。
GeoFF3Dは2000枚の画像を約5分で再構築し、スケーラブルで堅牢な大規模UAV再構築を実証する。
関連論文リスト
- Glob3R: Global Structure-from-Motion with 3D Foundation Models [44.33296410481359]
Glob3Rは3Dファウンデーションモデルに基づいて構築されたグローバルなSfMスタイルの再構築である。
私たちのキーとなるアイデアは、フィードフォワード幾何学的予測を明示的に最適化することです。
屋内、屋外、大規模運転、および非秩序なSfMベンチマークの実験は、Glob3Rが堅牢で正確な再構築を実現することを示した。
論文 参考訳(メタデータ) (2026-07-10T09:18:35Z) - Geometric Context Transformer for Streaming 3D Reconstruction [51.19524805829903]
LingBot-Mapは、ストリーミングデータからシーンを再構築するためのフィードフォワード3Dファウンデーションモデルである。
LingBot-Mapの定義的な側面は、アンカーコンテキスト、ポーズ参照ウィンドウ、トラジェクトリメモリを統合した、慎重に設計されたアテンションメカニズムにある。
この設計は、リッチな幾何学的コンテキストを維持しながら、ストリーミング状態をコンパクトに保ち、518 x 378の解像度入力に対して、20FPS程度の安定した効率的な推論を可能にする。
論文 参考訳(メタデータ) (2026-04-15T17:58:13Z) - ReefMapGS: Enabling Large-Scale Underwater Reconstruction by Closing the Loop Between Multimodal SLAM and Gaussian Splatting [9.554102334590365]
本稿では,3DGSをベースとした逐次再構築フレームワークReefMapGSを提案する。
複雑な地形を持つ2つの海底礁のCOLMAPフリーな3次元再構築と,700m以上の調査軌道上でのAUVのより正確なグローバルなポーズ推定について述べる。
論文 参考訳(メタデータ) (2026-04-13T19:32:53Z) - ZeD-MAP: Bundle Adjustment Guided Zero-Shot Depth Maps for Real-Time Aerial Imaging [1.9247157750972368]
ZeD-MAPは、テスト時間拡散深さモデルをメトリック一貫性のあるSLAMのようなマッピングパイプラインに変換する、クラスタレベルのフレームワークである。
本手法は,水平(XY)平面で約0.87m,垂直(Z)方向で約0.12mの誤差で,サブメーター精度を実現する。
結果は手動のポイントクラウドアノテーションから小さなノイズを受けます。
論文 参考訳(メタデータ) (2026-04-06T13:21:17Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - UniQueR: Unified Query-based Feedforward 3D Reconstruction [68.01984215138098]
提案するUniQueRは,未提示画像からの3次元再構成を効率よく正確に行うための,クエリベースの統合フィードフォワードフレームワークである。
我々のモデルは、明示的な幾何学的クエリとして機能する3Dアンカー点のコンパクトな集合を学習する。
Mip-NeRF 360とVR-NeRFの実験により、UniQueRはレンダリング品質と幾何学的精度の両方において最先端のフィードフォワード法を上回ることを示した。
論文 参考訳(メタデータ) (2026-03-24T06:42:02Z) - LucidFusion: Reconstructing 3D Gaussians with Arbitrary Unposed Images [23.96972213606037]
3次元再構成を画像から画像への変換として再構成し、相対座標マップ(RCM)を導入する。
RCMは、ポーズ推定なしで複数の未提示画像をメインビューにアライメントする。
RCMはプロセスを単純化するが、グローバルな3D監視の欠如によりノイズの多い出力が得られる。
我々のLucidFusionフレームワークは、任意の数の未用意な入力を処理し、数秒で堅牢な3D再構成を実現し、より柔軟でポーズなしの3Dパイプラインを実現する。
論文 参考訳(メタデータ) (2024-10-21T04:47:01Z) - GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation [65.33726478659304]
GeoLRM(Geometry-Aware Large Restruction Model)は、512kガウスと21の入力画像で11GBのGPUメモリで高品質な資産を予測できる手法である。
従来の作品では、3D構造の本質的な空間性は無視されており、3D画像と2D画像の間の明示的な幾何学的関係は利用されていない。
GeoLRMは、3Dポイントを直接処理し、変形可能なクロスアテンション機構を使用する新しい3D対応トランスフォーマー構造を導入することで、これらの問題に対処する。
論文 参考訳(メタデータ) (2024-06-21T17:49:31Z) - FrozenRecon: Pose-free 3D Scene Reconstruction with Frozen Depth Models [67.96827539201071]
本稿では,3次元シーン再構成のための新しいテスト時間最適化手法を提案する。
本手法は5つのゼロショットテストデータセット上で,最先端のクロスデータセット再構築を実現する。
論文 参考訳(メタデータ) (2023-08-10T17:55:02Z) - Towards 3D Scene Reconstruction from Locally Scale-Aligned Monocular
Video Depth [90.33296913575818]
映像深度推定や映像からの3次元シーン再構成のようなビデオベースのシナリオでは、フレームごとの予測における未知のスケールとシフトが深度の不整合を引き起こす可能性がある。
局所重み付き線形回帰法を提案する。
提案手法は,複数のゼロショットベンチマークにおいて,既存の最先端手法の性能を50%向上させることができる。
論文 参考訳(メタデータ) (2022-02-03T08:52:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。