論文の概要: SiZeUp: Fast 3D Proxy from Aerial Images via Depth Ordinal Loss
- arxiv url: http://arxiv.org/abs/2608.22821v2
- Date: Tue, 25 Aug 2026 05:23:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.142101
- Title: SiZeUp: Fast 3D Proxy from Aerial Images via Depth Ordinal Loss
- Title(参考訳): SiZeUp:空中画像からの高速3Dプロキシ
- Authors: Wenjun Zhou, Yunshan Li, Qiaoyu Zhu, Weidan Xiong, Hao Zhang, Daniel Cohen-Or, Hui Huang,
- Abstract要約: SiZeUpは、斜めの空中画像から直接大規模な3D都市プロキシモデルを構築するための、高速でスケーラブルなアプローチである。
提案手法は,最先端のプロキシ再構築パイプラインよりも23-52$timesの高速化を実現する。
- 参考スコア(独自算出の注目度): 45.254340705755
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present SiZeUp, a fast and scalable approach for constructing large-scale 3D urban proxy models directly from calibrated oblique aerial imagery. Our method adopts a height-from-footprint representation, reducing 3D building abstraction to a low-dimensional optimization problem in which building footprints are extruded by a single height parameter. To enable efficient and robust height estimation, we introduce an ordinal depth consistency loss that enforces agreement between the relative depth ordering of rendered proxies and depth priors predicted by a monocular depth model. This is realized through a differentiable renderer that maps parametric building proxies into multi-view depth images, allowing gradients to be propagated from depth supervision to building heights. Our ordinal formulation produces stable optimization in practice and avoids explicit feature matching or dense point cloud reconstruction. Rather than relying on metric depth, which can be unreliable under monocular scale ambiguity, our ordinal depth consistency loss operates on relative depths, providing a more reliable signal across views. Combined with an efficient dynamic view selection, our approach achieves a 23-52$\times$ speedup over state-of-the-art proxy reconstruction pipelines while maintaining comparable proxy-level coverage and volume consistency, making it well suited for large-scale urban modeling tasks.
- Abstract(参考訳): キャリブレーションされた斜空画像から直接大規模な3次元都市プロキシモデルを構築するための高速でスケーラブルなSiZeUpを提案する。
提案手法では,3次元構造の抽象概念を低次元の最適化問題に還元し,フットプリントの高さを1つの高さパラメータで表現する。
効率よくロバストな高さ推定を可能にするため,単分子深度モデルにより予測される渦の相対的な深度秩序と深度事前との一致を強制する順序的深さ整合性損失を導入する。
これは、パラメトリックなビルディングプロキシを多視点の奥行き画像にマッピングする微分可能なレンダラによって実現され、奥行きの監督から高さへの勾配の伝播を可能にする。
我々の順序の定式化は、実際に安定した最適化を実現し、明示的な特徴マッチングや高密度点雲の再構成を避ける。
モノクラースケールの曖昧さの下では信頼性の低い計量深度に頼るのではなく、我々の順序の深さの整合性損失は相対的な深度で作用し、ビューをまたいだより信頼性の高い信号を提供する。
提案手法は,効率的な動的ビュー選択と組み合わせることで,最先端のプロキシ再構築パイプラインよりも23-52$\times$の高速化を実現し,これと同等なプロキシレベルのカバレッジとボリューム一貫性を維持しながら,大規模都市モデリングタスクに適している。
関連論文リスト
- Large Depth Completion Model from Sparse Observations [28.01552819701954]
LDCM(Large Depth Completion Model, Large Depth Completion Model)は、スパース観測による単視点距離深度推定のための、シンプルで効果的で堅牢なフレームワークである。
LDCMは変圧器を用いて計量精度の高い密度深度マップを生成する。
論文 参考訳(メタデータ) (2026-05-28T15:50:29Z) - In Depth We Trust: Reliable Monocular Depth Supervision for Gaussian Splatting [22.674046124865196]
幾何的監督にスケールあいまいでノイズの多い奥行きを取り入れたトレーニングフレームワークを導入する。
多様なデータセットに対する実験では、幾何精度が一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-04-07T11:15:15Z) - Pseudo Depth Meets Gaussian: A Feed-forward RGB SLAM Baseline [64.42938561167402]
本稿では,3次元ガウス型SLAMとフィードフォワードリカレント予測モジュールを組み合わせたオンライン3次元再構成手法を提案する。
このアプローチは、遅いテスト時間の最適化を高速なネットワーク推論に置き換え、トラッキング速度を大幅に改善する。
提案手法は,最先端のSplaTAMと同等の性能を示しながら,追跡時間を90%以上削減する。
論文 参考訳(メタデータ) (2025-08-06T16:16:58Z) - JointSplat: Probabilistic Joint Flow-Depth Optimization for Sparse-View Gaussian Splatting [10.690965024885358]
スパースの観点から3Dシーンを再構築することは、幅広いアプリケーションにおいて長年にわたる課題である。
近年のフィードフォワード3Dガウスのスパースビュー再構成法は, リアルタイムな新規ビュー合成のための効率的な解法である。
光学的流れと深さの相補性を利用する統一的なフレームワークであるJointSplatを提案する。
論文 参考訳(メタデータ) (2025-06-04T12:04:40Z) - Refinement of Monocular Depth Maps via Multi-View Differentiable Rendering [6.372979654151044]
現在の最先端のモノクル深度推定器は、広範囲なデータセットで訓練され、よく一般化されているが、多くのアプリケーションに必要な3D一貫性が欠如している。
本稿では,これらの一般化単分子深度推定手法の強度を多視点データと組み合わせ,これを解析・合成最適化問題としてフレーミングする。
提案手法は,室内シナリオの難易度においても,詳細な,高品質なビュー一貫性のある,正確な深度マップを生成でき,また,そのようなデータセット上での最先端のマルチビュー深度再構成手法よりも優れる。
論文 参考訳(メタデータ) (2024-10-04T18:50:28Z) - GEOcc: Geometrically Enhanced 3D Occupancy Network with Implicit-Explicit Depth Fusion and Contextual Self-Supervision [49.839374549646884]
本稿では,視覚のみのサラウンドビュー知覚に適したジオメトリ強化OccupancyネットワークであるGEOccについて述べる。
提案手法は,Occ3D-nuScenesデータセット上で,画像解像度が最小で,画像バックボーンが最大である状態-Of-The-Art性能を実現する。
論文 参考訳(メタデータ) (2024-05-17T07:31:20Z) - Self-Supervised Depth Completion Guided by 3D Perception and Geometry
Consistency [17.68427514090938]
本稿では,3次元の知覚的特徴と多視点幾何整合性を利用して,高精度な自己監督深度補完法を提案する。
NYU-Depthv2 と VOID のベンチマークデータセットを用いた実験により,提案モデルが最先端の深度補完性能を実現することを示す。
論文 参考訳(メタデータ) (2023-12-23T14:19:56Z) - FrozenRecon: Pose-free 3D Scene Reconstruction with Frozen Depth Models [67.96827539201071]
本稿では,3次元シーン再構成のための新しいテスト時間最適化手法を提案する。
本手法は5つのゼロショットテストデータセット上で,最先端のクロスデータセット再構築を実現する。
論文 参考訳(メタデータ) (2023-08-10T17:55:02Z) - TANDEM: Tracking and Dense Mapping in Real-time using Deep Multi-view
Stereo [55.30992853477754]
本稿では,リアルタイムな単分子追跡と高密度フレームワークであるTANDEMを紹介する。
ポーズ推定のために、TANDEMはアライメントのスライディングウィンドウに基づいて光度バンドル調整を行う。
TANDEMは最先端のリアルタイム3D再構成性能を示す。
論文 参考訳(メタデータ) (2021-11-14T19:01:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。