論文の概要: ObliCity: A Benchmark and Baseline for Roof-to-Ground Projection Displacement Correction
- arxiv url: http://arxiv.org/abs/2607.25210v1
- Date: Tue, 28 Jul 2026 02:31:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.683129
- Title: ObliCity: A Benchmark and Baseline for Roof-to-Ground Projection Displacement Correction
- Title(参考訳): A Benchmark and Baseline for Roof-to-Ground Projection Displacement Correction
- Authors: Kai Li, Yupeng Deng, Ligao Deng, Zhihao Xi, Chenhao Wang, Jierui Zhang, Yingrui Ji, Yu Meng, Xiangyu Zhao,
- Abstract要約: Roof-to-footprint offset vector(RFOV)抽出は、意味的セグメンテーションから幾何学的アライメントを分離する学習タスクである。
方法論的には、DragOSMを人間行動にインスパイアされたODEベースのフレームワークであるDragRoofに再構成する。
ObliCityの実験は、DragRoofが最先端のRFOV抽出性能を達成することを示した。
- 参考スコア(独自算出の注目度): 23.351835462733074
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Oblique-view urban remote sensing imagery inevitably exhibits geometric projection displacements between building roofs and footprints, leading to significant distortions in spatial structure. Existing approaches either ignore these deformations or handle them implicitly within segmentation-based frameworks, where progress is dominated by general segmentation advances rather than improvements in geometric correction. In this work, we explicitly define roof-to-footprint offset vector (RFOV) extraction as an independent learning task that decouples geometric alignment from semantic segmentation. To support this task, we introduce the Oblique City dataset (ObliCity), the first large-scale benchmark that integrates high-resolution UAV imagery and globally distributed satellite data, covering diverse city morphologies and camera perspectives. Methodologically, we reformulate DragOSM into DragRoof, an ODE-based framework inspired by human annotation behavior. By simulating the continuous process of dragging roofs toward their footprints, DragRoof learns deterministic, geometry-consistent offset fields and adaptively determines convergence through an end token. Extensive experiments on ObliCity demonstrate that DragRoof achieves state-of-the-art RFOV extraction performance, requiring fewer inference steps while delivering superior directional and length accuracy. Our dataset and model establish a principled foundation for studying projection displacement correction in oblique remote sensing imagery. The source code and dataset will be avaliable at https://github.com/likaiucas/DragRoof.
- Abstract(参考訳): 斜視の都市リモートセンシング画像は、建築屋根とフットプリントの間の幾何学的投射変位を必然的に示し、空間構造に大きな歪みをもたらす。
既存のアプローチでは、これらの変形を無視したり、セグメント化ベースのフレームワーク内で暗黙的に処理する。
本研究では,屋上からフットプリントまでのオフセットベクトル(RFOV)抽出を,意味的セグメンテーションから幾何学的アライメントを分離する独立した学習タスクとして明確に定義する。
この課題を支援するために,高解像度UAV画像とグローバルに分散した衛星データを統合し,多様な都市形態とカメラ視点を網羅した,最初の大規模ベンチマークであるObliCityデータセット(ObliCity)を紹介した。
方法論的には、DragOSMを人間のアノテーションの振る舞いにインスパイアされたODEベースのフレームワークであるDragRoofに再構成する。
屋根を足跡に向かってドラッグする連続過程をシミュレートすることで、ドラグルーフは決定論的で幾何学的に一貫性のあるオフセット場を学び、終点トークンを通して収束を適応的に決定する。
ObliCityに関する大規模な実験は、DragRoofが最先端のRFOV抽出性能を達成し、より優れた方向と長さの精度を提供しながら、推論ステップを少なくすることを示した。
我々のデータセットとモデルは、斜めリモートセンシング画像における投影変位補正の基本的な基礎を確立する。
ソースコードとデータセットはhttps://github.com/likaiucas/DragRoof.comで検証可能である。
関連論文リスト
- TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive [19.699267665705715]
TerraDiT-$は、任意のネイティブプリミティブから直接衛星画像を生成する統合空間制御フレームワークである。
生成モデルは驚くべき進歩を遂げているが、衛星画像に適用することは依然として困難である。
論文 参考訳(メタデータ) (2026-06-30T01:56:41Z) - GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation [6.488530751190965]
全体移動操作には移動基地とマニピュレータの調整が必要である。
我々は、シンプルな原理に基づいて構築された、エンドツーエンドの拡散ベースのフレームワークGeoHATを提案する。
ManiSkill-HABシミュレーションベンチマークの実験では、GeoHATが79.3%の成功率を達成した。
論文 参考訳(メタデータ) (2026-06-11T14:25:09Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video [76.32954467706581]
本稿では,生のビデオストリームからGEometric foundationモデルのスケーラブル適応を行うフレームワークであるSAGEを提案する。
階層的なマイニングパイプラインを使用して、ビデオをトレーニングトラジェクトリやハイブリッド監視に変換します。
実験の結果、SAGEはゼロショットの一般化を著しく向上し、チェムファー距離を20-42%削減した。
論文 参考訳(メタデータ) (2026-02-08T09:53:21Z) - From Editor to Dense Geometry Estimator [77.21804448599009]
密度幾何予測のための拡散変換器(DiT)アーキテクチャに基づく高度な編集モデルを適用するフレームワークである textbfFE2E を紹介する。
FE2EはETH3Dデータセットで35%以上のパフォーマンス向上を実現し、100$times$データでトレーニングされたDepthAnythingシリーズを上回っている。
論文 参考訳(メタデータ) (2025-09-04T15:58:50Z) - Boosting Cross-Domain Point Classification via Distilling Relational Priors from 2D Transformers [59.0181939916084]
従来の3Dネットワークは主に局所幾何学的詳細に焦点を当て、局所幾何学間の位相構造を無視する。
そこで本稿では,大規模画像上においてよく訓練されたトランスフォーマーから前駆体を抽出する,新しい先駆体蒸留法を提案する。
PointDA-10とSim-to-Realデータセットの実験は、提案手法が点クラウド分類におけるUDAの最先端性能を一貫して達成していることを検証する。
論文 参考訳(メタデータ) (2024-07-26T06:29:09Z) - Cross-view Geo-localization via Learning Disentangled Geometric Layout
Correspondence [11.823147814005411]
クロスビュージオローカライゼーションは、参照ジオタグ付き空中画像データベースとマッチングすることで、クエリーグラウンド画像の位置を推定することを目的としている。
最近の研究は、クロスビューなジオローカライゼーションベンチマークにおいて顕著な進歩を遂げている。
しかし、既存の手法は依然としてクロスエリアベンチマークのパフォーマンスの低下に悩まされている。
論文 参考訳(メタデータ) (2022-12-08T04:54:01Z) - Geometry-Contrastive Transformer for Generalized 3D Pose Transfer [95.56457218144983]
この研究の直感は、与えられたメッシュ間の幾何学的不整合を強力な自己認識機構で知覚することである。
本研究では,グローバルな幾何学的不整合に対する3次元構造的知覚能力を有する新しい幾何学コントラスト変換器を提案する。
本稿では, クロスデータセット3次元ポーズ伝達タスクのための半合成データセットとともに, 潜時等尺正則化モジュールを提案する。
論文 参考訳(メタデータ) (2021-12-14T13:14:24Z) - Sign-Agnostic CONet: Learning Implicit Surface Reconstructions by
Sign-Agnostic Optimization of Convolutional Occupancy Networks [39.65056638604885]
畳み込み型ネットワークの符号非依存最適化により暗黙的表面再構成を学習する。
この目標をシンプルで効果的な設計で効果的に達成できることを示す。
論文 参考訳(メタデータ) (2021-05-08T03:35:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。