論文の概要: FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry
- arxiv url: http://arxiv.org/abs/2607.11588v1
- Date: Mon, 13 Jul 2026 14:10:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.499588
- Title: FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry
- Title(参考訳): FoundationGeo: モノクロ計量幾何学のための空間的画素幅場を学習する
- Authors: Muxin Liu, Xiaoyang Lyu, Tianhe Ren, Peng Dai, Xiaoshan Wu, Zhiyue Zhang, Jiaqi Zhang, Jiehong Lin, Shaoshuai Shi, Xiaojuan Qi,
- Abstract要約: FoundationGeoは空間キャリブレーションと原則データ設計による相対的および計量的予測を橋渡しする。
ステージ1は DINOv3 で初期化することで高忠実なアフィン不変幾何モデルを学ぶ。
ステージ2は、メートル法推定のためのピクセルワイドキャリブレーションフィールドを導入することで、グローバルなスケーリングを越えている。
- 参考スコア(独自算出の注目度): 52.232826445242644
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present FoundationGeo, a two-stage framework that explicitly bridges relative and metric prediction via spatial calibration and principled data design. Stage 1 learns a high-fidelity, affine-invariant geometry model by initializing with DINOv3 and training on a curated 10.2M-sample multi-domain corpus with complementary local-detail supervision, yielding sharp boundaries and strong cross-domain generalization. Stage 2 moves beyond global scaling by introducing lightweight pixel-wise calibration fields for metric estimation: a scale field for spatially varying metric alignment and a ray-direction correction field that mitigates directional bias in point-map geometry, together producing metrically consistent 3D point maps. Beyond model design, we identify camera intrinsic coverage, especially focal length distribution mismatch between training and test data, as a key bottleneck for zero-shot metric generalization: performance drops sharply when test intrinsics fall outside the training distribution. To address this, we synthesize additional training data across diverse focal lengths using a Blender-based data engine, repairing under-covered focal regimes and improving robustness under intrinsic shift. Extensive zero-shot evaluations across seven benchmarks show that FoundationGeo significantly strengthens cross-domain robustness, staying near the top across diverse domains while avoiding the sharp cross-domain performance drops observed in other methods. This consistency translates into the best overall performance, surpassing heavier baselines by over 5.2% on average.
- Abstract(参考訳): 本稿では,空間キャリブレーションと基本データ設計を通じて,相対的および計量的予測を明示的にブリッジする2段階のフレームワークであるFoundationGeoを紹介する。
ステージ1は、DINOv3を初期化して10.2Mサンプルのマルチドメインコーパスを訓練することで、高忠実でアフィン不変な幾何学モデルを学び、局所的な監督を補完し、鋭い境界と強いクロスドメインの一般化をもたらす。
ステージ2は、測度推定のための軽量な画素ワイドキャリブレーション場を導入して、グローバルなスケーリングを超えて、空間的に異なる距離アライメントのためのスケールフィールドと、ポイントマップ幾何学における方向バイアスを緩和する線方向補正場を導入し、計量的に一貫した3Dポイントマップを生成する。
モデル設計以外にも、カメラ固有のカバレッジ、特にトレーニングデータとテストデータ間の焦点距離分布のミスマッチを、ゼロショットメトリックの一般化の鍵となるボトルネックとして特定する。
そこで本研究では,Blenderベースのデータエンジンを用いて,多種多様な焦点距離のトレーニングデータを合成し,未発見の焦点条件を修復し,本質的なシフト下での堅牢性を向上させる。
7つのベンチマークにわたる広範囲なゼロショット評価は、FoundationGeoがクロスドメインの堅牢性を大幅に強化し、さまざまなドメインをまたいだトップに留まり、他のメソッドで観察される急激なクロスドメインのパフォーマンス低下を避けていることを示している。
この一貫性は全体として最高のパフォーマンスに変換され、平均して5.2%以上のベースラインを上回ります。
関連論文リスト
- UnderOneFacade: Worldwide Facade Semantic Segmentation Benchmark Dataset [19.044731989703468]
我々はこれまでで最大のクロスカントリーおよびクロスコンチネントな3DファサードベンチマークであるUnderOneFacadeを紹介した。
現状の手法は, きめ細かいアーキテクチャ要素の認識に苦慮し, 地理的領域で著しく劣化していることを示す。
UnderOneFacadeは、堅牢で移動可能な3Dセグメンテーションモデルを開発するための厳密なベンチマークを確立する。
論文 参考訳(メタデータ) (2026-07-02T10:50:01Z) - Efficient Hybrid CNN-GNN Architecture for Monocular Depth Estimation [0.0]
畳み込みエンコーダ・デコーダフレームワークにグラフニューラルネットワーク(GNN)を統合する単眼深度推定アーキテクチャであるGraphDepthを提案する。
我々のアプローチは、効率的なGraphSAGEレイヤをResNet-101 U-Netバックボーンの複数スケールに埋め込む。
NYU Depth V2、WHU Aerial、ETH3D、Mid-Airベンチマークの実験では、最先端のトランスフォーマーの4.6%で競合精度が示されている。
論文 参考訳(メタデータ) (2026-05-11T09:21:04Z) - XD-MAP: Cross-Modal Domain Adaptation using Semantic Parametric Mapping [5.609281438287908]
本稿では,センサ固有の知識を画像データセットからLiDARに転送する手法を提案する。
我々のXD-MAPは、カメラ画像上のニューラルネットワークからの検出を活用して意味的パラメトリックマップを作成する。
その結果,手動ラベリングを使わずにLiDARデータに対して高い性能を実現する手法の有効性が示された。
論文 参考訳(メタデータ) (2026-01-20T21:00:26Z) - Zero-shot Inexact CAD Model Alignment from a Single Image [53.37898107159792]
1つの画像から3Dシーン構造を推測する実践的なアプローチは、データベースから密に一致する3Dモデルを検索し、画像内のオブジェクトと整列させることである。
既存のメソッドは、イメージによる教師付きトレーニングとアノテーションのポーズに依存しており、オブジェクトカテゴリの狭いセットに制限されている。
ポーズアノテーションを必要とせず、未知のカテゴリに一般化する不正確な3次元モデルの弱い教師付き9-DoFアライメント法を提案する。
論文 参考訳(メタデータ) (2025-07-04T04:46:59Z) - Topology-Aware Modeling for Unsupervised Simulation-to-Reality Point Cloud Recognition [63.55828203989405]
我々はオブジェクトポイントクラウド上でSim2Real UDAのための新しいTopology-Aware Modeling (TAM)フレームワークを紹介する。
提案手法は,低レベルの高周波3次元構造を特徴とするグローバル空間トポロジを利用して,領域間隙を緩和する。
本稿では,クロスドメイン・コントラスト学習と自己学習を組み合わせた高度な自己学習戦略を提案する。
論文 参考訳(メタデータ) (2025-06-26T11:53:59Z) - TraIL-Det: Transformation-Invariant Local Feature Networks for 3D LiDAR Object Detection with Unsupervised Pre-Training [21.56675189346088]
本稿では変換不変ローカル(TraIL)機能と関連するTraIL-Detアーキテクチャを紹介する。
TraILの特徴は、厳密な変換不変性を示し、点密度の変動に効果的に適応する。
彼らはLiDARの固有の等方性放射を利用して局所的な表現を強化する。
提案手法は,KITTI上のmAPを用いて,現代自己監督型3次元物体検出手法より優れている。
論文 参考訳(メタデータ) (2024-08-25T17:59:17Z) - Boosting Cross-Domain Point Classification via Distilling Relational Priors from 2D Transformers [59.0181939916084]
従来の3Dネットワークは主に局所幾何学的詳細に焦点を当て、局所幾何学間の位相構造を無視する。
そこで本稿では,大規模画像上においてよく訓練されたトランスフォーマーから前駆体を抽出する,新しい先駆体蒸留法を提案する。
PointDA-10とSim-to-Realデータセットの実験は、提案手法が点クラウド分類におけるUDAの最先端性能を一貫して達成していることを検証する。
論文 参考訳(メタデータ) (2024-07-26T06:29:09Z) - CL3D: Unsupervised Domain Adaptation for Cross-LiDAR 3D Detection [16.021932740447966]
クロスLiDAR3D検出のためのドメイン適応は、生データ表現に大きなギャップがあるため困難である。
以上の課題を克服する、教師なしのドメイン適応手法を提案する。
論文 参考訳(メタデータ) (2022-12-01T03:22:55Z) - Pretrained equivariant features improve unsupervised landmark discovery [69.02115180674885]
我々は、この課題を克服する2段階の教師なしアプローチを、強力なピクセルベースの特徴を初めて学習することによって定式化する。
本手法は,いくつかの難解なランドマーク検出データセットにおいて最先端の結果を生成する。
論文 参考訳(メタデータ) (2021-04-07T05:42:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。