論文の概要: GeoStereo: A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal
- arxiv url: http://arxiv.org/abs/2607.24024v2
- Date: Mon, 03 Aug 2026 05:02:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.332515
- Title: GeoStereo: A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal
- Title(参考訳): GeoStereo: 相違と表面正規化のための統合ステレオ幾何推定フレームワーク
- Abstract要約: GeoStereoは統合されたステレオ幾何推定フレームワークである。
フィードフォワードステレオマッチングパイプラインと拡散に基づく正規推定ブランチを結合する。
低照度環境を含む、挑戦的なシナリオで確実に機能する。
- 参考スコア(独自算出の注目度): 9.795622920077477
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Stereo matching and surface normal estimation are fundamental tasks in 3D vision. However, existing feed-forward stereo methods still struggle to produce reliable predictions in challenging regions, mainly due to the lack of strong geometric priors. In this paper, we propose $\textbf{GeoStereo}$, a unified stereo geometry estimation framework that leverages powerful diffusion priors to jointly predict disparity and surface normals. Specifically, GeoStereo couples a feed-forward stereo matching pipeline with a diffusion-based normal estimation branch. To enable effective interaction between the two tasks, we introduce a disparity to normal initialization strategy and construct a warp to left-view condition for the diffusion process. This coupled design allows the diffusion branch to provide strong structural priors that enhance disparity estimation in ill-posed regions, while the feed-forward branch offers reliable geometric guidance for accurate normal prediction. Extensive experiments show that GeoStereo performs reliably in challenging scenarios, including low-light environments, highly reflective surfaces, and transparent objects. Under zero-shot settings, it achieves Rank-1 disparity estimation on multiple benchmarks, including KITTI and NYUv2, and delivers the best normal estimation accuracy on many real indoor benchmarks, such as iBims-1 and ScanNet. Project page: https://qz-wei.github.io/GeoStereo.github.io/
- Abstract(参考訳): ステレオマッチングと表面正規推定は3次元視覚の基本課題である。
しかし、既存のフィードフォワードステレオ法は、主に強い幾何学的先行性の欠如のために、挑戦的な領域で信頼できる予測を生成するのに依然として苦労している。
本稿では,差分と表面の正規度を共同で予測するために,強力な拡散先を利用する統合ステレオ幾何推定フレームワークである$\textbf{GeoStereo}$を提案する。
具体的には、GeoStereoは拡散に基づく正規推定ブランチとフィードフォワードステレオマッチングパイプラインを結合する。
2つのタスク間の効果的な相互作用を実現するために,通常の初期化戦略と拡散過程の左ビュー条件のワープ構築の相違を導入する。
この結合設計により、拡散分岐は、不測領域における不定値推定を向上する強力な構造的先行情報を提供し、フィードフォワード分岐は、正確な正規予測のための信頼できる幾何学的ガイダンスを提供する。
大規模な実験により、GeoStereoは低照度環境、反射率の高い表面、透明な物体など、困難なシナリオで確実に機能することが示された。
ゼロショット設定では、KITTIやNYUv2を含む複数のベンチマークでランク1の差分推定を達成し、iBims-1やScanNetなど多くの屋内ベンチマークで最高の正規推定精度を提供する。
プロジェクトページ:https://qz-wei.github.io/GeoStereo.github.io/
関連論文リスト
- H-OmniStereo: Zero-Shot Omnidirectional Stereo Matching with Heading-Aligned Normal Priors [39.6437115448559]
H-OmniStereoはゼロショット全方位ステレオマッチングフレームワークである。
我々は280万以上のトップボトム等方形ステレオペアからなる高品質な合成データセットを構築した。
提案手法はドメイン外データセットの既存手法よりも精度が高い。
論文 参考訳(メタデータ) (2026-05-14T15:30:22Z) - Faster 3D Gaussian Splatting Convergence via Structure-Aware Densification [52.517763621139956]
3Dガウススプラッティングは、リアルタイムのノベルビュー合成のための強力なシーン表現として登場した。
標準適応密度制御は画面空間の位置勾配に依存する。
本稿では,3次元ガウススプラッティングのための構造認識型密度化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-30T15:37:20Z) - Unifying UAV Cross-View Geo-Localization via 3D Geometric Perception [51.687842983240564]
無人航空機(UAV)のクロスビューな地上局地化は、斜めのUAV画像と衛星地図との厳密な幾何学的相違により、いまだに困難である。
本稿では,3次元シーン形状を明示的にモデル化し,粗い位置認識ときめ細かなポーズ推定を統一する,幾何認識型UAV測位フレームワークを提案する。
提案手法は, 最先端のベースラインを著しく上回り, ロバストメータレベルのローカライゼーション精度を実現し, 複雑な都市環境における一般化を向上する。
論文 参考訳(メタデータ) (2026-04-02T08:08:41Z) - TopoMaskV3: 3D Mask Head with Dense Offset and Height Predictions for Road Topology Understanding [6.043109546012043]
TopoMaskV3は、2つの新しい密度予測ヘッドを介して、頑丈でスタンドアロンな3D予測器である。
我々は,道路トポロジ評価において,地理的データ漏洩に最初に対処した人物である。
TopoMaskV3は、地理的に結合しないベンチマークで最先端の28.5OLSを達成する。
論文 参考訳(メタデータ) (2026-03-02T07:33:46Z) - Dens3R: A Foundation Model for 3D Geometry Prediction [44.13431776180547]
Dens3Rは幾何学的密度予測のための3次元基礎モデルである。
画像対マッチング機能と本質的不変性モデリングを統合することにより、Dens3Rは複数の幾何学的量を正確に回帰する。
論文 参考訳(メタデータ) (2025-07-22T07:22:30Z) - Boosting Omnidirectional Stereo Matching with a Pre-trained Depth Foundation Model [70.67610495024459]
カメラベースの設定は、立体深度推定を用いて高解像度の高解像度深度マップを生成することで、コスト効率のよい選択肢を提供する。
既存の全方位ステレオマッチング手法は、様々な環境において限られた深度精度しか達成できない。
DFI-OmniStereoは, 大規模事前学習基礎モデルを用いて, 相対的な単眼深度推定を行う新しい全方位ステレオマッチング法である。
論文 参考訳(メタデータ) (2025-03-30T16:24:22Z) - FoundationStereo: Zero-Shot Stereo Matching [50.79202911274819]
FoundationStereoはステレオ深度推定の基礎モデルである。
まず,大規模(1Mステレオペア)合成学習データセットを構築した。
その後、スケーラビリティを高めるために、多数のネットワークアーキテクチャコンポーネントを設計します。
論文 参考訳(メタデータ) (2025-01-17T01:01:44Z) - SR-Stereo & DAPE: Stepwise Regression and Pre-trained Edges for Practical Stereo Matching [2.8908326904081334]
ドメインの相違を克服する新しい段階的回帰アーキテクチャを提案する。
疎基底真理で新しいドメインを適応するモデルのエッジ認識を高めるために,事前学習エッジ(DAPE)に基づくドメイン適応を提案する。
提案したSR-StereoとDAPEは,SceneFlow,KITTI,Middbury 2014,ETH3Dで広く評価されている。
論文 参考訳(メタデータ) (2024-06-11T05:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。