論文の概要: Planar-SfM: Camera Pose Estimation via Homography Graph Embeddings
- arxiv url: http://arxiv.org/abs/2606.31979v2
- Date: Wed, 01 Jul 2026 07:10:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.090351
- Title: Planar-SfM: Camera Pose Estimation via Homography Graph Embeddings
- Title(参考訳): 平面SfM:ホログラフィグラフ埋め込みによるカメラポーズ推定
- Authors: Gabi Pragier, Matan Karklinsky, David Ungarish, Avi Ben-Cohen,
- Abstract要約: 各平面面は、ホモグラフィ分解により、相対カメラの相対的なポーズを独立に推定する。
本稿では、ホモグラフィー推定からポーズグラフを構築し、スペクトル埋め込みを用いて信頼できないエッジを識別・フィルタリングする新しいグラフベースのアプローチを提案する。
IMC Phototourismベンチマークの制約のない屋外シーンにおいて,既存の手法が苦戦しているバスケットボールコートイメージに優れたパフォーマンスを示す。
- 参考スコア(独自算出の注目度): 0.5799785223420272
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Structure from Motion (SfM) systems traditionally struggle with planar scenes, where standard epipolar geometry-based methods become degenerate. Rather than viewing planar surfaces as a limitation, we propose a unified framework that leverages them as a source of geometric constraints. Our key insight is that each planar surface visible across multiple views provides an independent estimate of relative camera poses through homography decomposition. By aggregating estimates from multiple planes or even from a single dominant plane we achieve robust pose recovery in scenarios where traditional methods fail. We introduce a novel graph-based approach that constructs a pose-graph from homography estimates and employs spectral embedding to identify and filter unreliable edges. Our method maps homography-based pose estimates onto the real line based on their geometric and visual consistency, enabling efficient extraction of a maximally consistent spanning tree for pose recovery. This approach naturally handles both highly planar scenes, such as indoor sports arenas, and general $3$D environments. We demonstrate superior performance on basketball court imagery where existing methods struggle, while matching or exceeding state-of-the-art results on unconstrained outdoor scenes from the IMC Phototourism benchmark.
- Abstract(参考訳): Structure from Motion (SfM) システムは伝統的に、標準のエピポーラ幾何学に基づく手法が縮退する平面的なシーンと競合する。
平面面を制限と見なすのではなく、幾何学的制約の源として活用する統一的な枠組みを提案する。
我々の重要な洞察は、複数のビューにまたがって見える各平面面は、ホモグラフィ分解による相対カメラのポーズを独立に推定できるということである。
複数の平面からの見積もりを集約したり、一つの支配的な平面からでも、従来のメソッドが失敗するシナリオで堅牢なポーズ回復を達成する。
本稿では、ホモグラフィー推定からポーズグラフを構築し、スペクトル埋め込みを用いて信頼できないエッジを識別・フィルタリングする新しいグラフベースのアプローチを提案する。
提案手法は,その幾何学的および視覚的整合性に基づいて,ホモグラフィに基づくポーズ推定を実線上にマッピングし,ポーズ回復のための最大一貫したスパンニングツリーの効率的な抽出を可能にする。
このアプローチは、屋内スポーツ競技場や一般的な3ドルの環境など、非常に平面的なシーンを自然に扱う。
IMC Phototourismベンチマークの制約のない屋外シーンにおいて,既存の手法が難航するバスケットボールコートイメージに優れたパフォーマンスを示す。
関連論文リスト
- Homographic Navigation: Geometry-Driven Camera Guidance for Deterministic Planar Capture [0.9036844836403516]
ホログラフィーナビゲーションは、平面領域の正確な捕捉に向けて、カメラの取得を導くための幾何学中心のフレームワークである。
我々は、ホモグラフ拡張による無制限な合成トレーニングデータを生成し、共同認識とローカライゼーションのための単一ショットモデルを訓練する。
実験の結果、最小限の監督で正確な平面アライメントが達成できることが示されている。
論文 参考訳(メタデータ) (2026-06-22T04:15:08Z) - Z-FLoc: Zero-Shot Floorplan Localization via Geometric Primitives [72.63181031215858]
そこで本研究では,ゼロショットフロアプランのローカライズ手法を提案する。
我々の重要な洞察は、支配的な幾何学的プリミティブが人間が作った環境でユビキタスであることである。
シミュレーションと実世界の両方のデータセットの実験により、我々のアプローチは、目に見えない環境における最先端の学習ベースの手法よりも優れています。
論文 参考訳(メタデータ) (2026-06-03T12:14:24Z) - Seamlessly Natural: Image Stitching with Natural Appearance Preservation [0.6089774484591287]
SENAは、パララックスと深度変化を特徴とする現実世界の挑戦的なシーンにおける構造的忠実度を優先する。
SENAは3つの重要なコントリビューションを通じて基本的な制限に対処する。
挑戦的なデータセットで行われた実験は、SENAが主要なホモグラフィーベースの手法に匹敵するアライメント精度を達成することを示した。
論文 参考訳(メタデータ) (2026-01-03T18:40:35Z) - G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior [53.762256749551284]
我々は,3次元シーン再構成を効果的に活用するための基本的な前提条件として,正確な幾何学を同定する。
生成パイプライン全体にこの幾何学的ガイダンスを導入し、可視性マスク推定を改善し、新しいビュー選択をガイドし、ビデオ拡散モデルに着色した場合の多視点一貫性を向上させる。
本手法は,屋内および屋外の両方のシナリオにおいて,高い一般化性を有するシングルビュー入力とアンポーズ映像を自然にサポートする。
論文 参考訳(メタデータ) (2025-10-14T03:06:28Z) - Gaussian Alignment for Relative Camera Pose Estimation via Single-View Reconstruction [18.936573991468926]
GARPSは、2つの独立して再構成された3Dシーンの直接的なアライメントとしてこの問題を論じる、トレーニング不要のフレームワークである。
差分可能なGMMアライメント目標を最適化することにより、フィードフォワード2ビューポーズ推定器の初期ポーズを洗練する。
Real-Estate10Kデータセットの実験では、GARPSが古典的および最先端の学習ベースの手法よりも優れていることが示されている。
論文 参考訳(メタデータ) (2025-09-17T02:57:34Z) - Loc$^2$: Interpretable Cross-View Localization via Depth-Lifted Local Feature Matching [80.57282092735991]
本稿では,高精度かつ解釈可能なクロスビューローカライズ手法を提案する。
地上画像の3自由度(DoF)のポーズを、その局所的な特徴と基準空中画像とをマッチングすることによって推定する。
実験では、クロスエリアテストや未知の向きといった挑戦的なシナリオにおいて、最先端の精度を示す。
論文 参考訳(メタデータ) (2025-09-11T18:52:16Z) - A Guide to Structureless Visual Localization [63.41481414949785]
既知のシーンにおけるクエリ画像のカメラポーズを推定する方法は、自動運転車や拡張現実/複合現実システムなど、多くのアプリケーションの中核的なコンポーネントである。
最先端のビジュアルローカライゼーションアルゴリズムは、シーンの3Dモデルを格納し、カメラポーズ推定モデルにおけるクエリ画像と3Dポイント間の2D-3D対応を利用する。
本論文は、私たちの知る限り、初めて包括的な議論を行い、構造化されていない手法の比較を行うものである。
論文 参考訳(メタデータ) (2025-04-24T15:08:36Z) - FG$^2$: Fine-Grained Cross-View Localization by Fine-Grained Feature Matching [69.81167130510333]
本研究では, 地上画像の3次元自由度ポーズを, 周囲の空中画像から推定する, 微粒なクロスビューローカライゼーション手法を提案する。
地中画像から生成された点面と地中画像からサンプリングされた点面とを合わせ、ポーズを推定する。
従来の最先端技術と比較して,VIGORクロスエリアテストセットでは,平均局所化誤差を28%削減する。
論文 参考訳(メタデータ) (2025-03-24T14:34:20Z) - RelPose: Predicting Probabilistic Relative Rotation for Single Objects
in the Wild [73.1276968007689]
本稿では、任意のオブジェクトの複数の画像からカメラ視点を推定するデータ駆動手法について述べる。
本手法は, 画像の鮮明さから, 最先端のSfM法とSLAM法より優れていることを示す。
論文 参考訳(メタデータ) (2022-08-11T17:59:59Z) - GeoFill: Reference-Based Image Inpainting of Scenes with Complex
Geometry [40.68659515139644]
参照誘導画像描画は、他の参照画像からのコンテンツを活用して画像画素を復元する。
我々は、単眼深度推定を利用して、カメラ間の相対的なポーズを予測し、その基準画像を異なる3次元再投影により目標に整列させる。
提案手法は,RealEstate10KとMannequinChallengeの両方のデータセットに対して,大規模なベースライン,複雑な幾何学,極端なカメラモーションによる最先端性能を実現する。
論文 参考訳(メタデータ) (2022-01-20T12:17:13Z) - Depth-Aware Multi-Grid Deep Homography Estimation with Contextual
Correlation [38.95610086309832]
ホログラフィー推定は、画像ステッチ、ビデオ安定化、カメラキャリブレーションなどのコンピュータビジョンにおいて重要なタスクである。
従来のホモグラフィー推定法は特徴点の量と分布に依存するため、テクスチャレスシーンではロバスト性が低い。
特徴写像上の長距離相関を捉えることができ、学習フレームワークに柔軟にブリッジできるコンテキスト相関層を提案する。
我々は,新しい深度認識型形状保存損失を導入することで,ネットワークに深度知覚能力を持たせる。
論文 参考訳(メタデータ) (2021-07-06T10:33:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。