論文の概要: Learning Global Camera Poses from Noisy View-Graphs for Structure from Motion
- arxiv url: http://arxiv.org/abs/2609.09491v1
- Date: Tue, 08 Sep 2026 22:14:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.828614
- Title: Learning Global Camera Poses from Noisy View-Graphs for Structure from Motion
- Title(参考訳): ノイズの多い視点図からグローバルカメラポジショニングを学習して動きから構造を学習する
- Abstract要約: 本稿では,学習されたビューグラフの集約に基づくグローバルな構造抽出フレームワークを提案する。
提案手法では,雑音に富んだペアの相対的なポーズを取る変分同変エッジ条件グラフニューラルネットワークを用いる。
我々はMegaDepth, 1DSfM, Strecha, BlendedMVSについて検討した。
- 参考スコア(独自算出の注目度): 12.851731302874171
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Camera pose estimation is a key step in 3D reconstruction and view-synthesis pipelines. We present a deep, global Structure-from-Motion framework based on learned view-graph aggregation. Our method employs a permutation-equivariant, edge-conditioned graph neural network that takes noisy pairwise relative poses as input and outputs globally consistent camera extrinsics. The network is trained without ground-truth supervision, relying solely on a relative-pose consistency objective. This is followed by 3D point triangulation and robust bundle adjustment. Our approach is efficient, scalable to more than a thousand images, and robust to graph density. We evaluate our method on MegaDepth, 1DSfM, Strecha, and BlendedMVS. These experiments demonstrate that our method achieves superior rotation and translation accuracy compared to deep track-centric methods while registering more images across many scenes, and competitive results compared to state-of-the-art classical pipelines, while being much faster.
- Abstract(参考訳): カメラポーズ推定は、3D再構成とビュー合成パイプラインにおける重要なステップである。
本稿では,学習されたビューグラフの集約に基づくグローバルな構造抽出フレームワークを提案する。
提案手法では,一意に一貫したカメラ外在物として,ノイズに富んだペアの相対的なポーズを取り,一貫した一貫したカメラ外在物を出力する,変分同変のエッジ条件付きグラフニューラルネットワークを用いる。
ネットワークは、相対的な目的の一貫性の目的にのみ依存して、地道的な監督なしに訓練される。
この後、3次元点三角法とロバストなバンドル調整が続く。
私たちのアプローチは効率的で、1000以上の画像に対してスケーラブルで、グラフ密度に対して堅牢です。
我々はMegaDepth, 1DSfM, Strecha, BlendedMVSについて検討した。
これらの実験により,本手法は,多くのシーンにまたがってより多くの画像を登録しながら,深いトラック中心の手法と比較して高い回転精度と翻訳精度を実現し,また,最先端の古典的パイプラインに比べてより高速で競合的な結果が得られることを示した。
関連論文リスト
- Geo-Align: Video Generation Alignment via Metric Geometry Reward [53.65904111864641]
Geo-Alignは、カメラ制御ビデオ再レンダリング用に特別に設計された最初の強化学習フレームワークである。
事前訓練されたモデルに基づいて、スケールアウェアの知覚報酬機構を用いてモデルを最適化する。
実験により、Geo-Alignは、カメラの正確な制御性と視覚的忠実性の両方において、既存の教師付き学習ベースラインを一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-05-22T17:59:43Z) - Unblur-SLAM: Dense Neural SLAM for Blurry Inputs [68.94602568657164]
Un-SLAMは、ぼやけた画像入力から鋭い3D再構成を行うための新しいパイプラインである。
動作のぼやけとデフォーカスのぼやけの両方が存在する場合の最先端性能を実証する。
いくつかの実世界のデータセットの実験では、ポーズ推定とシャープな再構成結果の両方において一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-03-26T14:29:47Z) - FaVoR: Features via Voxel Rendering for Camera Relocalization [23.7893950095252]
カメラ再ローカライズ手法は、高密度画像アライメントから、クエリ画像からの直接カメラポーズ回帰まで様々である。
本稿では,世界規模で疎密だが局所的に密集した2次元特徴の3次元表現を活用する新しい手法を提案する。
一連のフレーム上でのランドマークの追跡と三角測量により、追跡中に観察された画像パッチ記述子をレンダリングするために最適化されたスパースボクセルマップを構築する。
論文 参考訳(メタデータ) (2024-09-11T18:58:16Z) - Visual Geometry Grounded Deep Structure From Motion [20.203320509695306]
本稿では,各コンポーネントが完全に微分可能で,エンドツーエンドでトレーニング可能な,新しいディープパイプラインVGGSfMを提案する。
まず, 深部2次元点追跡の最近の進歩をベースとして, 画素精度の高いトラックを抽出し, ペアマッチングのチェーン化の必要性を解消する。
私たちは、CO3D、IMC Phototourism、ETH3Dという3つの一般的なデータセットで最先端のパフォーマンスを達成しました。
論文 参考訳(メタデータ) (2023-12-07T18:59:52Z) - FrozenRecon: Pose-free 3D Scene Reconstruction with Frozen Depth Models [67.96827539201071]
本稿では,3次元シーン再構成のための新しいテスト時間最適化手法を提案する。
本手法は5つのゼロショットテストデータセット上で,最先端のクロスデータセット再構築を実現する。
論文 参考訳(メタデータ) (2023-08-10T17:55:02Z) - ParticleSfM: Exploiting Dense Point Trajectories for Localizing Moving
Cameras in the Wild [57.37891682117178]
本稿では,一対の光流からの高密度対応に基づく動画の高密度間接構造抽出手法を提案する。
不規則点軌道データを処理するために,新しいニューラルネットワークアーキテクチャを提案する。
MPIシンテルデータセットを用いた実験により,我々のシステムはより正確なカメラ軌道を生成することがわかった。
論文 参考訳(メタデータ) (2022-07-19T09:19:45Z) - FvOR: Robust Joint Shape and Pose Optimization for Few-view Object
Reconstruction [37.81077373162092]
数枚の画像から正確な3Dオブジェクトモデルを再構築することは、コンピュータビジョンにおいて難しい問題である。
FvORは、ノイズの多い入力ポーズを持つ数枚の画像から正確な3Dモデルを予測する学習ベースのオブジェクト再構成手法である。
論文 参考訳(メタデータ) (2022-05-16T15:39:27Z) - 3D Scene Geometry-Aware Constraint for Camera Localization with Deep
Learning [11.599633757222406]
近年、畳み込みニューラルネットワークに基づくエンドツーエンドのアプローチは、従来の3次元幾何学に基づく手法を達成または超えるように研究されている。
本研究では,絶対カメラポーズ回帰のためのコンパクトネットワークを提案する。
これらの従来の手法から着想を得た3Dシーンの幾何学的制約も、動き、深さ、画像の内容を含むすべての利用可能な情報を活用することによって導入される。
論文 参考訳(メタデータ) (2020-05-13T04:15:14Z) - Lightweight Multi-View 3D Pose Estimation through Camera-Disentangled
Representation [57.11299763566534]
空間校正カメラで撮影した多視点画像から3次元ポーズを復元する手法を提案する。
我々は3次元形状を利用して、入力画像をカメラ視点から切り離したポーズの潜在表現に融合する。
アーキテクチャは、カメラプロジェクション演算子に学習した表現を条件付け、ビュー当たりの正確な2次元検出を生成する。
論文 参考訳(メタデータ) (2020-04-05T12:52:29Z) - Image Matching across Wide Baselines: From Paper to Practice [80.9424750998559]
局所的な特徴とロバストな推定アルゴリズムの包括的なベンチマークを導入する。
パイプラインのモジュール構造は、さまざまなメソッドの容易な統合、構成、組み合わせを可能にします。
適切な設定で、古典的な解決策は依然として芸術の知覚された状態を上回る可能性があることを示す。
論文 参考訳(メタデータ) (2020-03-03T15:20:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。