論文の概要: Glob3R: Global Structure-from-Motion with 3D Foundation Models
- arxiv url: http://arxiv.org/abs/2607.09225v1
- Date: Fri, 10 Jul 2026 09:18:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.814912
- Title: Glob3R: Global Structure-from-Motion with 3D Foundation Models
- Title(参考訳): Glob3R:3Dファウンデーションモデルによるグローバルな構造制御
- Abstract要約: Glob3Rは3Dファウンデーションモデルに基づいて構築されたグローバルなSfMスタイルの再構築である。
私たちのキーとなるアイデアは、フィードフォワード幾何学的予測を明示的に最適化することです。
屋内、屋外、大規模運転、および非秩序なSfMベンチマークの実験は、Glob3Rが堅牢で正確な再構築を実現することを示した。
- 参考スコア(独自算出の注目度): 44.33296410481359
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent 3D geometric foundation models, such as VGGT, provide robust feed-forward 3D reconstruction by directly predicting camera poses and 3D scene points from input images. However, their results remain inaccurate, and scaling them to long sequences or large unordered image sets typically requires chunk-wise processing, which can introduce drift and inconsistency. We present Glob3R, a global SfM-style reconstruction built on 3D foundation models. Our key idea is to explicitly optimize feed-forward geometric predictions. To this end, we augment a frozen Pi3X backbone with a lightweight dense matching head that predicts image warps between selected reference frames and neighboring views. These dense warps are converted into sparse but reliable multi-view feature tracks, which provide correspondence constraints for global optimization. We further introduce a keyframe-based sliding-window association strategy that propagates tracks and relative poses across overlapping windows, enabling scalable reconstruction. Finally, we perform global motion averaging and bundle adjustment to refine camera poses, reduce scale inconsistencies, and recover dense scene geometry. Extensive experiments on indoor, outdoor, large-scale driving, and unordered SfM benchmarks demonstrate that Glob3R achieves robust and accurate reconstruction. It consistently improves over feed-forward foundation-model baselines and recent scalable reconstruction methods, while being more robust than classical SfM pipelines. The refined poses also lead to higher-quality neural rendering, validating the benefit of combining foundation-model priors with global geometric optimization. Project page: https://junyuandeng.github.io/Glob3r
- Abstract(参考訳): 近年のVGGTのような幾何学的基礎モデルでは、入力画像からカメラのポーズや3Dシーンポイントを直接予測することで、フィードフォワード3Dの堅牢な再構築が実現されている。
しかし、それらの結果は依然として不正確であり、長いシーケンスや大きな未順序のイメージセットにスケールするには、通常チャンクワイズ処理が必要であり、ドリフトと矛盾をもたらす可能性がある。
本稿では,3次元基礎モデルに基づくグローバルなSfMスタイルの再構築Glob3Rを提案する。
私たちのキーとなるアイデアは、フィードフォワード幾何学的予測を明示的に最適化することです。
この目的のために、選択した参照フレームと隣接するビュー間の画像ワープを予測する軽量な濃密なマッチングヘッドにより、凍結したPi3Xバックボーンを増強する。
これらの高密度ワープはスパースだが信頼性の高いマルチビュー特徴トラックに変換され、グローバル最適化のための対応制約を提供する。
さらに、重なり合うウィンドウをまたいでトラックや相対的なポーズを伝搬し、スケーラブルな再構築を可能にするキーフレームベースのスライディングウィンドウアソシエーション戦略を導入する。
最後に,グローバルな動き平均化とバンドル調整を行い,カメラのポーズを洗練し,スケールの不整合を低減し,密集したシーン形状を復元する。
屋内、屋外、大規模運転、および非秩序なSfMベンチマークに関する大規模な実験は、Glob3Rが堅牢で正確な再構築を実現することを示した。
フィードフォワードのファンデーションモデルベースラインと最近のスケーラブルな再構築方法よりも一貫して改善され、従来のSfMパイプラインよりも堅牢である。
洗練されたポーズはまた、高品質なニューラルレンダリングをもたらし、ファンデーションモデルの先行とグローバルな幾何学的最適化を組み合わせる利点を検証している。
プロジェクトページ:https://junyuandeng.github.io/Glob3r
関連論文リスト
- GeoWeaver: Accurate Long-Sequence 3D Reconstruction via Hierarchical Geometric Assembly [23.486108847409856]
RGBビデオからの長時間の3D再構成には、正確な局所幾何学と一貫したカメラモーションの両方が必要である。
Geometric Prior Model(GPM)とTest-Time Adaptation(TTA)を組み合わせた統合フレームワークGeoWeaverを提案する。
TTAは、シーケンシャルでグローバルなチャンクレベルSim(3)アライメントと、カメラのポーズ、アフィン深さ補正、および本質的な精細化を行う。
さまざまな時系列ベンチマークによる実験では、カメラの精度の向上、グローバルな一貫性、ポイントクラウドの品質が示されている。
論文 参考訳(メタデータ) (2026-08-18T05:29:31Z) - DGSfM: Depth-Guided Scale-Aware Global Structure-from-Motion [40.127097529332815]
本稿では,DGSfMを提案する。DGSfMは,モノクル深度マップを拡張性のある先行モデルとして用いるグローバルSfMパイプラインである。
各画像対に対して、深度対応の相対ポーズソルバを用いて、拡大あいまいなエピポーラ制約をスケール対応の相対ポーズ制約に変換する。
ETH3D と IMC2021 の実験では、DGSfM はスパースと密集したフロントエンドをまたいだ強いグローバルな SfM ベースラインよりも一貫して改善されている。
論文 参考訳(メタデータ) (2026-07-10T15:18:37Z) - S-MUSt3R: Sliding Multi-view 3D Reconstruction [17.018626984951823]
本研究はS-MUSt3Rを提案する。S-MUSt3Rは単分子3次元再構成のための基礎モデルの限界を拡張するシンプルで効率的なパイプラインである。
我々は,S-MUSt3Rが長いRGBシーケンス上で正常に動作し,高精度で一貫した3D再構成を実現することを示す。
論文 参考訳(メタデータ) (2026-02-04T13:07:14Z) - TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction [57.46712611558817]
3次元視覚基礎モデルでは、1つのフィードフォワードパスを通して、未校正画像からキー3D属性を再構成する際の強力な一般化が示されている。
近年の戦略は,グローバルトランスフォーメーションの解決によって連続的な予測と整合するが,本分析では,仮定の妥当性,局所的なアライメント範囲,雑音的幾何の下でのロバスト性といった基本的な限界を明らかにしている。
本研究では,グローバルに伝播する制御点を利用して空間的に異なる不整合を補正する,Tin Plate Splineに基づく高DOFおよび長期アライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T02:22:20Z) - WorldMirror: Universal 3D World Reconstruction with Any-Prior Prompting [51.69408870574092]
汎用的な3次元幾何予測タスクのためのオールインワンフィードフォワードモデルであるWorldMirrorを提案する。
我々のフレームワークは、カメラのポーズ、内在性、深度マップなど、様々な幾何学的先入観を柔軟に統合する。
WorldMirrorは、カメラ、ポイントマップ、深さ、表面正規推定から新しいビュー合成に至るまで、さまざまなベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-10-12T17:59:09Z) - PF3plat: Pose-Free Feed-Forward 3D Gaussian Splatting [54.7468067660037]
PF3platは、設計選択を検証した包括的なアブレーション研究によってサポートされた、すべてのベンチマークに新しい最先端を設定します。
本フレームワークは,3DGSの高速,スケーラビリティ,高品質な3D再構成とビュー合成機能を活用している。
論文 参考訳(メタデータ) (2024-10-29T15:28:15Z) - FrozenRecon: Pose-free 3D Scene Reconstruction with Frozen Depth Models [67.96827539201071]
本稿では,3次元シーン再構成のための新しいテスト時間最適化手法を提案する。
本手法は5つのゼロショットテストデータセット上で,最先端のクロスデータセット再構築を実現する。
論文 参考訳(メタデータ) (2023-08-10T17:55:02Z) - SparseFusion: Dynamic Human Avatar Modeling from Sparse RGBD Images [49.52782544649703]
本稿では,RGBDフレームのスパース集合に基づく3次元人体形状の再構築手法を提案する。
主な課題は、これらのスパースフレームを標準的な3Dモデルにしっかりと融合させる方法だ。
私たちのフレームワークは柔軟で、潜在的なアプリケーションは形状の再構築を超えています。
論文 参考訳(メタデータ) (2020-06-05T18:53:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。