論文の概要: MVDG: Efficient Multi-view 3D Disambiguation on Unconstrained Real-World Images
- arxiv url: http://arxiv.org/abs/2610.01098v1
- Date: Thu, 01 Oct 2026 05:41:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.919878
- Title: MVDG: Efficient Multi-view 3D Disambiguation on Unconstrained Real-World Images
- Title(参考訳): MVDG:制約のない実世界の画像における効率的なマルチビュー3次元曖昧化
- Abstract要約: 本稿では,3次元基礎モデルVGGT上に構築されたスケーラブルなマルチビュー曖昧化フレームワークMVDGを紹介する。
本手法は,1回のパスでビューを符号化・復号することで,ペア比較への依存を低減する。
実験により,本手法はSfM精度と推定速度の両方をベースライン上で向上させながら,同等のペアワイズ精度を実現することが示された。
- 参考スコア(独自算出の注目度): 10.986356944383973
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Illusory matches between distinct yet visually similar 3D surfaces--doppelgangers--remain a fundamental obstacle for large-scale, in-the-wild 3D reconstruction and visual localization. Prior work mitigates this issue with pairwise classifiers, but this design limits multi-view contextual reasoning and incurs O(n^2) inference complexity for downstream structure-from-motion (SfM). We present MVDG, a scalable multi-view disambiguation framework built on the 3D foundation model VGGT, which jointly reasons over an arbitrary number of multiview images. By incorporating 3D-aware multi-view features, our method reduces dependence on pairwise comparisons by encoding and decoding views in a single pass. We further observe that direct multi-view fine-tuning of VGGT can be unstable under noisy supervision; motivated by label ambiguity in Doppelgangers, we construct a pseudo-pairwise training set from AerialMegaDepth and show that fine-tuning on sampled subsets yields stable optimization and strong generalization to held-out scenes. Finally, because full SfM evaluation (even with faster pipelines such as GLOMAP) remains expensive, we process a pseudo-pairwise dataset for efficient validation; we derive a predictive relationship between regular SfM metrics and the classification accuracy on this pseudo-pairwise test. Experiments show that our method achieves comparable pairwise accuracy while improving both SfM accuracy and inference speed over baselines.
- Abstract(参考訳): 異なるが視覚的に類似した3次元表面のIllusory Match----doppelgangers--は、大規模な3次元再構成と視覚的位置決めの基本的な障害を残している。
事前の作業では、この問題をペアワイズ分類器で緩和するが、この設計では、マルチビューの文脈推論が制限され、下流構造からの移動(SfM)に対するO(n^2)推論の複雑さが生じる。
本稿では3次元基礎モデルVGGT上に構築されたスケーラブルなマルチビュー曖昧化フレームワークMVDGについて述べる。
本手法は,3D対応マルチビュー機能を導入することにより,一パスでビューを符号化・復号することで,ペア比較への依存を低減する。
さらに,VGGTの直接的多視点微調整はうるさい監督下では不安定であり,ドッペルガンガーのラベル曖昧さを動機として,AerialMegaDepthから擬似ペアワイズトレーニングセットを構築し,サンプル部分集合の微調整が安定した最適化と保留シーンへの強い一般化をもたらすことを示す。
最後に、(GLOMAPのような高速パイプラインでも)完全なSfM評価が高価であるため、効率の良い検証のために擬似ペアワイズデータセットを処理し、この擬似ペアワイズテストにおける正規SfMメトリクスと分類精度との予測的関係を導出する。
実験により,本手法はSfM精度と推定速度の両方をベースライン上で向上させながら,同等のペアワイズ精度を実現することが示された。
関連論文リスト
- G-MASt3R-SfM: Graph-based View Pruning and Multi-stage Optimization for Robust SfM [1.3048920509133808]
G-MASt3R-SfMは、2つの鍵モジュールによるロバスト性を高める新しいSfMパイプラインである。
まず、グラフベースのビュープルーニング(GVP)モジュールは、信頼度と幾何学的に不規則なビューとの整合性からシーングラフを構築する。
第二に、マルチステージ最適化(MSO)モジュールは、最適化範囲を局所的な一貫性からグローバルな一貫性へと拡張することで、カメラパラメータを段階的に洗練する。
論文 参考訳(メタデータ) (2026-06-22T05:01:08Z) - DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation [58.47973015036709]
DisPOSEは、本質的に離散的な多視点人物割り当て問題を近似する自己教師型フレームワークである。
特定可能なシンクホーン射影を用いることにより、本モデルは有効かつ実現可能な課題への解の導出を学ぶ。
提案手法は、標準データセット上での最先端の自己教師手法よりも優れている。
論文 参考訳(メタデータ) (2026-06-05T16:14:39Z) - MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction [14.717756921141364]
MV-RoMaは、ソース画像から複数の可視目標への密対応を推定する多視点密マッチングモデルである。
我々は、モデルが一貫したマルチビュー対応を、構造移動のための高品質トラックとして統合する後処理戦略を提案する(SfM)。
MV-RoMaは既存のスパース法や密マッチング法よりも信頼性が高く、かなり密集した3次元再構成を行う。
論文 参考訳(メタデータ) (2026-03-29T06:50:21Z) - COMPOSE: Hypergraph Cover Optimization for Multi-view 3D Human Pose Estimation [58.47973015036709]
スパース多視点からの3次元ポーズ推定は、行動認識、スポーツ分析、人間とロボットの相互作用にとって重要な課題である。
ハイパーグラフ問題として多視点ポーズ対応マッチングを定式化する新しいフレームワークComposEを提案する。
COMPOSEは,従来の最適化手法よりも平均23%,自己教師付きエンドツーエンド学習手法より最大11%の精度向上を実現している。
論文 参考訳(メタデータ) (2026-01-14T18:50:17Z) - econSG: Efficient and Multi-view Consistent Open-Vocabulary 3D Semantic Gaussians [56.85804719947]
3DGSを用いたオープン語彙セマンティックセマンティックセグメンテーションのためのeconSGを提案する。
筆者らのeconSGは,既存手法と比較して,4つのベンチマークデータセット上での最先端性能を示す。
論文 参考訳(メタデータ) (2025-04-08T13:12:31Z) - Doppelgangers++: Improved Visual Disambiguation with Geometric 3D Features [30.225172410427447]
ドッペルガンガー検出の精度を高め、3次元再構成精度を向上させる手法であるドッペルガンガース++を提案する。
私たちのコントリビューションには、ランドマークベースのデータセットを超えて拡大するために、日々のシーンからジオタグ付きイメージを組み込んだ、多様なトレーニングデータセットが含まれています。
Doppelgangers++は、標準的なSfMとMASt3R-SfMパイプラインにシームレスに統合され、さまざまなシーンで効率性と適応性を提供する。
論文 参考訳(メタデータ) (2024-12-08T06:08:47Z) - PCF-Lift: Panoptic Lifting by Probabilistic Contrastive Fusion [80.79938369319152]
我々は,PCF(Probabilis-tic Contrastive Fusion)に基づくPCF-Liftという新しいパイプラインを設計する。
私たちのPCFリフトは、ScanNetデータセットやMessy Roomデータセット(シーンレベルのPQが4.4%改善)など、広く使用されているベンチマークにおいて、最先端の手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2024-10-14T16:06:59Z) - S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR [50.435592120607815]
外科手術のシーングラフ生成(SGG)は、手術室(OR)におけるホモロジー認知知能の増強に不可欠である
これまでの研究は主に多段階学習に依存しており、生成したセマンティックシーングラフはポーズ推定とオブジェクト検出を伴う中間プロセスに依存している。
本研究では,S2Former-OR(S2Former-OR)と呼ばれるORにおけるSGGのための新しいシングルステージバイモーダルトランスフォーマフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-22T11:40:49Z) - SD-MVS: Segmentation-Driven Deformation Multi-View Stereo with Spherical
Refinement and EM optimization [6.886220026399106]
テクスチャレス領域の3次元再構成における課題を解決するために,多視点ステレオ (SD-MVS) を導入する。
私たちは、シーン内のセグメンテーションインスタンスを区別するためにSAM(Segment Anything Model)を採用した最初の人です。
球面座標と正規点の勾配勾配と深度の画素方向探索間隔を組み合わせた独自の精細化戦略を提案する。
論文 参考訳(メタデータ) (2024-01-12T05:25:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。