論文の概要: GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training
- arxiv url: http://arxiv.org/abs/2607.02486v1
- Date: Thu, 02 Jul 2026 17:52:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.958896
- Title: GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training
- Title(参考訳): GeoMix:グローバルコンテキストとマルチディテクタトレーニングによるディスクリプタフリーなビジュアルローカライゼーション
- Abstract要約: ディスクリプタフリーなビジュアルローカライゼーションは、高次元のディスクリプタストレージを排除し、シーンのプライバシを保護し、マップのメンテナンスを簡素化する。
このギャップを幾何学限定マッチングにおける幾何学的識別性の不足と同定する。
幾何学的識別性を3つのレベルで強化する,記述子レス2D-3DマッチングフレームワークGeoMixを提案する。
- 参考スコア(独自算出の注目度): 27.71531304367363
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Descriptor-free visual localization eliminates high-dimensional descriptor storage, preserves scene privacy, and simplifies map maintenance, yet its accuracy still lags far behind descriptor-based pipelines. We identify this gap to insufficient geometric discriminability in geometry-only matching. Without visual appearance, current methods underutilize local geometry cues, lack the global context among keypoints, and overfit to a single keypoint detector. We further observe that descriptor-free matching naturally enables multi-detector training, as heterogeneous keypoints can be optimized in a shared geometry-only space without aligning descriptor spaces. Building on these insights, we propose GeoMix, a descriptor-free 2D-3D matching framework that strengthens geometric discriminability at three levels. Locally, directional and distance-aware embeddings enrich neighborhood aggregation with fine-grained spatial structure. Globally, learnable context nodes aggregate and redistribute scene-wide information via cross-attention to resolve ambiguities beyond local receptive fields. At the training level, Mix-Training exploits this detector-agnostic geometry space to learn representations across multiple keypoint detectors. Extensive experiments on MegaDepth, Cambridge Landmarks, 7Scenes, and Aachen Day-Night show that GeoMix sets a new state of the art among descriptor-free methods, reducing 75th-percentile rotation error by 89\% and translation error by up to 90\% over the previous best, while generalizing zero-shot to unseen detectors and narrowing the gap to descriptor-based pipelines. Code is available at $\href{https://github.com/YejunZhang/Geomix}{\text{this links}}$.
- Abstract(参考訳): ディスクリプタフリーなビジュアルローカライゼーションは、高次元ディスクリプタストレージを排除し、シーンプライバシを保護し、マップのメンテナンスを簡素化するが、その精度はディスクリプタベースのパイプラインよりもはるかに遅れている。
このギャップを幾何学限定マッチングにおける幾何学的識別性の不足と同定する。
視覚的な外観がなければ、現在の手法は局所幾何学的手がかりを弱め、キーポイント間のグローバルなコンテキストを欠き、単一のキーポイント検出器に過度に適合する。
さらに、デクリプタフリーマッチングは、デクリプタ空間を整列することなく、共有幾何のみの空間で不均一なキーポイントを最適化できるため、自然にマルチ検出器のトレーニングを可能にする。
これらの知見に基づいて,幾何学的識別性を3段階に強化する記述子レス2D-3DマッチングフレームワークGeoMixを提案する。
局所的, 指向性, 距離に配慮した埋め込みは, きめ細かい空間構造を持つ近傍の凝集度を増大させる。
グローバルに、学習可能なコンテキストノードは、局所受容フィールドを超えた曖昧さを解決するために、クロスアテンションを介してシーン全体の情報を集約し、再配布する。
訓練レベルでは、Mix-Trainingはこの検出器に依存しない幾何学空間を利用して、複数のキーポイント検出器間の表現を学習する。
MegaDepth、Cambridge Landmarks、7Scenes、Aachen Day-Nightの大規模な実験では、GeoMixは記述子なしの手法の中で新しい最先端を設定し、75パーセントの回転誤差を89倍、翻訳エラーを90倍まで削減し、ゼロショットを検出できない検出器に一般化し、記述子ベースのパイプラインにギャップを狭める。
コードは$\href{https://github.com/YejunZhang/Geomix}{\text{this link}}$.comから入手できる。
関連論文リスト
- Robust Scene Coordinate Regression via Geometrically-Consistent Global Descriptors [52.57327385675752]
幾何学的構造と視覚的類似性の両方に整合したグローバルな記述子を学習するアグリゲータモジュールを提案する。
これにより、信頼できないオーバーラップスコアによる誤関連が修正される。
挑戦的なベンチマークの実験では、大規模環境ではかなりのローカライゼーションが得られた。
論文 参考訳(メタデータ) (2025-12-19T04:24:03Z) - NeuraLoc: Visual Localization in Neural Implicit Map with Dual Complementary Features [50.212836834889146]
本稿では,補完的な特徴を持つニューラル暗黙マップに基づく,効率的で斬新な視覚的局所化手法を提案する。
具体的には、幾何学的制約を強制し、ストレージ要件を小さくするために、3Dキーポイント記述子フィールドを暗黙的に学習する。
記述子の意味的あいまいさにさらに対処するために、追加の意味的文脈的特徴体を導入する。
論文 参考訳(メタデータ) (2025-03-08T08:04:27Z) - FUSELOC: Fusing Global and Local Descriptors to Disambiguate 2D-3D Matching in Visual Localization [52.57327385675752]
直接2D-3Dマッチングではメモリが大幅に削減されるが、より大きくあいまいな検索空間のために精度が低下する。
重み付き平均演算子を用いて局所的および大域的記述子を融合することにより、この曖昧さに対処する。
メモリを43%削減し、1.6倍高速に動作しながら、階層的な手法に近いパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2024-08-21T23:42:16Z) - GeoFormer: Learning Point Cloud Completion with Tri-Plane Integrated Transformer [41.26276375114911]
ポイント・クラウド・コンプリートは、正確なグローバル・ジオメトリを復元し、部分的なポイント・クラウドからのきめ細かい局所的な詳細を保存することを目的としている。
従来の手法では、3Dポイントのクラウド座標から直接見えない点を予測したり、自己投影された多視点深度マップを使用するのが一般的である。
ポイントのグローバルな幾何学的構造を同時に拡張し、局所的な詳細を改善するGeoFormerを導入する。
論文 参考訳(メタデータ) (2024-08-13T03:15:36Z) - Coupled Laplacian Eigenmaps for Locally-Aware 3D Rigid Point Cloud Matching [0.0]
局所構造を考慮したグラフラプラシアン固有写像に基づく新しい手法を提案する。
ラプラシアン固有写像の順序と符号のあいまいさに対処するために、結合ラプラシアンと呼ばれる新しい作用素を導入する。
これらの高次元空間間の類似性は、形状に一致するような局所的な意味のあるスコアを与えることを示す。
論文 参考訳(メタデータ) (2024-02-27T10:10:12Z) - Uni3DETR: Unified 3D Detection Transformer [75.35012428550135]
同一の枠組み内での屋内および屋外検出に対処する統合された3次元検出器を提案する。
具体的には,物体の予測に点-ボクセル相互作用を用いた検出変換器を用いる。
そこで我々は,密集した屋内シーンのグローバル情報と,大域の狭い屋外シーンのローカル情報とを十分に活用する問合せポイントの混合を提案する。
論文 参考訳(メタデータ) (2023-10-09T13:20:20Z) - Flattening-Net: Deep Regular 2D Representation for 3D Point Cloud
Analysis [66.49788145564004]
我々は、任意の幾何学と位相の不規則な3次元点雲を表現するために、Flattning-Netと呼ばれる教師なしのディープニューラルネットワークを提案する。
我々の手法は、現在の最先端の競合相手に対して好意的に機能する。
論文 参考訳(メタデータ) (2022-12-17T15:05:25Z) - RIGA: Rotation-Invariant and Globally-Aware Descriptors for Point Cloud
Registration [44.23935553097983]
RIGAを導入して,設計とグローバルアウェアによる回転不変な記述子を学習する。
RIGAはModelNet40の相対回転誤差で最先端の手法を8度の差で上回り、3DLoMatchでは少なくとも5ポイントのFeature Matching Recallを改善する。
論文 参考訳(メタデータ) (2022-09-27T08:45:56Z) - Viewpoint Invariant Dense Matching for Visual Geolocalization [15.8038460597256]
本研究では,局所的特徴量に基づく画像マッチング手法を提案する。
我々の手法はGeoWarpと呼ばれ、高密度な特徴を抽出する過程において、視点シフトへの不変性を直接埋め込む。
GeoWarpは、既存の視覚的ジオローカライゼーションパイプラインに簡単に組み込むことができる、リグレードメソッドとして効率的に実装されている。
論文 参考訳(メタデータ) (2021-09-20T20:17:38Z) - Distinctive 3D local deep descriptors [2.512827436728378]
ポイントクラウドパッチは抽出され、推定されたローカル参照フレームに対して正準化され、PointNetベースのディープニューラルネットワークによって符号化される。
我々は、異なるセンサを用いて再構成された点雲からなる複数のデータセットにおいて、DIPを、別の手作り、ディープディスクリプタと比較し、比較した。
論文 参考訳(メタデータ) (2020-09-01T06:25:06Z) - DH3D: Deep Hierarchical 3D Descriptors for Robust Large-Scale 6DoF
Relocalization [56.15308829924527]
生の3D点から直接3次元特徴の検出と記述を共同で学習するシームズネットワークを提案する。
3次元キーポイントを検出するために,局所的な記述子の識別性を教師なしで予測する。
各種ベンチマーク実験により,本手法はグローバルポイントクラウド検索とローカルポイントクラウド登録の両面で競合する結果が得られた。
論文 参考訳(メタデータ) (2020-07-17T20:21:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。