論文の概要: SGFormer: Structure-Guided Transformer for Robust Local Feature Matching
- arxiv url: http://arxiv.org/abs/2608.03423v1
- Date: Tue, 04 Aug 2026 10:14:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.124572
- Title: SGFormer: Structure-Guided Transformer for Robust Local Feature Matching
- Title(参考訳): SGFormer:ロバスト局所特徴マッチングのための構造ガイド変換器
- Authors: Runyu Zhu,
- Abstract要約: 局所的特徴マッチングはフォトグラムメトリーの基本的な構成要素である。
重なり合う領域における有意な構造に近い特徴に対する注意を適応的に更新する構造対応マッチングネットワークであるSGFormerを提案する。
広汎な実験により,SGFormerは注意分散を著しく軽減し,マッチング精度を向上することが示された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Local feature matching is a fundamental component of photogrammetry, enabling accurate image correspondence critical for tasks such as 3D reconstruction, stereo mapping, and visual localization. While recent detector-free matching methods, like LoFTR, have advanced the field, the global features obtained by leveraging the global-range modeling capacity of the unconstrained attention mechanism compromise the model's attention to the salient structures in certain scenarios. This limitation leads to a phenomenon we define as attention divergence, wherein a portion of high-confidence matches are distributed outside the valid matching region (overlapping region), especially in scenes with large viewpoint variations. This occurs because similar features in irrelevant regions may receive equal weighting and consideration within the standard Transformer, limiting matching reliability in challenging photogrammetric environments. To address this issue in feature matching, we propose SGFormer (Structure-Guided Transformer), a novel structure-aware matching network that adaptively updates attention on features near salient structure in overlapping regions. SGFormer employs a semi-dense coarse-to-fine pipeline and incorporates the proposed Triple-Structure-Attention (TSA) module into the backbone net for extracting distinctive features. The TSA module utilizes shallow local features from early network layers to enhance the representation around salient structure, guiding subsequent transformer stages to intensify the model's focus on regions with salient structure across the global scope. SGFormer, thereby reinforcing attention to visually consistent areas while mitigating the influence of non-overlapping regions. Extensive experiments show that SGFormer significantly mitigates attention divergence and improves matching accuracy.
- Abstract(参考訳): 局所特徴マッチングは3次元再構成、ステレオマッピング、視覚的ローカライゼーションといったタスクに不可欠な正確な画像対応を可能にするフォトグラムの基本的な構成要素である。
LoFTRのような最近の検出器レスマッチング手法は分野を進歩させたが、制約のない注意機構のグローバルレンジモデリング能力を活用することで得られるグローバルな特徴は、特定のシナリオにおける健全な構造に対するモデルの注意を損なう。
この制限は、特に大きな視点変化のあるシーンにおいて、高い信頼度マッチの一部が有効なマッチング領域(重なり合う領域)の外に分散される、注意分散( attention divergence)と定義する現象につながる。
これは、非関連領域の類似した特徴が標準トランスフォーマー内で等しく重み付けと考慮を受け、挑戦的なフォトグラム環境における整合性に制限されるためである。
特徴マッチングにおけるこの問題に対処するため,重なり合う領域における有意な構造近傍の特徴を適応的に更新する新しい構造対応マッチングネットワークであるSGFormer(Structure-Guided Transformer)を提案する。
SGFormerは半密度の粗いパイプラインを採用し、提案されたTriple-Structure-Attention (TSA)モジュールをバックボーンネットに組み込んで特徴を抽出する。
TSAモジュールは、初期のネットワーク層からの浅い局所的特徴を利用して、サージェント構造に関する表現を強化し、その後のトランスフォーマーステージを導くことで、グローバルスコープをまたいだサージェント構造を持つ領域に対するモデルの焦点を強化する。
SGFormerは、重複しない領域の影響を緩和しながら、視覚的に一貫した領域に注意を向ける。
広汎な実験により,SGFormerは注意分散を著しく軽減し,マッチング精度を向上することが示された。
関連論文リスト
- ViCrop-Det: Spatial Attention Entropy Guided Cropping for Training-Free Small-Object Detection [6.1221124436192875]
ViCrop-Detは、適応的な空間信頼領域収縮を導入する、トレーニング不要な推論フレームワークである。
RT-DETR-R50 と Deformable DETR に +1-3 mAP@50 を連続的に追加し,20-23% の遅延オーバヘッドを有することを示す。
計算マッチング設定下では、適応的ルーティング戦略は、一様スライシングベースラインを包括的に超越し、高度に最適化された精度-速度トレードオフを実現する。
論文 参考訳(メタデータ) (2026-04-29T15:35:03Z) - RDNet: Region Proportion-Aware Dynamic Adaptive Salient Object Detection Network in Optical Remote Sensing Images [78.19052099452695]
地域分布を考慮した動的適応型オブジェクト検出ネットワーク(RDNet)を提案する。
RDNetはグローバルコンテキストモデリングのためにCNNのバックボーンをSwinTransformerに置き換える。
スケールの変動や正確なローカライゼーションに対して堅牢性を実現し、最先端の手法と比較して優れた検出性能を提供する。
論文 参考訳(メタデータ) (2026-03-12T17:34:29Z) - Cross-view geo-localization, Image retrieval, Multiscale geometric modeling, Frequency domain enhancement [1.6686955491488273]
クロスビュージオローカライゼーション(CVGL)は、異なる視点から撮影された画像間の空間的対応を確立することを目的としている。
CVGLは、厳密な幾何学的非対称性、画像領域間のテクスチャの不整合、および識別的局所情報の段階的な劣化により、依然として困難なままである。
本稿では、空間領域と周波数領域の相補表現を利用した空間周波数領域拡張ネットワーク(SFDE)を提案する。
論文 参考訳(メタデータ) (2026-03-03T08:25:35Z) - UAGLNet: Uncertainty-Aggregated Global-Local Fusion Network with Cooperative CNN-Transformer for Building Extraction [83.48950950780554]
リモートセンシング画像からの抽出は、複雑な構造変化のために難しい課題である。
既存の方法は、セグメンテーションモデルにおけるマルチスケール特徴をキャプチャするために、畳み込みブロックまたは自己アテンションブロックを使用する。
高品質なグローバルローカルなビジュアルセマンティクスを活用するために,不確実性集約型グローバルローカルフュージョンネットワーク(UAGLNet)を提案する。
論文 参考訳(メタデータ) (2025-12-15T02:59:16Z) - GCRPNet: Graph-Enhanced Contextual and Regional Perception Network for Salient Object Detection in Optical Remote Sensing Images [68.33481681452675]
本稿では,GCRPNet(Graph-enhanced contextual and Regional Recognition Network)を提案する。
これはMambaアーキテクチャの上に構築され、長距離依存関係を同時にキャプチャし、地域的特徴表現を強化する。
マルチスケールの畳み込みによって処理される特徴マップに対して適応的なパッチスキャンを行い、リッチなローカル領域情報をキャプチャする。
論文 参考訳(メタデータ) (2025-08-14T11:31:43Z) - Conformer: Local Features Coupling Global Representations for Visual
Recognition [72.9550481476101]
本稿では,畳み込み操作と自己アテンション機構を利用した表現学習のためのハイブリッドネットワーク構造,conformerを提案する。
実験では、コンフォーマーが同等のパラメータ複雑性の下で視覚変換器(DeiT-B)を2.3%上回ることが示されている。
論文 参考訳(メタデータ) (2021-05-09T10:00:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。