論文の概要: SCCM: Spherically Consistent Coarse Matching for ERP Dense Feature Correspondence
- arxiv url: http://arxiv.org/abs/2609.36545v1
- Date: Tue, 29 Sep 2026 02:32:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.120473
- Title: SCCM: Spherically Consistent Coarse Matching for ERP Dense Feature Correspondence
- Title(参考訳): SCCM:ERP高密度特徴対応のための球面一貫性粗さマッチング
- Abstract要約: 等角射影 (ERP) は360$circ$画像の標準的な表現である。
平らな画像で訓練されたDense MatcherはERPで系統的に劣化する。
そこで,PCK@$1circ$をMatterport3Dで0.229~0.275に改善した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Equirectangular projection (ERP) is the standard representation for 360$^\circ$ imagery, and robust dense feature matching on ERP underpins panoramic stereo, view synthesis, and omnidirectional SLAM. Dense matchers trained on flat images degrade systematically on ERP because the chart introduces three coupled distortions -- topological, metric, and area -- that standard coarse matching and visibility estimation do not explicitly model. We show that correcting the three distortions at the coarse-stage interfaces where they arise -- pairwise distortions in attention, per-pixel distortion in covisibility gating -- improves PCK@$1^\circ$ from 0.229 to 0.275 on Matterport3D under a fixed coarse scaffold, with the refiner architecture unchanged -- our central result. Concretely, SCCM (Spherically Consistent Coarse Matching) augments a chart-naive cross-attention/dual-softmax coarse matcher with two sphere-derived priors: Spherical Positional Attention (SPA) pairs a yaw-periodic RoPE (topology) with a tangent-plane bias (metric), and Area-Aware Covisibility (AAC) applies a pre-sigmoid log-area correction (area). The chart-naive scaffold serves as a controlled reference, separating the scaffold-replacement effect from the spherical-prior effect. Instantiated in the RoMa V1 framework with the same frozen encoder, refiner architecture, and loss, SCCM also outperforms the ERP-native EDM (0.163) and an ERP-retrained RoMa V1 (0.198) under a unified ERP dense matching protocol, while perspective-trained matchers largely fail on ERP. It further transfers zero-shot to Stanford2D3D and, when trained on outdoor Holo360D, leads there as well.
- Abstract(参考訳): 等角射影(ERP)は360$^\circ$画像の標準表現であり、ERPアンダーピンの高密度特徴マッチングはパノラマステレオ、ビュー合成、全方位SLAMである。
フラットイメージでトレーニングされたDense Matcherは、ERP上で体系的に劣化する。このチャートは、標準の粗いマッチングと可視性推定が明示的にモデル化されていない3つの複合歪み(トポロジ、メートル法、面積)を導入するためである。
その結果,PCK@$1^\circ$ 0.229 から 0.275 に改善した。
具体的には、SCCM (Spherally Consistent Coarse Matching) は、2つの球面由来の先行性を持つチャートナイーブなクロスアテンション/Dual-softmax粗いマッチングを増強する: SPA (Spherical Positional Attention) は、タンジェント平面バイアス (metric) を持つヤウ周期RoPE (topology) と、AAC (Area-Aware Covisibility) は、プレシグモイド対数領域補正 (area) を適用する。
チャートナブ足場は制御基準として機能し、足場置換効果と球面優先効果を分離する。
SCCMは、同じ凍結エンコーダ、精細化アーキテクチャ、損失を持つRoMa V1フレームワークで実装されており、ERP-native EDM(0.163)とERP-retrained RoMa V1(0.198)を統一ERP高密度マッチングプロトコルで上回っている。
さらにゼロショットをStanford2D3Dに転送し、屋外のHolo360Dで訓練すると、それもリードする。
関連論文リスト
- DISTA-Net++: Rethinking Infrared Small Target Unmixing Beyond Sub-Pixel Separation [50.40058918817059]
長距離赤外線画像は、回折制限されたシグネチャが1つの識別不能なブロブに融合する密度の高いターゲットクラスタに対向する。
DisTA-Net++は2つの相乗的なメカニズムで動的に展開するバックボーンをアンカーする。
DisTA-Net++は、CSO-mAPが16.15%、62.96%の精度で、計算の6分の1に過ぎない。
論文 参考訳(メタデータ) (2026-09-16T14:57:11Z) - Stable and Scalable Bundle Adjustment of Holistic 3D Structures [99.03818732955783]
本稿では,3次元コンピュータビジョンのためのBundle Adjustment (BA) の新バージョンを提案する。
BAはカメラ、ポーズ、3Dポイントを共同で最適化するために開発された。
グループ誘導測定とクロスフィーチャー・リジェクションにより、古典的な点のみの3次元正規化の空間性を維持する。
論文 参考訳(メタデータ) (2026-09-03T16:08:03Z) - GeoMAD: Geometry-Aware Multi-View Anomaly Detection via Deformable Fusion and Distributional Alignment [32.33973839948303]
マルチビュー異常検出(MvAD)は、複数のカメラ視点からの相補的な観察を利用して欠陥を検出する。
既存の方法は通常2つの極端に該当する: ボクセルベースの融合は明示的な幾何学的アライメントを提供するが、コストがかかる3次元構造とクラス固有の仮定を必要とする。
幾何対応の不整合と分布不整合の両方に対処する統合多視点多クラスADフレームワークGeoMADを提案する。
論文 参考訳(メタデータ) (2026-08-27T07:15:15Z) - ERP-XTTN: Interpretable Prototype-Guided Cross-Attention for Cross-Subject ERP Classification [0.0]
プロトタイプベースのクロスアテンションは、デプロイ互換条件下での競合的、解釈可能なイベント関連電位(ERP)分類を提供する。
ERP-XTTNは入力EEGパッチを固定差分波プロトタイプにルーティングするクロスアテンションアーキテクチャである。
我々は,3つの公開情報源を対象に,LOSO (Left-one-subject-out) 評価を行った。
論文 参考訳(メタデータ) (2026-06-01T22:38:23Z) - PRISM: A Geometric Risk Bound that Decomposes Drift into Scale, Shape, and Head [14.880821907124451]
本研究では,LLMの線形出力ヘッドと背骨のほぼ等尺構造を利用したPRISMを提案する。
境界は変分ランクに調整され、ドリフトを3つの独立測定可能な軸に分解する。
PRISMは、学習後の量子化において平均スピアマン相関が0.820、LoRAを忘れるために0.831の変種をランク付けする。
論文 参考訳(メタデータ) (2026-05-12T06:40:34Z) - Keep It CALM: Toward Calibration-Free Kilometer-Level SLAM with Visual Geometry Foundation Models via an Assistant Eye [34.902300948471314]
CAL2Mは任意のVGFMと互換性のあるプラグイン・アンド・プレイのフレームワークである。
一定の物理的間隔の先行を利用するためだけに「補助眼」を使用する。
不正確な内因論による回転と翻訳の誤りを効果的に正すことができる。
論文 参考訳(メタデータ) (2026-04-16T08:58:57Z) - The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment [24.22523653033535]
視覚言語モデルは画像とテキストの共有埋め込み空間を学ぶが、それらの表現は幾何学的に分離されている。
このギャップは、キャプションや共同クラスタリングのような、モーダル間交換性を必要とするタスクを制限する。
本稿では,TPC-CMA (Three-Phase Curriculum for Cross-Modal Alignment)を提案する。
論文 参考訳(メタデータ) (2026-03-31T22:11:49Z) - ProAct: Agentic Lookahead in Interactive Environments [56.50613398808361]
ProActは、2段階のトレーニングパラダイムを通じて、エージェントが正確なルックアヘッド推論を内部化することを可能にするフレームワークである。
そこでは,環境に基づく探索から得られたトラジェクトリの微調整をエージェントが行うGLAD(Grounded LookAhead Distillation)を紹介する。
また,政策段階のアルゴリズムを改良する補助値推定器であるモンテカルロ批判(MC-Critic)を提案する。
論文 参考訳(メタデータ) (2026-02-05T05:45:16Z) - Label Distributionally Robust Losses for Multi-class Classification:
Consistency, Robustness and Adaptivity [55.29408396918968]
多クラス分類のためのラベル分布ロバスト(LDR)損失という損失関数群について検討した。
我々の貢献は、多クラス分類のためのLDR損失のトップ$kの一貫性を確立することによって、一貫性と堅牢性の両方を含んでいる。
本稿では,各インスタンスのクラスラベルの雑音度に個別化温度パラメータを自動的に適応させる適応型LDR損失を提案する。
論文 参考訳(メタデータ) (2021-12-30T00:27:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。