論文の概要: DXPR: Depth-Based Vision-LiDAR Cross-Modal Place Recognition Using Vision Foundation Models
- arxiv url: http://arxiv.org/abs/2609.09005v1
- Date: Tue, 08 Sep 2026 16:42:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 15:08:48.732674
- Title: DXPR: Depth-Based Vision-LiDAR Cross-Modal Place Recognition Using Vision Foundation Models
- Title(参考訳): DXPR:ビジョンファウンデーションモデルを用いた奥行きに基づく視覚-LiDARクロスモーダル位置認識
- Authors: Yungsoo Han, Youngseok Jang, Seungwon Roh, Jeongyeon Seo, H. Jin Kim,
- Abstract要約: 本稿では、視覚基礎モデル(VFM)を用いて、モダリティ固有のエンコーダを使わずに、モノクロカメラクエリとLiDARマップをマッチングする、奥行きに基づくクロスモーダル位置認識(CMPR)フレームワークを提案する。
これにより、ロボットと自動運転車は、厳しい季節、天候、照明の変化の下でも、事前に構築されたLiDARマップ内のカメラのみを使用して、ロバストなローカライズを行うことができる。
- 参考スコア(独自算出の注目度): 19.864444185057224
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present DXPR, a depth-based cross-modal place recognition (CMPR) framework that uses vision foundation models (VFMs) to match monocular camera queries against a LiDAR map without modality-specific encoders. This enables robots and autonomous vehicles to robustly localize using only cameras within pre-built LiDAR maps, even under severe seasonal, weather, and illumination changes. The key idea is to convert both camera images and LiDAR scans into a unified depth image representation so that a single VFM backbone with an aggregation head can learn modality-invariant global descriptors. To make pairwise metric learning faithful to scene geometry, we introduce a geometry-aware overlap miner: after cross-modal scale alignment of camera and LiDAR depth, we forward-warp measurements between views to compute a pixel-level overlap score. This score relabels ambiguous pairs and adaptively modulates the positive margin in a multi-similarity loss to avoid overfitting on weakly overlapping views. Extensive experiments on KITTI odometry and Boreas demonstrate strong performance and robustness across seasons, weather, and day/night. On KITTI, DXPR achieves near-perfect Recall@1 on most sequences and outperforms prior CMPR baselines. On Boreas, DXPR achieves intra-sequence performance on par with a strong single-modal baseline (DINOv2-SALAD), while showing clear improvements in the more challenging inter-sequence setting. Compared with RangeBEV, our method consistently performs better in both intra- and inter-sequence evaluations, demonstrating robustness under diverse seasonal and illumination changes.
- Abstract(参考訳): DXPRは、視覚基礎モデル(VFM)を用いて、モダリティ固有のエンコーダを持たないLiDARマップとモノクロカメラクエリをマッチングする、奥行きに基づくクロスモーダル位置認識(CMPR)フレームワークである。
これにより、ロボットと自動運転車は、厳しい季節、天候、照明の変化の下でも、事前に構築されたLiDARマップ内のカメラのみを使用して、ロバストなローカライズを行うことができる。
キーとなるアイデアは、カメライメージとLiDARスキャンの両方を統一された深度画像表現に変換することで、集約ヘッドを持つ単一のVFMバックボーンが、モダリティ不変のグローバルディスクリプタを学習できるようにすることである。
シーンジオメトリに忠実なペアワイズ計量学習を実現するために,カメラとLiDAR深度をクロスモーダルなスケールアライメントした後に,ビュー間を前方ワープして画素レベルのオーバーラップスコアを算出する,幾何対応のオーバーラップマイナを導入する。
このスコアはあいまいなペアをリラベルし、多相性損失の正のマージンを適応的に調整し、弱い重なり合うビューに過度に収まらないようにする。
KITTIオドメトリーとボレアの大規模な実験は、季節、天候、昼夜の強い性能と頑丈さを示している。
KITTIでは、DXPRはほとんどのシーケンスでほぼ完璧なRecall@1を達成し、CMPR以前のベースラインよりも優れています。
Boreasでは、DXPRは、強い単一モードベースライン(DINOv2-SALAD)と同等にシーケンス内パフォーマンスを達成し、より困難なシーケンス間設定において明らかに改善されている。
RangeBEVと比較して,本手法は,季節変化と照明変化による頑健さを実証し,シーケンス内およびシーケンス間評価において常に優れた性能を発揮する。
関連論文リスト
- RADIO1D: Elastic Representations for Condensed Vision Modeling [69.84453279129937]
本稿では,視覚言語モデル (VLM) が固定パッチベースの2次元視覚機能を必要とするという仮定に挑戦する。
RADIO1Dは,マルチ教師の知識蒸留とオートエンコーダ設計を用いて,画像をコンパクトで可変長の1Dトークンシーケンスに圧縮する。
結果として得られた表現は、強い階層的な要約を示し、1つのトークンでも正確なシーン理解を可能にし、合成認識画像検索の改善をサポートする。
論文 参考訳(メタデータ) (2026-07-03T22:58:54Z) - UDPNet: Unleashing Depth-based Priors for Robust Image Dehazing [77.10640210751981]
UDPNetは、大規模で事前訓練された深度推定モデルDepthAnything V2から深度に基づく事前情報を活用する一般的なフレームワークである。
提案手法は,様々なシナリオにまたがる深度認識デハージングのための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2026-01-11T13:29:02Z) - DMS:Diffusion-Based Multi-Baseline Stereo Generation for Improving Self-Supervised Depth Estimation [10.461837853869959]
本稿では,方向指示によって誘導される極上方向に沿った新しいビューを合成するモデルに依存しないアプローチを提案する。
提案したDMSは,自己教師型ステレオマッチングと単眼深度推定をシームレスに向上する,コストフリーの'plug-and-play'法である。
論文 参考訳(メタデータ) (2025-08-18T17:05:15Z) - Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching [7.5461100059974315]
本稿では,LiDARとカメラビュー間の直接点画像マッチングのための検出不要フレームワークを提案する。
具体的には、LiDARインテンシティマップをLiDARの観点から2次元ビューに投影し、注意に基づくマッチングネットワークに入力する。
マッチングの信頼性をさらに高めるために,事前にソフトな可視性として機能する再現性スコアリング機構を導入する。
論文 参考訳(メタデータ) (2025-06-28T06:57:13Z) - Monocular One-Shot Metric-Depth Alignment for RGB-Based Robot Grasping [26.7709114619056]
単一のRGB画像から距離深度を復元する新しいフレームワークであるモノクロワンショット距離アライメント(MOMA)を提案する。
MOMAは、カメラキャリブレーション中のスケール回転シフトアライメントを実行する。
テーブルトップ2指握りと吸引型ビンピッキングアプリケーションの実世界実験は、MOMAが多種多様なタスクで高い成功率を達成することを示している。
論文 参考訳(メタデータ) (2025-06-20T16:11:20Z) - Aerial Multi-View Stereo via Adaptive Depth Range Inference and Normal Cues [38.954104931025704]
本稿では,多視点深度推定精度を向上させるための適応深度MVS(ADR-MVS)を提案する。
ADR-MVSは、クロスアテンション離散性学習を用いて、深さと正規推定値から適応範囲マップを生成する。
実験により,ADR-MVSはWHU,LuoJia-MVS,M"unchenデータセット上で最先端の性能を実現することが示された。
論文 参考訳(メタデータ) (2025-06-06T01:14:55Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - Unsupervised Visible-light Images Guided Cross-Spectrum Depth Estimation
from Dual-Modality Cameras [33.77748026254935]
クロススペクトル深度推定は、対のデュアルスペクトル画像を用いて、すべての照明条件で深度マップを提供することを目的としている。
本稿では,教師なし可視光画像ガイド型クロススペクトル(熱・可視光,略してTIR-VIS)の奥行き推定フレームワークを提案する。
提案手法は,既存手法と比較して性能が向上する。
論文 参考訳(メタデータ) (2022-04-30T12:58:35Z) - TANDEM: Tracking and Dense Mapping in Real-time using Deep Multi-view
Stereo [55.30992853477754]
本稿では,リアルタイムな単分子追跡と高密度フレームワークであるTANDEMを紹介する。
ポーズ推定のために、TANDEMはアライメントのスライディングウィンドウに基づいて光度バンドル調整を行う。
TANDEMは最先端のリアルタイム3D再構成性能を示す。
論文 参考訳(メタデータ) (2021-11-14T19:01:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。