論文の概要: MPTF-Net: Multi-view Pyramid Transformer Fusion Network for LiDAR-based Place Recognition
- arxiv url: http://arxiv.org/abs/2604.04513v1
- Date: Mon, 06 Apr 2026 08:27:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.142355
- Title: MPTF-Net: Multi-view Pyramid Transformer Fusion Network for LiDAR-based Place Recognition
- Title(参考訳): MPTF-Net:LiDARを用いた位置認識のための多視点ピラミッド変圧器融合ネットワーク
- Abstract要約: MPTF-Netは、新しいマルチビュー・マルチスケールピラミッドトランスフォーマー融合ネットワークである。
我々のコアコントリビューションは、局所的な幾何学的複雑性と強度分布を明示的にモデル化したマルチチャネルNDTベースのBEV符号化である。
nuScenes、KITTI、NCLTデータセットの実験は、MPTF-Netが最先端のパフォーマンスを達成することを示す。
- 参考スコア(独自算出の注目度): 12.521587523389343
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LiDAR-based place recognition (LPR) is essential for global localization and loop-closure detection in large-scale SLAM systems. Existing methods typically construct global descriptors from Range Images or BEV representations for matching. BEV is widely adopted due to its explicit 2D spatial layout encoding and efficient retrieval. However, conventional BEV representations rely on simple statistical aggregation, which fails to capture fine-grained geometric structures, leading to performance degradation in complex or repetitive environments. To address this, we propose MPTF-Net, a novel multi-view multi-scale pyramid Transformer fusion network. Our core contribution is a multi-channel NDT-based BEV encoding that explicitly models local geometric complexity and intensity distributions via Normal Distribution Transform, providing a noise-resilient structural prior. To effectively integrate these features, we develop a customized pyramid Transformer module that captures cross-view interactive correlations between Range Image Views (RIV) and NDT-BEV at multiple spatial scales. Extensive experiments on the nuScenes, KITTI and NCLT datasets demonstrate that MPTF-Net achieves state-of-the-art performance, specifically attaining a Recall@1 of 96.31\% on the nuScenes Boston split while maintaining an inference latency of only 10.02 ms, making it highly suitable for real-time autonomous unmanned systems.
- Abstract(参考訳): 大規模SLAMシステムにおいて,LDARに基づく位置認識(LPR)はグローバルな位置決めとループ閉鎖検出に不可欠である。
既存の手法では、マッチングのためにRange ImagesやBEV表現からグローバルな記述子を構築するのが一般的である。
BEVは、空間配置の明示的な符号化と効率的な検索により広く採用されている。
しかし、従来のBEV表現は単純な統計集約に依存しており、微粒な幾何学構造を捉えることができず、複雑な環境や反復的な環境での性能劣化につながる。
そこで我々は,新しいマルチビュー・マルチスケールピラミッドトランスフォーマー融合ネットワークMPTF-Netを提案する。
我々のコアコントリビューションはマルチチャネルNDTベースのBEV符号化であり、局所的な幾何学的複雑性と正規分布変換による強度分布を明示的にモデル化し、ノイズ耐性を持つ構造的事前を提供する。
これらの特徴を効果的に統合するために、複数の空間スケールでレンジ画像ビュー(RIV)とNDT-BEVの相互インタラクティブな相関をキャプチャする、カスタマイズされたピラミッドトランスフォーマーモジュールを開発した。
nuScenes、KITTI、NCLTデータセットに関する大規模な実験により、MPTF-Netは最先端のパフォーマンスを実現し、特にnuScenes Bostonでは10.02msの推論レイテンシを維持しながらRecall@1の96.31\%を達成した。
関連論文リスト
- Statistical Channel Fingerprint Construction for Massive MIMO: A Unified Tensor Learning Framework [51.39651336043647]
チャネル指紋(CF)は、IMO通信システムにおけるチャネル状態情報の取得を容易にする重要な手段であると考えられている。
統計的CSI(sCSI)を各電位で保存する新しいタイプのCFを提案し,これを統計的CF(sCF)と呼ぶ。
論文 参考訳(メタデータ) (2026-04-30T08:28:45Z) - Fundamental Limits of CSI Compression in FDD Massive MIMO [32.267305083092594]
状態推論と状態適応型TCを組み合わせた実用的なCSIフィードバックアーキテクチャを提案する。
鍵となる構造的結果は、全ての混合成分をまたいだ最適なビット割り当てが、単一の大域的な逆給水レベルによって制御されることである。
その結果,大容量のニューラルエンコーダを使わずに準最適CSI圧縮を状態適応TCにより達成できることが示唆された。
論文 参考訳(メタデータ) (2026-03-15T11:03:22Z) - GSPN-2: Efficient Parallel Sequence Modeling [101.33780567131716]
一般化空間伝搬ネットワーク(GSPN)は2次自己アテンションを直線走査型伝搬方式に置き換えることでこの問題に対処する。
GSPN-2は、視覚アプリケーションにおけるグローバル空間コンテキストをモデル化するための新しい効率フロンティアを確立する。
論文 参考訳(メタデータ) (2025-11-28T07:26:45Z) - Unifying Dimensions: A Linear Adaptive Approach to Lightweight Image Super-Resolution [6.857919231112562]
ウィンドウベーストランスは超高解像度タスクにおいて優れた性能を示した。
畳み込みニューラルネットワークよりも計算複雑性と推論レイテンシが高い。
線形適応ミキサーネットワーク(LAMNet)という,畳み込みに基づくトランスフォーマーフレームワークを構築する。
論文 参考訳(メタデータ) (2024-09-26T07:24:09Z) - Double-Shot 3D Shape Measurement with a Dual-Branch Network for Structured Light Projection Profilometry [14.749887303860717]
我々は、異なる構造光(SL)変調を処理するために、デュアルブランチ畳み込みニューラルネットワーク(CNN)-トランスフォーマーネットワーク(PDCNet)を提案する。
PDCNet内では、Transformerブランチを使用してフリンジイメージのグローバルな認識をキャプチャし、CNNブランチはスペックルイメージのローカル詳細を収集するように設計されている。
提案手法は, 自己生成データセット上で高精度な結果が得られる一方で, フランジオーダーの曖昧さを低減できる。
論文 参考訳(メタデータ) (2024-07-19T10:49:26Z) - CT-MVSNet: Efficient Multi-View Stereo with Cross-scale Transformer [8.962657021133925]
クロススケールトランス(CT)プロセスは、追加計算なしで異なる段階の表現を特徴付ける。
複数のスケールで異なる対話型アテンションの組み合わせを利用する適応型マッチング認識変換器(AMT)を導入する。
また、より細かなコストボリューム構成に大まかにグローバルな意味情報を埋め込む2機能ガイドアグリゲーション(DFGA)も提案する。
論文 参考訳(メタデータ) (2023-12-14T01:33:18Z) - Affine-Consistent Transformer for Multi-Class Cell Nuclei Detection [76.11864242047074]
本稿では, 原子核位置を直接生成する新しいアフィン一貫性変換器 (AC-Former) を提案する。
本稿では,AAT (Adaptive Affine Transformer) モジュールを導入し,ローカルネットワークトレーニングのためのオリジナル画像をワープするための重要な空間変換を自動学習する。
実験結果から,提案手法は様々なベンチマークにおいて既存の最先端アルゴリズムを著しく上回ることがわかった。
論文 参考訳(メタデータ) (2023-10-22T02:27:02Z) - FocDepthFormer: Transformer with latent LSTM for Depth Estimation from Focal Stack [11.433602615992516]
本稿では,トランスフォーマーをLSTMモジュールとCNNデコーダと統合した新しいトランスフォーマーネットワークFocDepthFormerを提案する。
LSTMを組み込むことで、FocDepthFormerは大規模な単分子RGB深さ推定データセットで事前トレーニングすることができる。
我々のモデルは、複数の評価指標で最先端のアプローチより優れています。
論文 参考訳(メタデータ) (2023-10-17T11:53:32Z) - CSformer: Bridging Convolution and Transformer for Compressive Sensing [65.22377493627687]
本稿では,CNNからの詳細な空間情報を活用するためのハイブリッドフレームワークと,表現学習の強化を目的としたトランスフォーマーが提供するグローバルコンテキストを統合することを提案する。
提案手法は、適応的なサンプリングとリカバリからなるエンドツーエンドの圧縮画像センシング手法である。
実験により, 圧縮センシングにおける専用トランスアーキテクチャの有効性が示された。
論文 参考訳(メタデータ) (2021-12-31T04:37:11Z) - PnP-DETR: Towards Efficient Visual Analysis with Transformers [146.55679348493587]
近年、DeTRはトランスフォーマーを用いたソリューションビジョンタスクの先駆者であり、画像特徴マップを直接オブジェクト結果に変換する。
最近の変圧器を用いた画像認識モデルとTTは、一貫した効率向上を示す。
論文 参考訳(メタデータ) (2021-09-15T01:10:30Z) - Global Filter Networks for Image Classification [90.81352483076323]
本稿では,対数線形複雑度を持つ周波数領域における長期空間依存性を学習する,概念的に単純だが計算効率のよいアーキテクチャを提案する。
この結果から,GFNetはトランスフォーマー型モデルやCNNの効率,一般化能力,堅牢性において,非常に競争力のある代替手段となる可能性が示唆された。
論文 参考訳(メタデータ) (2021-07-01T17:58:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。