論文の概要: IUP-Pose: Decoupled Iterative Uncertainty Propagation for Real-time Relative Pose Regression via Implicit Dense Alignment v1
- arxiv url: http://arxiv.org/abs/2603.19625v1
- Date: Fri, 20 Mar 2026 04:04:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.988225
- Title: IUP-Pose: Decoupled Iterative Uncertainty Propagation for Real-time Relative Pose Regression via Implicit Dense Alignment v1
- Title(参考訳): IUP-Pose:Implicit Dense Alignment v1によるリアルタイム相対性詩回帰のための反復的不確実性伝播の分離
- Authors: Jun Wang, Xiaoyan Huang,
- Abstract要約: 相対的なポーズ推定は、SLAM、視覚的位置決め、および3D再構成に基本となる。
既存のRPR(Relative Pose Regression)メソッドでは,機能マッチングパイプラインの精度は向上するが,非微分可能なRANSACによるブロック勾配フローが実現されている。
IUP-Poseは、幾何駆動の分離された反復的フレームワークであり、暗黙の密接なアライメントを持つ。
- 参考スコア(独自算出の注目度): 4.987163446489143
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Relative pose estimation is fundamental for SLAM, visual localization, and 3D reconstruction. Existing Relative Pose Regression (RPR) methods face a key trade-off: feature-matching pipelines achieve high accuracy but block gradient flow via non-differentiable RANSAC, while ViT-based regressors are end-to-end trainable but prohibitively expensive for real-time deployment. We identify the core bottlenecks as the coupling between rotation and translation estimation and insufficient cross-view feature alignment. We propose IUP-Pose, a geometry-driven decoupled iterative framework with implicit dense alignment. A lightweight Multi-Head Bi-Cross Attention (MHBC) module aligns cross-view features without explicit matching supervision. The aligned features are processed by a decoupled rotation-translation pipeline: two shared-parameter rotation stages iteratively refine rotation with uncertainty, and feature maps are realigned via rotational homography H_inf before translation prediction. IUP-Pose achieves 73.3% AUC@20deg on MegaDepth1500 with full end-to-end differentiability, 70 FPS throughput, and only 37M parameters, demonstrating a favorable accuracy-efficiency trade-off for real-time edge deployment.
- Abstract(参考訳): 相対的なポーズ推定は、SLAM、視覚的位置決め、および3D再構成に基本となる。
既存のRPR(Relative Pose Regression)メソッドは重要なトレードオフに直面している。 機能マッチングパイプラインは高い精度を達成するが、非微分可能なRANSACによるブロック勾配フローを実現する。
中心となるボトルネックは、回転と翻訳推定の結合と、クロスビューな特徴アライメントの不十分さである。
IUP-Poseは、幾何駆動の分離された反復的フレームワークであり、暗黙の密接なアライメントを持つ。
MHBC(Multi-Head Bi-Cross Attention)モジュールは、明示的なマッチング監督なしに、クロスビュー機能を整列する。
2つの共有パラメータ回転ステージは、不確実性を伴う反復的に回転を洗練し、特徴写像は、翻訳予測の前に回転ホモグラフィH_infを介して再構成される。
IUP-PoseはMegaDepth1500上で73.3%のAUC@20degを達成した。
関連論文リスト
- Bidirectional Feature-aligned Motion Transformation for Efficient Dynamic Point Cloud Compression [97.66080040613726]
特徴空間における動きを暗黙的にモデル化する双方向特徴整合運動変換(Bi-FMT)フレームワークを提案する。
Bi-FMTは、時間的に一貫した潜在表現を生成するために、過去と将来の両方のフレームで機能を調整する。
圧縮効率とランタイムの両方において, Bi-FMT が D-DPCC と AdaDPCC を上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-18T03:51:06Z) - H3R: Hybrid Multi-view Correspondence for Generalizable 3D Reconstruction [39.22287224290769]
H3Rは、潜在融合と注目に基づく機能集約を統合するハイブリッドフレームワークである。
両パラダイムを統合することで,既存手法よりも2$times$高速に収束しながら,一般化が促進される。
本手法は,ロバストなクロスデータセットの一般化を実証しながら,可変数および高分解能な入力ビューをサポートする。
論文 参考訳(メタデータ) (2025-08-05T05:56:30Z) - Bidirectional Regression for Monocular 6DoF Head Pose Estimation and Reference System Alignment [23.65735794927899]
TRGv2は、我々のTranslation, Rotation, and Geometry (TRG)ネットワークの軽量拡張である。
顔のランドマークと6DoFは、ランドマーク・ツー・イメージ・プロジェクションで反復的なリファインメントループを通してポーズを推測する。
アウト・オブ・ディストリビューションデータへの一般化を改善するため、TRGv2は変換を直接予測するのではなく、補正パラメータを回帰する。
不整合性中心定義によるデータセット間評価において,これまで見過ごされていたバイアス源を同定する。
論文 参考訳(メタデータ) (2024-07-19T09:05:49Z) - An Accurate and Real-time Relative Pose Estimation from Triple Point-line Images by Decoupling Rotation and Translation [10.05584976985694]
3D-2D制約は、Visual Odometry (VO) やStructure-from-Motion (SfM) システムで広く使われている。
回転変換デカップリング推定に基づく新しい3次元ポーズ解決器を提案する。
論文 参考訳(メタデータ) (2024-03-18T10:21:05Z) - Rotation-Invariant Transformer for Point Cloud Matching [42.5714375149213]
我々は,回転不変変換器であるRoITrを導入し,点クラウドマッチングタスクにおけるポーズ変動に対処する。
本稿では,自己認識機構によって学習した,回転不変なクロスフレーム空間認識を備えたグローバルトランスフォーマーを提案する。
RoITrは、Inlier RatioとRegistration Recallの点で、既存のメソッドを少なくとも13と5のパーセンテージで上回っている。
論文 参考訳(メタデータ) (2023-03-14T20:55:27Z) - DSVT: Dynamic Sparse Voxel Transformer with Rotated Sets [95.84755169585492]
本研究では,屋外3次元知覚のためのシングルストライドウィンドウベースのボクセルトランスであるDynamic Sparse Voxel Transformer (DSVT)を提案する。
本モデルでは,3次元認識タスクを多岐にわたって行うことにより,最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-01-15T09:31:58Z) - DPCN++: Differentiable Phase Correlation Network for Versatile Pose
Registration [18.60311260250232]
本稿では,世界規模で収束し,対応のない位相相関解法を提案する。
DCPN++は,2次元鳥眼視画像,3次元物体・シーン計測,医用画像など,入力モードが異なる幅広い登録タスクで評価される。
論文 参考訳(メタデータ) (2022-06-12T10:00:34Z) - Augmented Parallel-Pyramid Net for Attention Guided Pose-Estimation [90.28365183660438]
本稿では、注意部分モジュールと微分可能な自動データ拡張を備えた拡張並列ピラミドネットを提案する。
我々は、データ拡張のシーケンスをトレーニング可能なCNNコンポーネントとして定式化する新しいポーズ検索空間を定義する。
特に,本手法は,挑戦的なCOCOキーポイントベンチマークとMPIIデータセットの最先端結果において,トップ1の精度を実現する。
論文 参考訳(メタデータ) (2020-03-17T03:52:17Z) - Robust 6D Object Pose Estimation by Learning RGB-D Features [59.580366107770764]
本稿では、この局所最適問題を解くために、回転回帰のための離散連続的な新しい定式化を提案する。
我々はSO(3)の回転アンカーを均一にサンプリングし、各アンカーから目標への制約付き偏差を予測し、最適な予測を選択するための不確実性スコアを出力する。
LINEMOD と YCB-Video の2つのベンチマーク実験により,提案手法が最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2020-02-29T06:24:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。