論文の概要: DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation
- arxiv url: http://arxiv.org/abs/2607.23755v1
- Date: Sun, 26 Jul 2026 17:00:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.219833
- Title: DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation
- Title(参考訳): DAP-Pose-Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation
- Authors: Jianhan Lin, Yuchu Qin, Jiateng Yuan, Wenbo Zhang, Shuai Gao,
- Abstract要約: DAP-Poseは、堅牢なマルチモーダルポーズ推定のための統一されたエンドツーエンドモデルである。
BCFモジュールは、視覚、慣性、測定から意味的および幾何学的な動きの手がかりをキャプチャする。
DTAモジュールは非同期ストリームを遅延空間に整列させ、厳密なハードウェア同期なしにコヒーレントな動作モデリングを可能にする。
- 参考スコア(独自算出の注目度): 1.9537336589945413
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robust and accurate pose estimation with multi-modal sensors is fundamental for autonomous vehicles and mobile robotic systems in complex environments. In this paper, we propose DAP-Pose, a unified end-to-end model for robust multi-modal pose estimation. DAP-Pose introduces a Bi-level Cross-modal Fusion (BCF) module that captures complementary semantic and geometric motion cues from visual, inertial, and GNSS measurements. To handle temporal offsets, we designed a Deep Temporal Alignment (DTA) module that explicitly aligns asynchronous streams in latent space, enabling coherent motion modeling without strict hardware synchronization. Furthermore, we incorporate physics-aware constraints via manifold geometry and GNSS-guided absolute metric scale, enforcing motion consistency and mitigating drift. Experiments upon the public KITTI benchmark dataset were conducted to evaluate the performance of DAP-Pose against existing methods. DAP-Pose achieved the state-of-the-art performance, with the lowest average translation error ($t_{rel}$) of 1.31% and rotation error ($r_{rel}$) of 0.46$^{\circ}$. Furthermore, it accurately estimates poses and maintains robust performance under severe artificially injected temporal misalignment.
- Abstract(参考訳): マルチモーダルセンサによるロバストで正確なポーズ推定は、複雑な環境下での自律走行車や移動ロボットシステムにとって基礎となる。
本稿では,堅牢なマルチモーダルポーズ推定のためのエンドツーエンド統一モデルであるDAP-Poseを提案する。
DAP-Poseはバイレベルクロスモーダル・フュージョン(BCF)モジュールを導入し、視覚、慣性、GNSSの測定から相補的な意味と幾何学的な動きの手がかりをキャプチャする。
時間的オフセットを処理するために,遅延空間における非同期ストリームを明示的に整列するDeep Temporal Alignment (DTA) モジュールを設計し,ハードウェアの厳密な同期なしにコヒーレントな動作モデリングを可能にする。
さらに,GNSS誘導絶対測度スケールや運動の整合性,ドリフトの緩和など,物理に配慮した制約を多様体幾何学とGNSS誘導絶対測度スケールに組み入れた。
既存の手法に対するDAP-Poseの性能を評価するために,パブリックKITTIベンチマークデータセットの実験を行った。
DAP-Poseは最先端のパフォーマンスを達成し、平均翻訳誤差(t_{rel}$)は1.31%、回転誤差(r_{rel}$)は0.46$^{\circ}$であった。
さらに、高度に人工的に注入された時間的過誤の下で、ポーズを正確に推定し、堅牢な性能を維持する。
関連論文リスト
- TSCA-Net: Temporal-Spatial Clique Attention for Interpretable Multimodal Pedestrian Trajectory Prediction [1.3612214163974456]
3つの相補的なモジュール上に構築された軌道予測フレームワークであるTSCA-Netを提案する。
TSCA(Temporal-Spatial Clique Attention)モジュールは、clique-based goal-history interactionに学習可能な時間ゲーティングを導入する。
クロスペデストリアン傾斜ポテンシャル(CPCP)モジュールは、動的傾きポテンシャルフレームワークを通じて非対称な対のエージェント関係をモデル化する。
Adaptive Kan Grid Refinement (AKGR) 機構は、エージェントごとのゴール分布エントロピーに基づいて、コルモゴロフ・アルノルドネットワーク拡張LSTMデコーダのBスプライングリッド解像度を動的に調整する。
論文 参考訳(メタデータ) (2026-07-11T08:32:02Z) - PDRNN: Modular Data-driven Pedestrian Dead Reckoning on Loosely Coupled Radio- and Inertial-Signalstreams [2.4897806364302633]
センサデータストリームを暗黙的に予測できるシンプルなリカレントニューラルネットワーク(RNN)アーキテクチャを提案する。
提案手法では,各コンポーネントを機械学習(ML)モデルの独立したアンサンブルとして扱うモジュール型ハイブリッドAI支援PDRシステムであるPDRNNを導入する。
動的スポーツ運動データを用いた実験により,PDRNNは従来のML法やML法に比べて精度と精度が優れていることが示された。
論文 参考訳(メタデータ) (2026-05-14T16:35:57Z) - Stereo-Inertial Poser: Towards Metric-Accurate Shape-Aware Motion Capture Using Sparse IMUs and a Single Stereo Camera [54.967647497048205]
本稿では,距離精度と形状を考慮した3次元動作を推定するリアルタイムモーションキャプチャシステムであるStereo-Inertial Poserを提案する。
モノクラーRGBをステレオビジョンに置き換え、直接3次元キーポイント抽出と形状パラメータ推定を可能にした。
ドリフトフリーなグローバル翻訳を長い記録時間で生成し,フットスケート効果を低減させる。
論文 参考訳(メタデータ) (2026-03-02T17:46:38Z) - Group Inertial Poser: Multi-Person Pose and Global Translation from Sparse Inertial Sensors and Ultra-Wideband Ranging [28.86800972797388]
Group Inertial Poserは、身体のポーズを強く推定し、複数の個人に対してグローバルな翻訳を行うための新しいアプローチである。
Group Inertial Poserは、超広帯域距離(UWB)からの2組のセンサー間の絶対距離を推定する
2人追跡のための最初のIMU+UWBデータセットであるGIP-DBを導入する。
論文 参考訳(メタデータ) (2025-10-24T17:11:50Z) - Geometric Neural Distance Fields for Learning Human Motion Priors [51.99890740169883]
本研究では,より頑健で時間的に整合性があり,物理的に妥当な3次元運動回復を可能にする新しい3D生成人体運動について紹介する。
AMASSデータセットをトレーニングし、NRMFは複数の入力モードにまたがって著しく一般化する。
論文 参考訳(メタデータ) (2025-09-11T17:58:18Z) - DIMM: Decoupled Multi-hierarchy Kalman Filter for 3D Object Tracking [50.038098341549095]
状態推定は、高い操作性を持つ3次元物体追跡において困難である。
本稿では,各方向の異なる動きモデルから推定される推定を効果的に組み合わせる新しいフレームワークであるDIMMを提案する。
DIMMは既存の状態推定手法のトラッキング精度を31.61%99.23%向上させる。
論文 参考訳(メタデータ) (2025-05-18T10:12:41Z) - ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions [91.55655961014027]
シーン理解には3次元セマンティック占有とフロー予測が不可欠である。
本稿では,3つの改善点を目標とした視覚ベースのフレームワークを提案する。
我々の純粋な畳み込みアーキテクチャは、セマンティック占有率とジョイントセマンティックフロー予測の両方のために、複数のベンチマーク上で新しいSOTA性能を確立する。
論文 参考訳(メタデータ) (2024-11-12T11:32:56Z) - DeepSimHO: Stable Pose Estimation for Hand-Object Interaction via
Physics Simulation [81.11585774044848]
我々は、前方物理シミュレーションと後方勾配近似とニューラルネットワークを組み合わせた新しいディープラーニングパイプラインであるDeepSimHOを紹介する。
提案手法は, 評価の安定性を著しく向上し, テスト時間最適化よりも優れた効率性を実現する。
論文 参考訳(メタデータ) (2023-10-11T05:34:36Z) - TLIO: Tight Learned Inertial Odometry [43.17991168599939]
IMUのみの状態推定のための密結合拡張カルマンフィルタフレームワークを提案する。
ヘッドセットからの歩行者データでトレーニングされた我々のネットワークは、統計的に一貫した測定と不確実性を生み出すことができる。
論文 参考訳(メタデータ) (2020-07-06T03:13:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。