論文の概要: HandMvNet: Real-Time 3D Hand Pose Estimation Using Multi-View Cross-Attention Fusion
- arxiv url: http://arxiv.org/abs/2608.20093v2
- Date: Wed, 26 Aug 2026 14:49:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:14.805506
- Title: HandMvNet: Real-Time 3D Hand Pose Estimation Using Multi-View Cross-Attention Fusion
- Title(参考訳): HandMvNet:Multi-View Cross-Attention Fusionを用いたリアルタイム3Dハンドポース推定
- Authors: Muhammad Asad Ali, Nadia Robertini, Didier Stricker,
- Abstract要約: HandMvNetは、マルチビューカメラ画像から手の動きと形状を推定するために設計された最初のリアルタイム手法の1つである。
メソッドは、整合的で正確な絶対的な手の位置とあいまいさを保証する。
HandMvNetは推論時間を大幅に短縮する。
- 参考スコア(独自算出の注目度): 16.460964161152052
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this work, we present HandMvNet, one of the first real-time method designed to estimate 3D hand motion and shape from multi-view camera images. Unlike previous monocular approaches, which suffer from scale-depth ambiguities, our method ensures consistent and accurate absolute hand poses and shapes. This is achieved through a multi-view attention-fusion mechanism that effectively integrates features from multiple viewpoints. In contrast to previous multi-view methods, our approach eliminates the need for camera parameters as input to learn 3D geometry. HandMvNet also achieves a substantial reduction in inference time while delivering competitive results compared to the state-of-the-art methods, making it suitable for real-time applications. Evaluated on publicly available datasets, HandMvNet qualitatively and quantitatively outperforms previous methods under identical settings. Code is available at github.com/pyxploiter/handmvnet.
- Abstract(参考訳): 本研究では,マルチビューカメラ画像から3次元手の動きと形状を推定する最初のリアルタイム手法であるHandMvNetを提案する。
スケールの深さのあいまいさに悩まされていた従来の単分子的アプローチとは異なり、我々の手法は一貫性と正確な絶対的なポーズと形状を保証する。
これは、複数の視点から機能を効果的に統合する多視点アテンション融合機構によって達成される。
従来のマルチビュー手法とは対照的に,本手法では3次元幾何学を学習するための入力としてカメラパラメータを不要にしている。
HandMvNetは、最先端の手法と比較して競争力のある結果を提供しながら、推論時間を大幅に短縮し、リアルタイムアプリケーションに適している。
HandMvNetは、公開データセットに基づいて、定性的かつ定量的に、同じ設定で前のメソッドより優れている。
コードはgithub.com/pyxploiter/handmvnetで入手できる。
関連論文リスト
- From Sparse to Dense: Spatio-Temporal Fusion for Multi-View 3D Human Pose Estimation with DenseWarper [18.273229436048066]
マルチビューの人間のポーズ推定では、モデルは通常、特定の瞬間にポーズを予測するために、異なるカメラビューから同時にキャプチャされた画像に依存する。
そこで本研究では,新しい3次元ポーズ推定手法を提案する。
提案手法は,スパース・インターリーブ画像のみを入力として利用し,従来の多視点入力手法よりも優れ,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-05-14T08:08:29Z) - Direction-Aware Hybrid Representation Learning for 3D Hand Pose and Shape Estimation [41.96019347138128]
暗黙的な画像特徴と明示的な2次元共同座標特徴を融合する学習方向対応ハイブリッド特徴(DaHyF)を提案する。
提案手法は,DAHyF表現による3次元手振りを直接予測し,コントラスト学習に基づく予測信頼度を用いて,モーションキャプチャ時のジッタリングを低減する。
論文 参考訳(メタデータ) (2025-04-02T02:06:23Z) - WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild [53.288327629960364]
野生における効率的なマルチハンド再構築のためのデータ駆動パイプラインを提案する。
提案するパイプラインは、リアルタイム完全畳み込みハンドローカライゼーションと、高忠実度トランスフォーマーに基づく3Dハンド再構成モデルという2つのコンポーネントで構成されている。
提案手法は, 一般的な2次元および3次元のベンチマークにおいて, 効率と精度の両方において, 従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2024-09-18T18:46:51Z) - FvOR: Robust Joint Shape and Pose Optimization for Few-view Object
Reconstruction [37.81077373162092]
数枚の画像から正確な3Dオブジェクトモデルを再構築することは、コンピュータビジョンにおいて難しい問題である。
FvORは、ノイズの多い入力ポーズを持つ数枚の画像から正確な3Dモデルを予測する学習ベースのオブジェクト再構成手法である。
論文 参考訳(メタデータ) (2022-05-16T15:39:27Z) - Direct Multi-view Multi-person 3D Pose Estimation [138.48139701871213]
マルチビュー画像からマルチパーソン3Dポーズを推定するためのMulti-view Pose Transformer(MvP)を提案する。
MvPは、中間タスクに頼ることなく、複数の人物の3Dポーズを直接クリーンで効率的な方法で回帰する。
我々は,MvPモデルがより効率的でありながら,いくつかのベンチマークにおいて最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-11-07T13:09:20Z) - Self-Attentive 3D Human Pose and Shape Estimation from Videos [82.63503361008607]
3D人間のポーズと形状推定のためのビデオベースの学習アルゴリズムを紹介します。
ビデオの時間情報を利用して自己着脱モジュールを提案する。
本手法を3DPW, MPI-INF-3DHP, Human3.6Mデータセット上で評価した。
論文 参考訳(メタデータ) (2021-03-26T00:02:19Z) - Leveraging Photometric Consistency over Time for Sparsely Supervised
Hand-Object Reconstruction [118.21363599332493]
本稿では,ビデオ中のフレームの粗いサブセットに対してのみアノテーションが利用できる場合に,時間とともに光度整合性を活用する手法を提案する。
本モデルでは,ポーズを推定することにより,手や物体を3Dで共同で再構成するカラーイメージをエンドツーエンドに訓練する。
提案手法は,3次元手動画像再構成の精度向上に有効であることを示す。
論文 参考訳(メタデータ) (2020-04-28T12:03:14Z) - Lightweight Multi-View 3D Pose Estimation through Camera-Disentangled
Representation [57.11299763566534]
空間校正カメラで撮影した多視点画像から3次元ポーズを復元する手法を提案する。
我々は3次元形状を利用して、入力画像をカメラ視点から切り離したポーズの潜在表現に融合する。
アーキテクチャは、カメラプロジェクション演算子に学習した表現を条件付け、ビュー当たりの正確な2次元検出を生成する。
論文 参考訳(メタデータ) (2020-04-05T12:52:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。