論文の概要: Estimating Accurate Hand Pose in Camera Space with Vision Transformer
- arxiv url: http://arxiv.org/abs/2609.24424v2
- Date: Tue, 22 Sep 2026 03:26:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.98386
- Title: Estimating Accurate Hand Pose in Camera Space with Vision Transformer
- Title(参考訳): 視覚変換器を用いたカメラ空間における正確なハンドポースの推定
- Abstract要約: コンピュータビジョンにおける重要な研究フロンティアとして、単眼のRGBベースの手ポーズ推定が登場している。
本フレームワークでは,手深度情報抽出のためのtransform-Iso Supervisionとパースペクティブ情報埋め込みという2つの重要なイノベーションを提案する。
我々の完全統合アプローチは、HO3D上のSOTAよりもCS-MJEにおいて少なくとも37.1%の優位性を達成する。
- 参考スコア(独自算出の注目度): 8.226195369046016
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Monocular RGB-based hand pose estimation has emerged as a critical research frontier in computer vision. The local hand pose estimation methods predict hand poses relative to the wrist, while global hand pose estimation also requires estimating the wrist's position in the camera coordinate system. However, this camera-space estimation confronts two fundamental challenges: (1) depth ambiguity in monocular settings, and (2) the coupling effect of hand local poses and global wrist positions in the perspective projections. In particular, this coupling reflects that the projections are jointly determined by local hand poses, wrist positions, and camera intrinsics. To overcome these challenges, our framework proposes two key innovations: Transformation-Isomorphism Supervision for hand-depth information extraction and Perspective Information Embedding for resolving above coupling effect of local pose and wrist position, both integrated within the mainstream encoder-decoder architecture. Besides, we propose a novel framerate-aware multi-dataset training strategy for sequential pose refinement. Our fully integrated approach achieves at most 37.1\% superiority in CS-MJE over SOTA on HO3D. Project page: https://github.com/Mine268/CS-ViT.
- Abstract(参考訳): コンピュータビジョンにおける重要な研究フロンティアとして、単眼のRGBベースの手ポーズ推定が登場している。
局所的な手ポーズ推定法は手首に対して手ポーズを推定するが,大域的な手ポーズ推定では手首の位置をカメラ座標系で推定する必要がある。
しかし,このカメラ空間推定は,(1)単眼設定における奥行きのあいまいさ,(2)視点投影における手動ポーズとグローバル手首位置の結合効果の2つの基本的な課題に直面する。
特に、この結合は、プロジェクションが局所的なポーズ、手首の位置、カメラ固有の位置によって共同で決定されていることを反映している。
これらの課題を克服するため,本フレームワークでは,手深度情報抽出のためのトランスフォーメーション・アイソモーフィズム・スーパービジョンと,ローカルポーズと手首位置の結合効果を解消するためのパースペクティブ情報埋め込みという2つの重要なイノベーションを提案する。
さらに,シーケンシャルポーズ改善のための新しいフレームレート対応マルチデータセットトレーニング戦略を提案する。
我々の完全に統合されたアプローチは、HO3D上のSOTAよりもCS-MJEにおいて少なくとも37.1\%の優位性を達成する。
プロジェクトページ:https://github.com/Mine268/CS-ViT.com
関連論文リスト
- REACH: Hand Pose Estimation from Room Corners [36.83846955932045]
遠隔地から人の手の形状やポーズを正確に再現できる新しい3Dハンドポーズ推定器を提案する。
私たちのキーとなるアイデアは、身体のコーディネーション、時間的進行、多視点観察を十分に活用することです。
我々のモデルであるREACH-Netは,遠方からの高精度な3次元ポーズ推定を実現する。
論文 参考訳(メタデータ) (2026-05-21T09:32:18Z) - Generalized Hand-Object Pose Estimation with Occlusion Awareness [87.10073091219066]
1枚のRGB画像から一般的な3次元手動ポーズ推定は、物体の外観や相互作用パターンに大きな変化があるため、依然として困難である。
我々は,オクルージョン認識を用いた汎用的手動ポーズ推定フレームワークであるGenHOIを提案する。
論文 参考訳(メタデータ) (2026-03-19T15:19:23Z) - UniHOPE: A Unified Approach for Hand-Only and Hand-Object Pose Estimation [82.93208597526503]
既存のメソッドは、オブジェクトと対話する素手または手に焦点を当てて、特殊化されている。
他のシナリオに適用しても、どちらのメソッドも柔軟にシナリオとパフォーマンスの低下を処理できません。
汎用的な3次元手動ポーズ推定のための統一的なアプローチであるUniHOPEを提案する。
論文 参考訳(メタデータ) (2025-03-17T15:46:43Z) - HandDGP: Camera-Space Hand Mesh Prediction with Differentiable Global Positioning [1.4515751892711464]
本稿では,2D-3D対応問題に対処するエンドツーエンドソリューションを提案する。
このソリューションは、新しい差別化可能なグローバル位置決めモジュールを通じて、カメラ空間出力からネットワークの他の部分へのバックプロパゲーションを可能にする。
いくつかのベースラインと最先端のアプローチに対する評価において、我々のフレームワークの有効性を検証する。
論文 参考訳(メタデータ) (2024-07-22T17:59:01Z) - SCIPaD: Incorporating Spatial Clues into Unsupervised Pose-Depth Joint Learning [17.99904937160487]
本研究では,教師なし深層学習のための空間的手がかりを取り入れた新しいアプローチであるSCIPaDを紹介する。
SCIPaDは平均翻訳誤差22.2%、カメラポーズ推定タスクの平均角誤差34.8%をKITTI Odometryデータセットで達成している。
論文 参考訳(メタデータ) (2024-07-07T06:52:51Z) - HandDiff: 3D Hand Pose Estimation with Diffusion on Image-Point Cloud [60.47544798202017]
ハンドポーズ推定は、様々な人間とコンピュータの相互作用アプリケーションにおいて重要なタスクである。
本論文は,手形画像点雲上での正確な手ポーズを反復的に認知する拡散型手ポーズ推定モデルであるHandDiffを提案する。
実験の結果,提案したHandDiffは,4つの挑戦的なハンドポーズベンチマークデータセットにおいて,既存のアプローチよりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-04-04T02:15:16Z) - LG-Hand: Advancing 3D Hand Pose Estimation with Locally and Globally
Kinematic Knowledge [0.693939291118954]
本稿では3次元手ポーズ推定のための強力な手法であるLG-Handを提案する。
キネマティックな情報が重要な役割を担い、3次元手ポーズ推定の性能に寄与すると主張している。
提案手法は,Person Hand Action Benchmarkデータセット上で有望な結果を得る。
論文 参考訳(メタデータ) (2022-11-06T15:26:32Z) - 3D Interacting Hand Pose Estimation by Hand De-occlusion and Removal [85.30756038989057]
単一のRGB画像から3Dインタラクションハンドポーズを推定することは、人間の行動を理解するのに不可欠である。
本稿では,難易度の高い手ポーズ推定タスクを分解し,各手のポーズを別々に推定することを提案する。
実験の結果,提案手法は従来の手ポーズ推定手法よりも有意に優れていた。
論文 参考訳(メタデータ) (2022-07-22T13:04:06Z) - MetaPose: Fast 3D Pose from Multiple Views without 3D Supervision [72.5863451123577]
正確な3Dポーズとカメラ推定が可能なニューラルモデルをトレーニングする方法を示す。
本手法は,古典的バンドル調整と弱教師付き単分子3Dベースラインの両方に優れる。
論文 参考訳(メタデータ) (2021-08-10T18:39:56Z) - Two-hand Global 3D Pose Estimation Using Monocular RGB [0.0]
我々は、単眼のRGB入力画像のみを用いて、両手のグローバルな3D関節位置を推定する難しい課題に取り組む。
本稿では,手の位置を正確に把握する多段階畳み込みニューラルネットワークに基づくパイプラインを提案する。
RGBのみの入力を用いて両手の3Dハンドトラッキングを高精度に行う。
論文 参考訳(メタデータ) (2020-06-01T23:53:52Z) - Measuring Generalisation to Unseen Viewpoints, Articulations, Shapes and
Objects for 3D Hand Pose Estimation under Hand-Object Interaction [137.28465645405655]
HANDS'19は、現在の3Dハンドポーズ推定器(HPE)がトレーニングセットのポーズを補間し、外挿する能力を評価するための課題である。
本研究では,最先端手法の精度が低下し,トレーニングセットから外れたポーズでほとんど失敗することを示す。
論文 参考訳(メタデータ) (2020-03-30T19:28:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。