論文の概要: DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery
- arxiv url: http://arxiv.org/abs/2608.20308v1
- Date: Thu, 20 Aug 2026 17:46:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.662737
- Title: DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery
- Title(参考訳): DreamHand: Occlusion-Robust Egocentric 3D Hand Motionの再生のためのビデオ拡散モデル
- Abstract要約: Egocentric Videoは、組み込みAIのためのスケーラブルな操作データを提供する。
しかし、重度物体の閉塞と頻繁な視界外ギャップのため、3次元手指軌跡の復元は困難である。
オフラインのクリップレベルフレームワークであるDreamHandを導入し、決定論的クリーンレイテンシを使って機能を抽出し、双方向時空間デコーダでデコードする。
- 参考スコア(独自算出の注目度): 51.92897182932217
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Egocentric video offers scalable manipulation data for embodied AI, yet recovering metric 3D hand trajectories remains challenging due to severe object occlusion and frequent out-of-sight gaps. Existing single-frame and windowed temporal regressors fail when hand shortly leaves the frame, while recent video diffusion models (VDMs) rely on heavy, stochastic multi-step sampling as pixel-space renderers. We instead repurpose VDM into a deterministic geometry encoder. A single forward pass over the clean latent exposes scene content beyond current observations, including occluded and out-of-sight hands. We introduce DreamHand, an offline clip-level framework that extracts features via a Deterministic Clean-Latent Encoder and decodes them with a Bidirectional Spatiotemporal Decoder. DreamHand recovers continuous bimanual trajectories with metric placement and no external detector, while a Ray-Based Camera Solver supports a second configuration that needs no test-time camera intrinsics. Across five egocentric benchmarks, DreamHand sets a new state of the art, cutting MPJPE-p by 30% on occlusion-heavy ARCTIC and 40% on HOT3D. These gains reach 46%-61% once out-of-sight hands are included in the evaluation, offering a scalable path from everyday human video to robot manipulation data.
- Abstract(参考訳): Egocentric Videoは、AIを具体化するためのスケーラブルな操作データを提供するが、厳密なオブジェクトの閉塞と頻繁な視界外ギャップのために、メトリクスの3Dハンドトラジェクトリの回収は依然として困難である。
最近のビデオ拡散モデル(VDM)は、ピクセル空間のレンダラーとして重くて確率的なマルチステップサンプリングに依存している。
代わりに、VDMを決定論的幾何エンコーダに置き換える。
片方の前方通過は、現在の観察以上のシーンコンテンツを露呈する。
オフラインのクリップレベルフレームワークであるDreamHandを導入し、決定論的クリーンレイテンシエンコーダを通じて機能を抽出し、双方向時空間デコーダでデコードする。
DreamHandは、メートル法配置と外部検出器なしの連続したバイマン軌道を回復する一方、Ray-Based Camera Solverは、テストタイムカメラの内在性を必要としない第2構成をサポートしている。
5つのエゴセントリックなベンチマークの中で、DreamHandは新たな最先端のMPJPE-pを、オクルージョン重のARCTICで30%、HOT3Dで40%削減する。
人間のビデオからロボット操作データへのスケーラブルなパスを提供する。
関連論文リスト
- Manifold4D: Denoising on Point Cloud Rendered Manifolds for Video Re-shooting [16.163736801043942]
ビデオの再撮影は、ユーザが指定したカメラ軌道に沿って、ダイナミックシーンのモノクロビデオを再レンダリングする。
支配的なレシピは、ターゲットの幾何学を明示的に提供します。
フローマッチングの初期ノイズに直接レンダリングを注入するMANIFOLD4Dを提案する。
論文 参考訳(メタデータ) (2026-08-28T10:39:52Z) - KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding [58.541098216700796]
エンボディド・ワールド・モデルの 物理的整合性を評価することは 重要なオープン・チャレンジです
既存のフレームワークはほとんどがアクション抽出に逆ダイナミクスモデル(IDM)に依存している。
IDMのないEWMのためのクローズドループベンチマークであるKineBenchを紹介する。
論文 参考訳(メタデータ) (2026-07-22T08:04:17Z) - ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video [51.951128822418774]
ReViVは、総合的なエゴセントリックな4D再構成のためのフレームワークである。
Masked Generative Egocentric Transformerにより、ReViVは単一のフィードフォワードアーキテクチャ内で動作する。
論文 参考訳(メタデータ) (2026-07-20T10:22:53Z) - KineFuse: Kinematic-Aware Haptic Fusion for In-Hand Occluded-Object Pose Tracking [18.013999575547427]
手で操作するには連続した6Dポーズトラッキングが必要だが、操作する指は必然的にカメラから物体を遮蔽する。
本研究は,多指ハンドで既に利用可能な疎発性触覚信号のプロセプション,近位力/トルク,二指接触などの構造について検討する。
キネマティック・アウェア・フィンガーレベル・エンコーダを提案し、3段階評価により4つの代替設計と体系的に比較する。
論文 参考訳(メタデータ) (2026-07-16T11:07:47Z) - HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control [51.913695868638634]
We present HandsOnWorld, a framework for hand-control egocentric video generation that for multi-view and marker-based motion capture, learning from unconstrained monocular video。
EgoVid-Proは、クリーンでプロタゴニストのみのハンドトラジェクトリのデータセットで、103Kのクリップと、さまざまな日常シーンの約1200万フレームにまたがる。
また, カメラから手表面への3次元光線表現, カメラと手の動きを表現レベルで切り離す3次元ハンドマップを提案する。
論文 参考訳(メタデータ) (2026-07-02T12:14:02Z) - The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction [36.627109956900256]
ViDiHandは、エゴセントリックなビデオから4Dの手の動きを再現するためのパイプラインだ。
予め訓練されたビデオ拡散モデルに基づいており、世界史を保存しながら手の特徴を専門とする。
ARCTIC、HOT3D、HOI4Dでは、ViDiHandは従来の方法よりも大幅に優れている。
論文 参考訳(メタデータ) (2026-06-29T13:53:00Z) - Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints [87.13154261503168]
モーションコントロール可能なビデオ生成は、仮想現実と組み込みAIにおけるエゴセントリックなアプリケーションに不可欠である。
既存の手法は、しばしば3D一貫性のきめ細かい手話を実現するのに苦労する。
単一の参照フレームからエゴセントリックなビデオを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-12T10:02:23Z) - QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy [9.514718375634345]
画像から3Dシーンの幾何学と意味学を学ぶことは、コンピュータビジョンにおける中核的な課題であり、自動運転の重要な能力である。
大規模な3Dアノテーションは高価であるため、最近の研究は手動ラベルなしでセンサデータから直接自己教師付き学習を探索している。
クエリベースの自己教師型フレームワークであるQueryOccを導入し、独立した4Dセマンティッククエリを通じて、継続的3D占有を直接学習する。
論文 参考訳(メタデータ) (2025-11-21T13:05:42Z) - 3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation [83.98251722144195]
制御可能なビデオ生成における従来の方法は、主に物体の動きを操作するために2D制御信号を利用する。
本稿では3次元空間におけるマルチエンタリティダイナミクスを制御する頑健なコントローラである3DTrajMasterを紹介する。
3DTrajMasterは,多心性3D動作を制御するための精度と一般化の両面において,新しい最先端技術を設定する。
論文 参考訳(メタデータ) (2024-12-10T18:55:13Z) - STRIDE: Single-video based Temporally Continuous Occlusion-Robust 3D Pose Estimation [27.854074900345314]
本研究では,STIDE (Single-video based TempoRally contInuous Occlusion-Robust 3D Estimation Pose) を提案する。
筆者らのフレームワークは,モデルに依存しない柔軟性を示し,既製の3Dポーズ推定手法を用いて,堅牢性と時間的整合性を向上させる。
論文 参考訳(メタデータ) (2023-12-24T11:05:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。