論文の概要: HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control
- arxiv url: http://arxiv.org/abs/2607.02075v1
- Date: Thu, 02 Jul 2026 12:14:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.821088
- Title: HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control
- Title(参考訳): HandsOnWorld: カメラ付き手ぶれ制御による非拘束エゴシックビデオ生成
- Abstract要約: We present HandsOnWorld, a framework for hand-control egocentric video generation that for multi-view and marker-based motion capture, learning from unconstrained monocular video。
EgoVid-Proは、クリーンでプロタゴニストのみのハンドトラジェクトリのデータセットで、103Kのクリップと、さまざまな日常シーンの約1200万フレームにまたがる。
また, カメラから手表面への3次元光線表現, カメラと手の動きを表現レベルで切り離す3次元ハンドマップを提案する。
- 参考スコア(独自算出の注目度): 51.913695868638634
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present HandsOnWorld, a framework for hand-controlled egocentric video generation that forgoes multi-view and marker-based motion capture, learning instead from unconstrained monocular video. Such generality is bottlenecked by the scarcity of scalable 3D hand annotations: large egocentric corpora lack finger-level labels, whereas precise hand datasets are confined to narrow, instrumented settings, limiting prior hand-controlled generators to restricted scene distributions. We instead annotate 3D hands directly on in-the-wild egocentric video through monocular reconstruction, introducing a protagonist-centered annotation pipeline that filters the reconstructions at the action-semantic, image-quality, and 3D-geometric levels to build EgoVid-Pro, a dataset of clean, protagonist-only hand trajectories spanning 103K clips and roughly 12M frames across diverse everyday scenes. To resolve the camera-hand entanglement induced by large ego-motion, we further propose the Plücker Hand Map, a 3D-aware control signal that extends Plücker-ray representations from camera rays to the hand surface, disentangling camera and hand motion at the representation level. Experiments show that \method surpasses prior hand-controlled generators in reconstruction fidelity and control accuracy, and generalizes to out-of-distribution everyday scenes beyond the laboratory datasets on which prior methods rely.
- Abstract(参考訳): We present HandsOnWorld, a framework for hand-control egocentric video generation that for multi-view and marker-based motion capture, learning from unconstrained monocular video。
大規模なエゴセントリックコーパスには指レベルのラベルがないのに対して、正確な手データセットは狭く計測された設定に限られており、以前の手操作によるジェネレータを制限されたシーン分布に制限している。
EgoVid-Proは、クリーンでプロタゴニストのみのハンドトラジェクタで、103Kのクリップと約1200万フレームのさまざまな日常シーンにまたがる、クリーンでプロタゴニストのみのハンドトラジェクタのデータセットで、アクション・セマンティック、画像品質、そして3D-ジオメトリレベルの再構築をフィルタリングする、プロタゴニスト中心のアノテーションパイプラインを導入しています。
そこで本研究では,大規模なエゴモーションによって引き起こされるカメラハンドの絡み合いを解決するために,カメラから手表面へのプリュッカー線表現,カメラと手の動きを表現レベルで拡張する3次元制御信号であるPlücker Hand Mapを提案する。
実験により,<method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</method</。
関連論文リスト
- EventEgoHands++: Event-based Egocentric 3D Hand Mesh Reconstruction with Real Dataset [3.8731899020772165]
イベントベースの3Dハンドメッシュ再構築のための枠組みを,エゴセントリックな視点から提案する。
提案手法は,左手と右手の両方に対して,インスタンスレベルのバウンディングボックスとマスクを推定するハンドディテクタを組み込んだ。
また,これらの検出結果に基づいて注意を動的にゲートするアダプティブアテンションも導入する。
論文 参考訳(メタデータ) (2026-09-15T13:46:02Z) - DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery [51.92897182932217]
Egocentric Videoは、組み込みAIのためのスケーラブルな操作データを提供する。
しかし、重度物体の閉塞と頻繁な視界外ギャップのため、3次元手指軌跡の復元は困難である。
オフラインのクリップレベルフレームワークであるDreamHandを導入し、決定論的クリーンレイテンシを使って機能を抽出し、双方向時空間デコーダでデコードする。
論文 参考訳(メタデータ) (2026-08-20T17:46:24Z) - EgoForce: Forearm-Guided Camera-Space 3D Hand Pose from a Monocular Egocentric Camera [40.28396219356337]
EgoForceは、頑丈で絶対的な3Dハンドポーズを復元する、単眼の3Dハンドコンストラクションフレームワークである。
魚眼、視界、歪んだ広視野のカメラモデルを単一の統一ネットワークで運用する。
EgoForceは最先端の3D精度を実現し、カメラ空間のMPJPEを最大28%削減する。
論文 参考訳(メタデータ) (2026-05-12T17:59:56Z) - SHOW3D: Capturing Scenes of 3D Hands and Objects in the Wild [17.556955295385908]
既存のハンドオブジェクトインタラクションデータセットは、主にコントロールされたスタジオ設定でキャプチャされる。
そこで本研究では,非拘束の移動性を実現するためのマーカーレスマルチカメラシステムを提案する。
SHOW3Dは3Dアノテーションを付加した最初の大規模データセットであり、様々な現実世界環境におけるオブジェクトとのインタラクションを示す。
論文 参考訳(メタデータ) (2026-03-30T17:58:27Z) - Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints [87.13154261503168]
モーションコントロール可能なビデオ生成は、仮想現実と組み込みAIにおけるエゴセントリックなアプリケーションに不可欠である。
既存の手法は、しばしば3D一貫性のきめ細かい手話を実現するのに苦労する。
単一の参照フレームからエゴセントリックなビデオを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-12T10:02:23Z) - Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures [33.2764643227486]
エゴセントリックなインタラクティブな世界モデルは、拡張現実と具体的AIにとって不可欠であり、視覚生成は低レイテンシ、幾何的一貫性、長期的な安定性でユーザの入力に応答する必要がある。
自由空間ハンドジェスチャ下での単一シーン画像からのエゴセントリックなインタラクション生成について検討し、シーンに手を入れたり、オブジェクトと対話したり、ヘッドモーション下でプラプティブルな世界ダイナミクスを誘導するフォトリアリスティックな映像を合成することを目的とした。
この設定には、自由空間のジェスチャーと接触重大なトレーニングデータとの分配シフト、モノクロビューにおける手の動きとカメラの動きのあいまいさ、任意の長さのビデオ生成の必要性など、基本的な課題が導入されている。
論文 参考訳(メタデータ) (2026-02-10T09:51:07Z) - Ego-Exo 3D Hand Tracking in the Wild with a Mobile Multi-Camera Rig [14.496137517475743]
高精度な3次元手や物体を撮像する新しいマーカーレスマルチカメラシステムを提案する。
軽量でバックマウントのキャプチャ・リグと8台のエキゾセントリックカメラ、そして2つのエゴセントリックなビューを提供するMeta Quest 3ヘッドセットを組み合わせています。
我々は、同期したマルチビュー画像と正確な3Dハンドポーズを備えた注釈付きデータセットを収集する。
論文 参考訳(メタデータ) (2025-10-02T22:26:03Z) - 3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation [83.98251722144195]
制御可能なビデオ生成における従来の方法は、主に物体の動きを操作するために2D制御信号を利用する。
本稿では3次元空間におけるマルチエンタリティダイナミクスを制御する頑健なコントローラである3DTrajMasterを紹介する。
3DTrajMasterは,多心性3D動作を制御するための精度と一般化の両面において,新しい最先端技術を設定する。
論文 参考訳(メタデータ) (2024-12-10T18:55:13Z) - Benchmarks and Challenges in Pose Estimation for Egocentric Hand Interactions with Objects [89.95728475983263]
ロボティクス、AR/VR、アクション認識、モーション生成といったタスクにおいて、自己中心的な視点からこのようなインタラクションを理解することが重要である。
我々は、AmblyHandsとARCTICデータセットに基づいたHANDS23チャレンジを、慎重に設計されたトレーニングとテストの分割に基づいて設計する。
提案手法の結果と近年のリーダーボードのベースラインに基づいて,3Dハンド(オブジェクト)再構成タスクの徹底的な解析を行う。
論文 参考訳(メタデータ) (2024-03-25T05:12:21Z) - Consistent 3D Hand Reconstruction in Video via self-supervised Learning [67.55449194046996]
本稿では,モノクロ映像から高精度で一貫した3Dハンドを再構築する手法を提案する。
検出された2次元手指キーポイントと画像テクスチャは、3次元手の形状とテクスチャに関する重要な手がかりを提供する。
自己監督型3Dハンド再構成モデルであるS2HAND$を提案する。
論文 参考訳(メタデータ) (2022-01-24T09:44:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。