論文の概要: Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting
- arxiv url: http://arxiv.org/abs/2607.15890v1
- Date: Fri, 17 Jul 2026 12:05:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.845154
- Title: Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting
- Title(参考訳): Exo2EgoPose:Egocentric 3D Hand Pose Forecastingのビジョンランゲージにおけるエクソセントリックなデモの活用
- Abstract要約: 本稿では,エゴセントリックな3Dハンドポース予測タスクを提案する。
視覚的観察、言語指導、ポーズ状態から将来のEgo 3Dハンドポーズを予測することを目的としている。
Egoビューにおける視野の制限やダイナミックな動きを克服するために,Exo2EgoPoseというフレームワークを提案する。
- 参考スコア(独自算出の注目度): 28.28260281993948
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Perceiving multimodal cues and forecasting fine-grained actions from an egocentric (Ego) perspective is vital for applications like robot manipulation. However, previous studies either rely mainly on under-informed visual inputs to predict coarse human motions or follow the VRM/VLA paradigm, which suffers from insufficient robot data and the gap between human and robot embodiments. We observe that 3D hand pose naturally serves as a unified representation to bridge human-robot actions. Hence, we investigate an under-explored Vision-Language guided Egocentric 3D Hand Pose Forecasting (VL-EHPF) task, which aims to predict future Ego 3D hand poses from visual observations, a language instruction, and pose states. To overcome the limited field-of-view and highly dynamic motions in the Ego view, we propose a framework dubbed Exo2EgoPose, which innovatively leverages holistic and stable exocentric (Exo) demonstrations as guidance to compensate for partial and dynamic Ego-view cues. Specifically, we introduce a Dual-level Exocentric Reconstruction Module (DERM), which incorporates the paired Exo videos as supervision to reconstruct their video-level and chunked frame-level representations, thereby modeling spatial contexts and temporal dynamics. Then, the Global-to-Local Modulation Module (GLMM) utilizes the reconstructed hierarchical Exo representations for progressive feature refinement via attention mechanisms and adaptive modulation, enabling comprehensive Exo guidance for accurate Ego hand pose forecasting. Extensive experiments on \textit{AssemblyHands}, \textit{Ego-Exo4D}, and our newly constructed \textit{EgoMe-pose} benchmarks show the superiority of our method, which outperforms state-of-the-art methods by a large margin. Moreover, it demonstrates an effective human-to-robot transfer capability and yields improvements on the \textit{CALVIN} dataset. Code will be released.
- Abstract(参考訳): マルチモーダルなキューを認識し、エゴセントリック(Ego)の観点からきめ細かいアクションを予測することは、ロボット操作のような応用には不可欠である。
しかし、従来の研究では、粗い人間の動きを予測するために、主にインフォームド・インプットに依存していたり、不十分なロボットデータと人間とロボットのエンボディメントのギャップに苦しむVRM/VLAパラダイムに従わされたりしていた。
人間のロボット動作を橋渡しするための統一表現として、3Dハンドポーズが自然に役立っていることを観察する。
そこで我々は,視覚的観察,言語指導,ポーズ状態から将来のEgo 3Dハンドポーズを予測することを目的とした,Egocentric 3D Hand Pose Forecasting (VL-EHPF)タスクについて検討した。
エゴビューにおける視野の制限と高ダイナミックな動きを克服するために,エゴビューの部分的および動的操作を補うためのガイダンスとして,エゴビューの全体的かつ安定的なエクソセントリック(Exo)デモを革新的に活用するExo2EgoPoseというフレームワークを提案する。
具体的には,Dual-level Exocentric Restruction Module (DERM)を導入し,ビデオレベルとチャンクフレームレベルの表現を再構成し,空間コンテキストと時間ダイナミクスをモデル化する。
次に,Global-to-Local Modulation Module (GLMM) は,アテンション機構と適応変調によるプログレッシブ特徴改善のために,再構成された階層的エクソ表現を用いて,正確なエゴ手ポーズ予測のための包括的エクソガイダンスを可能にする。
また,<textit{AssemblyHands}, \textit{Ego-Exo4D}, および新たに構築した \textit{EgoMe-pose} ベンチマークでは, 提案手法の優位性を示した。
さらに、有効な人間とロボットの転送能力を示し、 \textit{CALVIN}データセットを改善する。
コードはリリースされる。
関連論文リスト
- EgoExoMoCap: Distributed Ego-Exo Human Motion Capture [38.54314764814604]
ヘッドマウントデバイス(HMD)からの人間のモーションキャプチャは、現実世界の人間のモーションとインタラクションデータを取得するスケーラブルな方法を提供する。
我々は,HMDから人間の動き推定を行うために,エゴとエクソセントリックなマルチモーダル信号を共同で利用する分散フレームワークを提案する。
私たちのアプローチであるEgoExoMoCapは、2人(もしくはそれ以上)の人と同じくらいシンプルで、それぞれがスマートグラスを着用しています。
論文 参考訳(メタデータ) (2026-07-17T11:31:41Z) - Ego-Human Motion Prediction with 3D-Aware LLM [51.5064259568401]
Ego3DLMは、人間の動きを自我中心の視点から予測するツールである。
過去のポーズ、未来のポーズ、過去のナレーション、将来のナレーションを1つの自己回帰パスでデコードする。
Ego3DLMは、将来の動き予測、過去の動きの追跡、動作記述にまたがる最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-08T04:51:24Z) - AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding [55.535374902204296]
AffordanceVLAは、タスク指向の中間表現として構造化された価格予測を導入する統一フレームワークである。
AffordanceVLAは様々な操作シナリオで高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-04T13:28:51Z) - From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting [11.687067206676625]
EggHandは、エゴセントリックな手ポーズ予測のための基盤モデルベースのフレームワークである。
動的モーションモデリングとマルチモーダルなセマンティック推論を統一する。
提案手法は,エゴモーション下でのジェネリックビジュアルエンコーダの脆さを克服する。
論文 参考訳(メタデータ) (2026-05-08T12:09:27Z) - Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation [57.28703268044067]
ロボット操作のための新しいデュアルストリームビュー変換器であるCortical Policyを提案する。
われわれのフレームワークは、ロボット操作の新しい視点を提供し、視覚に基づくロボット制御の幅広い応用の可能性を秘めている。
論文 参考訳(メタデータ) (2026-03-22T04:18:54Z) - UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation [26.03507721111338]
本稿では、シーン認識動作合成に一対一のイメージを利用する2つの新しいタスクである、エゴセントリックモーション生成とエゴセントリックモーション予測を紹介する。
我々は,エゴセントリックデバイスに適した新しい頭部中心運動表現を備えた統一された条件付き運動拡散モデルUniEgoMotionを提案する。
UniEgoMotionは、自我中心の運動再構成において最先端のパフォーマンスを達成し、単一の自我中心の画像から動きを初めて生成する。
論文 参考訳(メタデータ) (2025-08-02T00:41:20Z) - EgoWorld: Translating Exocentric View to Egocentric View using Rich Exocentric Observations [4.252119151012245]
EgoWorld(エゴワールド)は、エゴセントリックな視点を、豊富なエゴセントリックな視点から再構築する新しいフレームワークである。
提案手法は,推定された遠心深度マップから点雲を再構成し,それをエゴセントリックな視点に再投影し,拡散に基づくインペインティングを適用して,密集した意味的コヒーレントなエゴセントリックな画像を生成する。
EgoWorldは最先端のパフォーマンスを実現し、新しいオブジェクト、アクション、シーン、主題への堅牢な一般化を実証している。
論文 参考訳(メタデータ) (2025-06-22T04:21:48Z) - Expressive Gaussian Human Avatars from Monocular RGB Video [69.56388194249942]
EVAは3DガウスとSMPL-Xに基づいて細部を巧みに彫刻する乾燥可能な人間モデルである。
SMPL-XモデルをRGBフレームに整合させることが,効果的なアバター学習において重要であることを強調した。
本稿では,勾配閾値を適応的に調整する適応密度制御戦略を提案する。
論文 参考訳(メタデータ) (2024-07-03T15:36:27Z) - Move as You Say, Interact as You Can: Language-guided Human Motion Generation with Scene Affordance [48.986552871497]
本稿では,シーンアベイランスを中間表現として活用する新しい2段階フレームワークを提案する。
シーンアベイランスマップを活用することで,マルチモーダルな条件下での人間の動きを再現する難しさを克服する。
我々のアプローチは、HumanML3DやHUMANISEなど、確立されたベンチマークのベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2024-03-26T18:41:07Z) - UnrealEgo: A New Dataset for Robust Egocentric 3D Human Motion Capture [70.59984501516084]
UnrealEgoは、エゴセントリックな3Dポーズ推定のための、新しい大規模博物学データセットである。
これは、2台の魚眼カメラを備えた高度な眼鏡のコンセプトに基づいており、制約のない環境で使用することができる。
本稿では,ステレオ入力のための2次元キーポイント推定モジュールを考案し,人間のポーズ推定を改善するための簡易かつ効果的なベンチマーク手法を提案する。
論文 参考訳(メタデータ) (2022-08-02T17:59:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。