論文の概要: EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting
- arxiv url: http://arxiv.org/abs/2608.22449v1
- Date: Sun, 23 Aug 2026 14:58:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.771198
- Title: EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting
- Title(参考訳): EMPIRE:Egocentric Hand-Motion Forecastingのための学習可能な中間表現としての明示的操作計画
- Authors: Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen,
- Abstract要約: 本稿では,エゴセントリックな手動予測のための中間表現として,明示的操作計画を導入した2段階のフレームワークを提案する。
モーションジェネレータは、凍結したプランナー表現に条件付けられた将来のバイマニュアルハンド動作を合成する。
本手法は,MPJPEが84.53mm,指相対誤差が38.97mmで,最先端の予測精度を実現する。
- 参考スコア(独自算出の注目度): 75.76075128622837
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Forecasting dexterous hand motions from egocentric observations is fundamental to intelligent interactive systems. Existing VLM-based methods typically map observations directly to future motions, overlooking the underlying manipulation process that governs hand-object interactions. Moreover, end-to-end optimization couples manipulation learning with motion synthesis, causing motion-generation gradients to interfere with the pre-learned manipulation-aware representations. To overcome these limitations, we propose EMPIRE, a two-stage framework that introduces Explicit Manipulation Planning as an Intermediate Representation for Egocentric hand-motion forecasting. Stage I: Learn to Plan. EMPIRE first learns explicit manipulation plans from multimodal context to capture the progression of hand-object interactions. Stage II: Learn to Act. A motion generator synthesizes future bimanual hand motions conditioned on frozen planner representations, preventing motion-generation gradients from affecting manipulation planning. To support our method, we further construct EMPIRE-651K, a bimanual hand-motion forecasting dataset comprising 650,910 training windows across 111 tasks, each paired with an explicit per-hand manipulation plan. Under identical training and evaluation protocols, EMPIRE achieves state-of-the-art forecasting accuracy, with an MPJPE of 84.53 mm and a finger-relative error of 38.97mm. We release the code and dataset at https://github.com/wangwen-banban/EMPIRE.
- Abstract(参考訳): 自我中心の観測から外見的な手の動きを予測することは、インテリジェントな対話システムに不可欠である。
既存のVLMベースの手法は、観察を直接将来の動きにマッピングし、手動物体の相互作用を管理する基礎となる操作プロセスを見渡すのが一般的である。
さらに、エンド・ツー・エンドの最適化は、学習をモーション合成と組み合わせることで、動作生成勾配が事前に学習した操作認識表現に干渉する。
これらの制約を克服するために,エゴセントリックな手動予測のための中間表現として明示的操作計画を導入する2段階フレームワークEMPIREを提案する。
ステージ1: 計画を学ぶ。
EMPIREはまず、手動物体相互作用の進行を捉えるために、マルチモーダルコンテキストから明示的な操作計画を学ぶ。
第2ステージ:演技を学ぶ。
モーションジェネレータは、凍結したプランナー表現に条件付けられた将来のバイマニュアルハンド動作を合成し、動作生成勾配が操作計画に影響を与えるのを防止する。
提案手法を支援するために,111タスクにわたる650,910のトレーニングウィンドウからなるバイマンハンドモーション予測データセットEMPIRE-651Kを構築した。
EMPIREは、同一のトレーニングおよび評価プロトコルの下で、MPJPEが84.53mm、指相対誤差が38.97mmという最先端の予測精度を達成する。
コードとデータセットはhttps://github.com/wangwen-banban/EMPIREで公開しています。
関連論文リスト
- AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding [55.535374902204296]
AffordanceVLAは、タスク指向の中間表現として構造化された価格予測を導入する統一フレームワークである。
AffordanceVLAは様々な操作シナリオで高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-04T13:28:51Z) - Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views [40.35520614736267]
マルチモーダル入力,多次元およびマルチターゲット予測パターン,マルチタスクの可利用性を考慮したユニバーサルハンドモーション予測フレームワークを提案する。
ヒトの頭と手の動きを同時に予測し、自我中心視における動きのシナジーを捉えるために、新しい二重枝拡散法が提案されている。
文献に下流タスク評価を取り入れた最初の試みとして,手の動き予測アルゴリズムの現実的適用性を評価するための新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2025-11-17T02:14:13Z) - Ego-centric Predictive Model Conditioned on Hand Trajectories [52.531681772560724]
自我中心のシナリオでは、次の行動とその視覚的結果の両方を予測することは、人間と物体の相互作用を理解するために不可欠である。
我々は,エゴセントリックなシナリオにおける行動と視覚的未来を共同でモデル化する,統合された2段階予測フレームワークを提案する。
我々のアプローチは、エゴセントリックな人間の活動理解とロボット操作の両方を扱うために設計された最初の統一モデルである。
論文 参考訳(メタデータ) (2025-08-27T13:09:55Z) - Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos [32.71627274876863]
本稿では,授業ビデオにおけるプロシージャ計画の課題に対処し,開始と終了の視覚的観察から協調的かつタスクに沿ったアクションシーケンスを生成することを目的とする。
これまでの研究は主に、観察された状態と観察されていない行動の間のギャップを埋めるためにテキストレベルの監督に依存してきたが、行動間の複雑な時間的関係を捉えるのに苦労した。
本研究では,拡散モデル内に潜時空間時間モジュールを導入した仮設仮設時間補間拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-07-04T08:54:59Z) - Latent Diffusion Planning for Imitation Learning [78.56207566743154]
Latent Diffusion Planning (LDP) は、プランナーと逆ダイナミクスモデルからなるモジュラーアプローチである。
行動予測からプランニングを分離することにより、LDPは最適なデータと行動自由データのより密集した監視信号の恩恵を受けることができる。
シミュレーションされた視覚ロボット操作タスクにおいて、LDPは最先端の模倣学習アプローチより優れている。
論文 参考訳(メタデータ) (2025-04-23T17:53:34Z) - PEAR: Phrase-Based Hand-Object Interaction Anticipation [20.53329698350243]
ファースト・パーソン・ハンド・オブジェクト・インタラクション・予測は、現在のシーンとプロンプトに基づいてインタラクション・プロセスを予測することを目的としている。
既存の研究は通常、操作を無視しながら相互作用の意図だけを予測している。
インタラクションの意図と操作を共同で予測する新しいモデルPEARを提案する。
論文 参考訳(メタデータ) (2024-07-31T10:28:49Z) - Learning Manipulation by Predicting Interaction [85.57297574510507]
本稿では,インタラクションを予測して操作を学習する一般的な事前学習パイプラインを提案する。
実験の結果,MPIは従来のロボットプラットフォームと比較して10%から64%向上していることがわかった。
論文 参考訳(メタデータ) (2024-06-01T13:28:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。