EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting
Abstractの概要
EMPIREは、マルチモーダルな観測と動作生成の間に明示的な操作計画を挿入する、一人称視点(エゴセントリック)の両手動作予測のための2段階フレームワークです。第1段階では、視覚言語プランナーがRGB、単眼深度、大まかなキャプション、およびカメラ視野から、時系列順の手ごとの操作ステップを予測します。第2段階では、フローマッチング拡散トランスフォーマーが、凍結されたプランナーの隠れ状態を条件付けとして未来の手の動作を生成し、動作学習時の勾配が計画表現を変更するのを防ぎます。また本論文では、111種類の操作タスクにわたる650,910件の5秒間の予測ウィンドウで構成され、それぞれに手ごとの明示的な操作計画が付与されたデータセット「EMPIRE-651K」も提案しています。
新規性
本研究は、視覚と言語の観測を動作へと直接マッピングするのではなく、一人称視点の手の動作予測における学習可能な中間表現として明示的な操作計画を導入しています。これを、動作生成器の学習中にプランナーを凍結する分離型の「計画してから実行する」学習スキームと組み合わせ、計画の教師データを含む新規に構築された大規模データセットによって支援しています。
成果
EMPIRE-651Kにおいて、EMPIREはMPJPEが84.53 mm、指の相対MPJPEが38.97 mmという最先端の予測精度を達成しました。再実装されたVITRAベースラインと比較してMPJPEを19.8%削減しつつ学習時間を38.8%短縮し、Being-H0-14Bと同等の全体精度を83.5倍高速な推論で実現しています。さらにタスクレベルの分析により、明示的な計画はより複雑なタスクで大きな利点をもたらし、評価された111の操作タスク中89タスクで性能が向上することが示されました。
論文の注目点
- EMPIREは予測を2段階に分離し、VLMがマルチモーダル入力から手ごとの構造化された操作計画を生成し、フローマッチングDiTアクターが凍結されたプランナーの隠れ状態を条件として未来の両手動作を予測します。
- 著者らはEgoDexからEMPIRE-651Kを構築し、111の操作タスクにわたる650,910件の学習ウィンドウに対して、MANOに基づく目標軌道とVLM生成後に監査・フィルタリングされた操作計画を提供しています。
- 実験結果とアブレーション研究により、明示的な計画の条件付けと動作勾配のVLMからの隔離が、詳細な指の関節運動、全体的な予測精度、学習効率、およびタスク横断的な汎化性能を大幅に向上させることが実証されています。