FuguReport

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

著者 Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen
所属 Peng Cheng Laboratory / Sun Yat-Sen University / Harbin Institute of Technology
カテゴリ Method / Motion Synthesis / Model predictive control framework, Application / Language Model Utilization / Motion generation from language input, Evaluation / Physics-Based Control / Inference-time physical feedback
ライセンス CC BY 4.0

Abstractの概要

本論文は、大規模言語モデル(LLM)のプランニングと推論時の物理的フィードバックを組み合わせた、テキスト駆動型の人体モーション合成のフレームワーク「In-Context Model Predictive Generation (ICMPG)」を提案している。この手法は、オープンボキャブラリの指示を構造化されたアクション記述に分解し、モーションのトークンシーケンスの候補を生成した後、セマンティックおよび物理的な報酬に基づくモデル予測制御(MPC)の手順を用いて反復的に改善する。アーキテクチャは、LLMベースのトークン生成を担うContext-Aware Motion Generationモジュールと、シミュレーションで候補を評価し最適な続きを選択するModel Predictive Generationモジュールで構成されている。主な目的は、オープンボキャブラリのモーション生成において、セマンティックな表現力と物理的な妥当性の間に通常生じるトレードオフを軽減することである。

新規性

本研究の最大の特徴は、モーション合成をオープンループのテキスト・モーション変換やタスク特化型の強化学習ではなく、MPCのような閉ループの生成プロセスとして再定式化したことである。このフレームワークは、凍結された、あるいは限定的に調整されたLLMをプランナーおよびジェネレーターとして利用し、推論時にシミュレーションに基づく物理フィードバックと組み合わせることで、タスク特化型のポリシーの再学習を回避しながらオープンボキャブラリの柔軟性を保持している。

成果

オープンボキャブラリのBABELベンチマークにおいて、LoRAでチューニングされたモデルは、比較手法の中で最高のセマンティック指標(FID 0.492、CLIP_Score 29.32、R-Precision 0.316/0.603)を達成しつつ、82.9%のシミュレーション成功率と3.704の物理エラーを維持した。ファインチューニングを行っていないICMPGもFID、CLIP_Score、R-PrecisionでAvatarCLIPやMotionCLIPを上回っており、HumanML3DやKIT-MLにおいても、物理を考慮しないベースラインと比べて物理的制約によるリアリズムを向上させた競争力のある結果が報告されている。

論文の注目点

  1. ICMPGは、LLMベースのセマンティックプランニングとシミュレーションから得られる報酬フィードバックを組み合わせ、後退ホライズンの反復的な改善ループを用いてモーションの続きを選択する。
  2. 本手法はオープンボキャブラリのモーション合成を対象としており、SemAligner、VQ-VAEを用いたモーションのトークン化、およびセマンティック/物理的報酬の組み合わせを利用して、アライメントと物理的妥当性を向上させる。
  3. 実験により、強力なオープンボキャブラリの汎化性能と競争力のある物理的リアリズムが示されており、アブレーション検証によってプランナー、報酬の設計、LLMバックボーンが性能に実質的な影響を与えることが示されている。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。