論文の概要: In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics
- arxiv url: http://arxiv.org/abs/2606.26981v1
- Date: Thu, 25 Jun 2026 12:50:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.286883
- Title: In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics
- Title(参考訳): 文脈内モデル予測生成:言語モデルから物理へのオープン語彙運動合成
- Authors: Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen,
- Abstract要約: In-Context Model Predictive Generation (ICMPG)は、言語モデル計画と推論時の物理的フィードバックを統合するフレームワークである。
ICMPGは2つのモジュールでモデル予測制御(MPC)のようなプロセスとして運動合成を再構成する。
- 参考スコア(独自算出の注目度): 109.99871326497333
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthesizing human motion from textual descriptions is essential for immersive digital applications, yet existing methods face a persistent trade-off between semantic fidelity and physical realism. Large language model (LLM)-based approaches can interpret diverse open-vocabulary instructions and compose high-level action plans, but they often generate motions that violate physical constraints. Physics-aware models improve realism through simulation or control, but they struggle with semantic complexity, fine-grained instructions, and novel concepts. To address this gap, we propose In-Context Model Predictive Generation (ICMPG), a framework that integrates language-model planning with inference-time physical feedback. ICMPG reformulates motion synthesis as a Model Predictive Control (MPC)-like process with two modules. The Context-Aware Motion Generation (CAMG) module uses an LLM as a planner to decompose textual commands and generate candidate motion sequences from motion tokens. The Model Predictive Generation (MPG) module evaluates these candidates through physical simulation and semantic alignment, estimates a composite reward, and selects the best sequence to guide subsequent generation steps. Unlike open-loop generation, this closed-loop refinement enables ICMPG to adapt motions to both the input semantics and the simulated physical environment without task-specific policy retraining. Extensive experiments across standard and zero-shot open-vocabulary settings show that ICMPG generalizes robustly to diverse commands and produces motions that are more physically plausible and semantically faithful than representative baselines on the evaluated benchmarks. The framework bridges semantic interpretation and physical simulation while remaining flexible enough to incorporate different LLM backbones, enabling more versatile and controllable text-driven motion synthesis.
- Abstract(参考訳): テキスト記述から人間の動きを合成することは没入型デジタルアプリケーションには不可欠であるが、既存の手法は意味的忠実性と物理的な現実性の間に永続的なトレードオフに直面している。
大規模言語モデル(LLM)に基づくアプローチは、様々なオープン語彙の命令を解釈し、ハイレベルなアクションプランを構成することができるが、しばしば物理的な制約に反する動作を生成する。
物理学を意識したモデルは、シミュレーションや制御を通じてリアリズムを改善するが、意味論的複雑さ、きめ細かい指示、そして新しい概念に苦しむ。
このギャップに対処するために,言語モデル計画と推論時物理フィードバックを統合するフレームワークであるIn-Context Model Predictive Generation (ICMPG)を提案する。
ICMPGは2つのモジュールでモデル予測制御(MPC)のようなプロセスとして運動合成を再構成する。
Context-Aware Motion Generation (CAMG)モジュールは、LLMをプランナーとして使用し、テキストコマンドを分解し、モーショントークンから候補のモーションシーケンスを生成する。
モデル予測生成(MPG)モジュールは、これらの候補を物理的シミュレーションとセマンティックアライメントを通じて評価し、合成報酬を推定し、その後の生成ステップを導く最良のシーケンスを選択する。
オープンループ生成とは異なり、このクローズドループ改善により、ICMPGはタスク固有のポリシーを訓練することなく、入力セマンティクスとシミュレートされた物理環境の両方に動きを適応させることができる。
標準およびゼロショットのオープンボキャブラリ設定の広範な実験により、ICMPGは様々なコマンドに頑健に一般化し、評価されたベンチマーク上の代表ベースラインよりも物理的に妥当で意味論的に忠実な動作を生成する。
このフレームワークは意味論的解釈と物理シミュレーションをブリッジし、異なるLLMバックボーンを組み込むのに十分な柔軟性を維持し、より汎用的で制御可能なテキスト駆動モーション合成を可能にする。
関連論文リスト
- SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control [72.5651722107621]
SCRIPTは、言語駆動の物理に基づくヒューマノイド制御のための多段階トレーニングフレームワークを備えたスケーラブルな拡散ポリシーである。
SCRIPTの中核はJAST-DiT(Joint Action-State-Text Diffusion Transformer)であり、アクション、物理状態、テキストを専用トークンストリームとして表現している。
自己回帰制御を安定させるために,近年の密集した文脈を保存し,長期的歴史から疎開したサンプルを抽出する非線形履歴条件付け機構を導入する。
論文 参考訳(メタデータ) (2026-05-21T14:17:21Z) - GenerativeMPC: VLM-RAG-guided Whole-Body MPC with Virtual Impedance for Bimanual Mobile Manipulation [2.061143628317803]
双方向のモバイル操作は、ハイレベルなセマンティック推論と安全で準拠した物理的相互作用のシームレスな統合を必要とする。
本稿では,双方向移動マニピュレータの物理的制御パラメータによる意味的シーン理解を橋渡しする階層型サイバー物理フレームワークであるGenerativeMPCを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:44:38Z) - LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens [19.167250154665812]
LLaMoは、モダリティ固有のMixture-of-Transformersアーキテクチャを通じて、事前訓練された大規模言語モデルを拡張するフレームワークである。
人間の動きを因果連続潜伏空間にエンコードし、デコーダのみのバックボーンで次のトーケン予測パラダイムを維持する。
実験により,LLaMoは一般的な設定で高忠実なテキスト・ツー・モーション生成とモーション・トゥ・テキストキャプションを実現することが示された。
論文 参考訳(メタデータ) (2026-02-12T20:02:21Z) - Motion-R1: Chain-of-Thought Reasoning and Reinforcement Learning for Human Motion Generation [31.484189825477877]
Motion-R1は、Chain-of-Thoughtメカニズムを統合したモーション言語モデリングフレームワークである。
複雑なテキスト命令を論理的に構造化されたアクションパスに明示的に分解することで、モーションR1はモーション生成のための高レベルなセマンティックガイダンスを提供する。
複数のベンチマークデータセットに対する実験では、Motion-R1は最先端の手法と比較して、競争力や優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-06-12T05:21:43Z) - LANGTRAJ: Diffusion Model and Dataset for Language-Conditioned Trajectory Simulation [102.1527101235251]
LangTrajは、トラフィックシナリオにおけるすべてのエージェントの共同動作をシミュレートする、言語条件のシーン拡散モデルである。
自然言語入力を条件付けすることで、LangTrajはインタラクティブな振る舞いを柔軟かつ直感的に制御できる。
LangTraj氏は、リアリズム、言語制御性、言語条件の安全クリティカルなシミュレーションにおいて、強力なパフォーマンスを示している。
論文 参考訳(メタデータ) (2025-04-15T17:14:06Z) - LangSuitE: Planning, Controlling and Interacting with Large Language Models in Embodied Text Environments [70.91258869156353]
テキストエンボディの世界における6つの代表的具体的タスクを特徴とする多目的・シミュレーション不要なテストベッドであるLangSuitEを紹介する。
以前のLLMベースのテストベッドと比較すると、LangSuitEは複数のシミュレーションエンジンを使わずに、多様な環境への適応性を提供する。
具体化された状態の履歴情報を要約した新しいチェーン・オブ・ソート(CoT)スキーマであるEmMemを考案する。
論文 参考訳(メタデータ) (2024-06-24T03:36:29Z) - Interactive Character Control with Auto-Regressive Motion Diffusion Models [18.727066177880708]
リアルタイム動作合成のためのA-MDM(Auto-Regressive Motion Diffusion Model)を提案する。
我々の条件拡散モデルは初期ポーズを入力とし、前者のフレームに条件付けられた連続した動きフレームを自動回帰的に生成する。
本稿では,タスク指向サンプリング,インペインティング,階層的強化学習など,対話型制御をA-MDMに組み込む一連の手法を紹介する。
論文 参考訳(メタデータ) (2023-06-01T07:48:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。