論文の概要: Flexible Motion Generation from Language and Style References
- arxiv url: http://arxiv.org/abs/2609.08032v1
- Date: Mon, 07 Sep 2026 22:28:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.529212
- Title: Flexible Motion Generation from Language and Style References
- Title(参考訳): 言語からのフレキシブルモーション生成とスタイル参照
- Authors: Kai Weixian Lan, Bodie Criswell, Briana Fedkiw, Zhan Zhang, Joseph Teran, Daniel Holden,
- Abstract要約: 自然言語記述と動作スタイル参照の両方を条件としたフレキシブルなヒューマンモーション合成のためのフレームワークFlexMoGenを紹介する。
スタイルの例クリップは、ニュアンスされた動作特性を直接伝達することでテキストを補完し、モデルが高レベルな意図を維持できる。
実験によると、FlexMoGenはコンテンツの忠実度とスタイルのリフレクションの最良のバランスを達成する。
- 参考スコア(独自算出の注目度): 8.863552570164048
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce FlexMoGen, a novel framework for flexible human motion synthesis conditioned on both natural language descriptions and motion style references. Text prompts are effective at defining semantic content, but they are often limited in capturing fine-grained style details such as timing, limb articulation, and expressive dynamics. A style example clip supplements the text by conveying these nuanced motion characteristics directly, enabling the model to preserve high-level intent while reproducing the desired stylistic traits. Given a text prompt and a style example clip, FlexMoGen generates high-quality motions that preserve semantic content while faithfully reflecting the target style, offering users greater control over the animation generation process. Unlike prior methods that rely on discrete style labels and do not generalize to long or multi-style generation, FlexMoGen learns a variational style encoder without style supervision and supports long, time-varying, multi-style synthesis. Our framework jointly pre-trains the style encoder and a text-to-motion latent diffusion model within a unified architecture, modulating motion style through a lightweight adaptation module. It integrates an efficient relative positional encoding scheme and is trained on both stylized and non-stylized datasets, enabling strong generalization to unseen text-style combinations. Experiments show that FlexMoGen achieves the best balance between content fidelity and style reflection.
- Abstract(参考訳): 本稿では、自然言語記述と動きスタイル参照の両方を条件とした、フレキシブルな人間の動き合成のための新しいフレームワークFlexMoGenを紹介する。
テキストプロンプトは意味的内容を定義するのに有効であるが、タイミング、手足の調音、表現力学といった細かなスタイルの詳細を捉えることに制限されることが多い。
スタイルの例クリップは、これらのニュアンスされた動作特性を直接伝達することでテキストを補完し、所望のスタイル特性を再現しながら、高レベルな意図を維持することができる。
テキストプロンプトとスタイルのサンプルクリップが与えられたFlexMoGenは、ターゲットのスタイルを忠実に反映しながらセマンティックなコンテンツを保存する高品質なモーションを生成し、アニメーション生成プロセスをよりコントロールする。
FlexMoGenは、個別のスタイルラベルを頼りにし、長いスタイルやマルチスタイルの生成を一般化しない従来の方法とは異なり、スタイルの監督なしに変動スタイルのエンコーダを学び、長い、時間的な、マルチスタイルの合成をサポートする。
本フレームワークは,軽量適応モジュールを用いて動作スタイルを変調する統合アーキテクチャにおいて,スタイルエンコーダとテキスト・トゥ・モーション遅延拡散モデルとを協調的に事前学習する。
効率的な相対的位置符号化方式を統合し、スタイリングされたデータセットと非スティル化されたデータセットの両方で訓練される。
実験によると、FlexMoGenはコンテンツの忠実度とスタイルのリフレクションの最良のバランスを達成している。
関連論文リスト
- Stylized Text-to-Motion Generation via Hypernetwork-Driven Low-Rank Adaptation [15.45127792716575]
テキスト駆動の運動拡散モデルは現実的な人間の動きを生成できるが、テキストだけではスタイルとして知られる動きの微妙なニュアンスを表現するのに苦労することが多い。
近年のアプローチでは、事前訓練されたテキスト駆動拡散モデルにスタイル注入機構を付加することでこの問題に対処している。
本稿では,ハイパーネットワークで生成されたLoRAパラメータを用いて,事前学習した拡散モデルを動的に変調する軽量なスタイル条件付けフレームワークを提案する。
HumanML3Dと100STYLEデータセットの実験は、最先端のスタイル化結果を示しながら、目に見えないスタイルのスタイル化の改善を実現している。
論文 参考訳(メタデータ) (2026-05-13T10:51:54Z) - ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model [73.95608242322949]
Stylized Text-to-Image Generation (STIG)は、テキストプロンプトとスタイル参照画像から画像を生成することを目的としている。
我々は、事前訓練された安定拡散を利用して、誤解釈スタイルや一貫性のない意味論といった課題に対処する新しいフレームワーク、ArtWeaverを提案する。
論文 参考訳(メタデータ) (2024-05-24T07:19:40Z) - StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter [78.75422651890776]
StyleCrafterは、トレーニング済みのT2Vモデルをスタイルコントロールアダプタで拡張する汎用的な方法である。
コンテンツスタイルのゆがみを促進するため,テキストプロンプトからスタイル記述を取り除き,参照画像のみからスタイル情報を抽出する。
StyleCrafterは、テキストの内容と一致し、参照画像のスタイルに似た高品質なスタイリングビデオを効率よく生成する。
論文 参考訳(メタデータ) (2023-12-01T03:53:21Z) - ParaGuide: Guided Diffusion Paraphrasers for Plug-and-Play Textual Style
Transfer [57.6482608202409]
テキストスタイル転送は、意味を保ちながらテキストのスタイル特性を変換するタスクである。
任意のスタイルに柔軟に適応できる汎用型転送のための新しい拡散型フレームワークを提案する。
本研究では,人的評価と自動評価の両面から,Enron Email Corpusの手法を検証するとともに,形式性,感情,さらにはオーサシップスタイルの伝達にも優れることを示す。
論文 参考訳(メタデータ) (2023-08-29T17:36:02Z) - GestureDiffuCLIP: Gesture Diffusion Model with CLIP Latents [3.229105662984031]
GestureDiffuCLIPは、フレキシブルなスタイル制御を備えたリアルでスタイル化された音声合成ジェスチャを合成するためのニューラルネットワークフレームワークである。
本システムは,高品質なジェスチャを生成するために潜時拡散モデルを学び,CLIP表現をジェネレータに注入する。
我々のシステムは、個々の身体部分のきめ細かいスタイル制御を可能にするよう拡張することができる。
論文 参考訳(メタデータ) (2023-03-26T03:35:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。