論文の概要: Flexible Motion Generation from Language and Style References
- arxiv url: http://arxiv.org/abs/2609.08032v1
- Date: Mon, 07 Sep 2026 22:28:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.529212
- Title: Flexible Motion Generation from Language and Style References
- Title(参考訳): 言語からのフレキシブルモーション生成とスタイル参照
- Abstract要約: 自然言語記述と動作スタイル参照の両方を条件としたフレキシブルなヒューマンモーション合成のためのフレームワークFlexMoGenを紹介する。
スタイルの例クリップは、ニュアンスされた動作特性を直接伝達することでテキストを補完し、モデルが高レベルな意図を維持できる。
実験によると、FlexMoGenはコンテンツの忠実度とスタイルのリフレクションの最良のバランスを達成する。
- 参考スコア(独自算出の注目度): 8.863552570164048
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce FlexMoGen, a novel framework for flexible human motion synthesis conditioned on both natural language descriptions and motion style references. Text prompts are effective at defining semantic content, but they are often limited in capturing fine-grained style details such as timing, limb articulation, and expressive dynamics. A style example clip supplements the text by conveying these nuanced motion characteristics directly, enabling the model to preserve high-level intent while reproducing the desired stylistic traits. Given a text prompt and a style example clip, FlexMoGen generates high-quality motions that preserve semantic content while faithfully reflecting the target style, offering users greater control over the animation generation process. Unlike prior methods that rely on discrete style labels and do not generalize to long or multi-style generation, FlexMoGen learns a variational style encoder without style supervision and supports long, time-varying, multi-style synthesis. Our framework jointly pre-trains the style encoder and a text-to-motion latent diffusion model within a unified architecture, modulating motion style through a lightweight adaptation module. It integrates an efficient relative positional encoding scheme and is trained on both stylized and non-stylized datasets, enabling strong generalization to unseen text-style combinations. Experiments show that FlexMoGen achieves the best balance between content fidelity and style reflection.
- Abstract(参考訳): 本稿では、自然言語記述と動きスタイル参照の両方を条件とした、フレキシブルな人間の動き合成のための新しいフレームワークFlexMoGenを紹介する。
テキストプロンプトは意味的内容を定義するのに有効であるが、タイミング、手足の調音、表現力学といった細かなスタイルの詳細を捉えることに制限されることが多い。
スタイルの例クリップは、これらのニュアンスされた動作特性を直接伝達することでテキストを補完し、所望のスタイル特性を再現しながら、高レベルな意図を維持することができる。
テキストプロンプトとスタイルのサンプルクリップが与えられたFlexMoGenは、ターゲットのスタイルを忠実に反映しながらセマンティックなコンテンツを保存する高品質なモーションを生成し、アニメーション生成プロセスをよりコントロールする。
FlexMoGenは、個別のスタイルラベルを頼りにし、長いスタイルやマルチスタイルの生成を一般化しない従来の方法とは異なり、スタイルの監督なしに変動スタイルのエンコーダを学び、長い、時間的な、マルチスタイルの合成をサポートする。
本フレームワークは,軽量適応モジュールを用いて動作スタイルを変調する統合アーキテクチャにおいて,スタイルエンコーダとテキスト・トゥ・モーション遅延拡散モデルとを協調的に事前学習する。
効率的な相対的位置符号化方式を統合し、スタイリングされたデータセットと非スティル化されたデータセットの両方で訓練される。
実験によると、FlexMoGenはコンテンツの忠実度とスタイルのリフレクションの最良のバランスを達成している。
関連論文リスト
- MorphoStyle: Motion Style Transfer with Morphology Control [15.706942166849288]
形状認識型モーションスタイル転送のためのフレームワークであるMorphoStyleを提案する。
MorphoStyleは形状条件付き有限-Scalar-Quantization Variational Auto-Encoder上に構築されている。
論文 参考訳(メタデータ) (2026-09-12T23:40:27Z) - Stylized Text-to-Motion Generation via Hypernetwork-Driven Low-Rank Adaptation [15.45127792716575]
テキスト駆動の運動拡散モデルは現実的な人間の動きを生成できるが、テキストだけではスタイルとして知られる動きの微妙なニュアンスを表現するのに苦労することが多い。
近年のアプローチでは、事前訓練されたテキスト駆動拡散モデルにスタイル注入機構を付加することでこの問題に対処している。
本稿では,ハイパーネットワークで生成されたLoRAパラメータを用いて,事前学習した拡散モデルを動的に変調する軽量なスタイル条件付けフレームワークを提案する。
HumanML3Dと100STYLEデータセットの実験は、最先端のスタイル化結果を示しながら、目に見えないスタイルのスタイル化の改善を実現している。
論文 参考訳(メタデータ) (2026-05-13T10:51:54Z) - Mixture of Style Experts for Diverse Image Stylization [73.7600741657193]
StyleExpertは、Mixture of Experts (MoE)をベースにしたセマンティックアウェアフレームワークである
我々のフレームワークは、コンテンツスタイルのスタイリング三重項の大規模データセットに基づいて訓練された統一型スタイルエンコーダを使用している。
本手法は, 浅いテクスチャから深いセマンティクスまで, 複数のセマンティクスレベルにまたがる多様なスタイルを扱う。
論文 参考訳(メタデータ) (2026-03-17T15:20:19Z) - Sissi: Zero-shot Style-guided Image Synthesis via Semantic-style Integration [57.02757226679549]
本研究では,文脈内学習タスクとしてスタイル誘導合成を再構成する学習自由フレームワークを提案する。
セマンティック・スタイル統合(DSSI)機構を提案する。
実験により,本手法はセマンティックスタイルのバランスと視覚的品質に優れた高忠実度スタイリングを実現することが示された。
論文 参考訳(メタデータ) (2026-01-10T16:01:14Z) - StyleMotif: Multi-Modal Motion Stylization using Style-Content Cross Fusion [14.213279927964903]
StyleMotifはStylized Motion Latent Diffusionモデルである。
複数のモダリティからコンテンツとスタイルの両方に条件付けされた動作を生成する。
論文 参考訳(メタデータ) (2025-03-27T17:59:46Z) - StyleDistance: Stronger Content-Independent Style Embeddings with Synthetic Parallel Examples [48.44036251656947]
スタイル表現は、内容に関係なく、類似した書体スタイルのテキストを密に埋め込み、異なる書体スタイルのテキストを遠くに埋め込むことを目的としている。
より強力なコンテンツに依存しないスタイル埋め込みをトレーニングするための新しいアプローチであるStyleDistanceを紹介する。
論文 参考訳(メタデータ) (2024-10-16T17:25:25Z) - ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model [73.95608242322949]
Stylized Text-to-Image Generation (STIG)は、テキストプロンプトとスタイル参照画像から画像を生成することを目的としている。
我々は、事前訓練された安定拡散を利用して、誤解釈スタイルや一貫性のない意味論といった課題に対処する新しいフレームワーク、ArtWeaverを提案する。
論文 参考訳(メタデータ) (2024-05-24T07:19:40Z) - Generative Human Motion Stylization in Latent Space [42.831468727082694]
単一動作(遅延)符号の多種多様なスタイリング結果を生成する新しい生成モデルを提案する。
推論では、ユーザーは参照動作やラベルからスタイルキューを使用して動きをスタイル化することができる。
提案手法は, 軽量な設計にもかかわらず, スタイル再現, コンテンツ保存, 一般化において, 最先端のスタイリングモデルよりも優れていた。
論文 参考訳(メタデータ) (2024-01-24T14:53:13Z) - StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter [78.75422651890776]
StyleCrafterは、トレーニング済みのT2Vモデルをスタイルコントロールアダプタで拡張する汎用的な方法である。
コンテンツスタイルのゆがみを促進するため,テキストプロンプトからスタイル記述を取り除き,参照画像のみからスタイル情報を抽出する。
StyleCrafterは、テキストの内容と一致し、参照画像のスタイルに似た高品質なスタイリングビデオを効率よく生成する。
論文 参考訳(メタデータ) (2023-12-01T03:53:21Z) - ParaGuide: Guided Diffusion Paraphrasers for Plug-and-Play Textual Style
Transfer [57.6482608202409]
テキストスタイル転送は、意味を保ちながらテキストのスタイル特性を変換するタスクである。
任意のスタイルに柔軟に適応できる汎用型転送のための新しい拡散型フレームワークを提案する。
本研究では,人的評価と自動評価の両面から,Enron Email Corpusの手法を検証するとともに,形式性,感情,さらにはオーサシップスタイルの伝達にも優れることを示す。
論文 参考訳(メタデータ) (2023-08-29T17:36:02Z) - GestureDiffuCLIP: Gesture Diffusion Model with CLIP Latents [3.229105662984031]
GestureDiffuCLIPは、フレキシブルなスタイル制御を備えたリアルでスタイル化された音声合成ジェスチャを合成するためのニューラルネットワークフレームワークである。
本システムは,高品質なジェスチャを生成するために潜時拡散モデルを学び,CLIP表現をジェネレータに注入する。
我々のシステムは、個々の身体部分のきめ細かいスタイル制御を可能にするよう拡張することができる。
論文 参考訳(メタデータ) (2023-03-26T03:35:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。