論文の概要: EMOSH: Expressive Motion and Shape Disentanglement for Human Animation
- arxiv url: http://arxiv.org/abs/2606.28026v1
- Date: Fri, 26 Jun 2026 12:30:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.483743
- Title: EMOSH: Expressive Motion and Shape Disentanglement for Human Animation
- Title(参考訳): EMOSH:人間のアニメーションのための表現的な動きと形状の絡み合い
- Abstract要約: EMOSHは,高忠実度制御可能なヒューマンビデオ生成のための新しいフレームワークである。
形状とポーズパラメータを明確に分離することにより, 身体形状の漏洩問題を解消する。
また,表現やジェスチャーをよりきめ細やかな制御が可能な粗大なハイブリッドモーションインジェクション戦略を提案する。
- 参考スコア(独自算出の注目度): 30.355109184821686
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-fidelity and expressive controllable human animation is essential for content creation and digital avatar applications. However, existing methods face a dilemma between expressiveness and disentanglement. Mainstream 2D pose-conditioned approaches suffer from "motion-shape entanglement", leading to the leakage of the driving subject's body shape. Conversely, methods relying on 3D priors (e.g., SMPL) achieve geometric disentanglement but struggle to capture facial expressions and complex gestures, resulting in rigid animations. To this end, we propose EMOSH, a novel framework for high-fidelity controllable human video generation. First, an Expressive Human Model (EHM) is introduced as the core control representation. By explicitly disentangling shape and pose parameters, we fundamentally resolve the body shape leakage issue. Alongside this, a robust motion tracker is designed to accurately estimate EHM parameters from video. Second, we propose a Coarse-to-Fine Hybrid Motion Injection strategy, enabling more fine-grained control over expressions and gestures. Furthermore, we introduce a Spatially-Aligned Conditioning mechanism to bridge the domain gap between training and inference, improving identity consistency. Extensive experiments demonstrate that EMOSH outperforms previous methods in both self-driven and cross-driven scenarios, producing high-fidelity videos with vivid expressions while maintaining shape disentanglement.
- Abstract(参考訳): 高忠実で表現力に富んだ人間アニメーションは、コンテンツ制作とデジタルアバター応用に不可欠である。
しかし、既存の手法は表現力と絡み合いの間にジレンマに直面している。
メインストリーム2Dポーズコンディショニングアプローチは「運動形状の絡み合い」に悩まされ、運転者の体形が漏洩する。
逆に、3Dの先行(例えばSMPL)に依存する手法は幾何学的ゆがみを実現するが、表情や複雑なジェスチャーを捉えるのに苦労し、硬直的なアニメーションをもたらす。
そこで本研究では,高忠実度制御可能なヒューマンビデオ生成のための新しいフレームワークであるEMOSHを提案する。
まず、コア制御表現として、表現型人間モデル(EHM)を導入する。
形状とポーズパラメータを明確に分離することにより、身体形状の漏洩問題を根本的に解決する。
これに加えて、ロバストなモーショントラッカーは、ビデオからEHMパラメータを正確に推定するように設計されている。
第2に,表現やジェスチャーをよりきめ細やかな制御が可能な粗大なハイブリッドモーションインジェクション戦略を提案する。
さらに、トレーニングと推論のドメインギャップを埋め、アイデンティティの整合性を改善するために、空間適応型コンディショニング機構を導入する。
大規模な実験では、EMOSHは自己駆動とクロス駆動の両方のシナリオにおいて従来の手法よりも優れており、形状のゆがみを維持しながら鮮明な表現で高忠実なビデオを生成する。
関連論文リスト
- 3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement [51.22216867938034]
映像生成のための再構成3次元環境において,人間の動作軌跡を制御できる3次元モーションアニメーションフレームワークを提案する。
我々は,視点適応型潜伏融合機構を設計し,映像視認性マスキングによる点-雲の幾何前兆を生成過程に注入する。
2つの標準的な人体画像アニメーションベンチマークデータセットによる実験は、関連する映像生成のメカティクスにおける芸術的状況に対する我々の手法の顕著な改善を実証している。
論文 参考訳(メタデータ) (2026-06-29T16:22:54Z) - IM-Animation: An Implicit Motion Representation for Identity-decoupled Character Animation [58.297199313494]
インプシット法は、動画から直接動作の意味をキャプチャするが、動作と外観の絡み合いやアイデンティティの漏洩に悩まされる。
本稿では,フレームごとの動作をコンパクトな1次元モーショントークンに圧縮する新しい暗黙の動作表現を提案する。
本手法では,3段階のトレーニング戦略を用いて,トレーニング効率を高め,高い忠実性を確保する。
論文 参考訳(メタデータ) (2026-02-07T11:17:20Z) - UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework [54.337290937468175]
統合された枠組み内での2次元映像と3次元映像の協調モデリングのための自己回帰モデルUniMoを提案する。
本手法は,正確なモーションキャプチャを行いながら,対応する映像と動きを同時に生成することを示す。
論文 参考訳(メタデータ) (2025-12-03T16:03:18Z) - SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation [50.792027578906804]
本稿では,高調波とコヒーレントなアニメーションを実現するR2V(Image-to-Video)パラダイムベースのフレームワークであるSteadyDancerを紹介する。
実験により,SteadyDancerは外観の忠実さとモーションコントロールの両方において最先端の性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-24T17:15:55Z) - DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid Guidance [9.898947423344884]
本稿では,DreamActor-M1 を用いた拡散トランスフォーマ (DiT) ベースのフレームワークを提案する。
動作誘導のために、暗黙の表情、3次元頭部球体、および3次元体骨格を統合したハイブリッド制御信号は、表情と身体運動の堅牢な制御を実現する。
実験により,本手法は,肖像画,上半身,全体生成の表現的結果を提示し,最先端の成果よりも優れることが示された。
論文 参考訳(メタデータ) (2025-04-02T13:30:32Z) - X-Dyna: Expressive Dynamic Human Image Animation [49.896933584815926]
X-Dynaは、単一の人間のイメージをアニメーションするための、ゼロショットで拡散ベースのパイプラインである。
対象と周辺環境の両方に対して現実的でコンテキスト対応のダイナミクスを生成する。
論文 参考訳(メタデータ) (2025-01-17T08:10:53Z) - Shape Conditioned Human Motion Generation with Diffusion Model [0.0]
本研究では,メッシュ形式での運動系列生成を可能にする形状条件付き運動拡散モデル(SMD)を提案する。
また、スペクトル領域内の時間的依存関係を活用するためのスペクトル・テンポラルオートエンコーダ(STAE)を提案する。
論文 参考訳(メタデータ) (2024-05-10T19:06:41Z) - FAAC: Facial Animation Generation with Anchor Frame and Conditional
Control for Superior Fidelity and Editability [14.896554342627551]
顔のアイデンティティと編集能力を両立させる顔アニメーション生成手法を提案する。
このアプローチは、オリジナルのテキスト・ツー・イメージモデルにおける生成能力の劣化に対処するためのアンカーフレームの概念を取り入れている。
提案手法の有効性をDreamBoothモデルとLoRAモデルで検証した。
論文 参考訳(メタデータ) (2023-12-06T02:55:35Z) - TapMo: Shape-aware Motion Generation of Skeleton-free Characters [64.83230289993145]
骨格のない3Dキャラクタの広帯域における動作のためのテキスト駆動アニメーションパイプラインであるTapMoを提案する。
TapMoはMesh Handle PredictorとShape-aware Diffusion Moduleの2つの主要コンポーネントで構成されている。
論文 参考訳(メタデータ) (2023-10-19T12:14:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。