RASA: Disentangled Spatial-Motional Priors for Cross-Identity Character Animation
Abstractの概要
本論文では、参照画像がターゲットの同一性を提供し、駆動動画がモーションを提供する、位置やスケール、骨格比率の困難な不一致が存在するクロスアイデンティティなキャラクターアニメーションを研究しています。著者らは、Spatial Prior Calibrator (SPC) と Inherent Motional Guider (IMG) という2つのモジュールを通じて空間アライメントとモーション制御を明示的に分離する、Diffusion TransformerベースのフレームワークであるRASAを提案しています。SPCは開始時およびデノイジング全体を通じて駆動ポーズを参照構造にアライメントし、IMGは形状に依存しないSMPLの関節運動特徴を中間Transformer層に注入して解剖学的および視点の一貫性があるモーションを向上させます。また、本論文は現実的なクロスアイデンティティの構造的ズレを評価するために手動で選別されたベンチマークであるCIM-Benchも導入しています。TikTokおよびCIM-Benchでの実験により、従来のアニメーション手法と比較して視覚的品質、同一性の保持、および堅牢性の向上が示されています。
新規性
主な新規性は、ポーズ条件付けを単一の交絡した信号として扱うのではなく、クロスアイデンティティアニメーションのためのDiffusion Transformer内で空間キャリブレーションとモーション誘導を明示的に分離した点にあります。また、アイデンティティ間での現実的な構造的ズレに焦点を当てたベンチマークであるCIM-Benchを導入した点も特徴的です。
成果
TikTokにおいて、RASAは本論文の比較表内でPSNR 22.03、SSIM 0.830、LPIPS 0.189、FID 18.93など最良の画像レベル指標を達成しつつ、動画指標でも競争力を維持しています。より困難なCIM-Benchでは、FVD 667.96、FID-VID 17.63、Sim-Arc 0.72、Face-FID 90.63を達成するなど、画像、動画、同一性の各指標で記載されたベースラインを上回っています。さらにアブレーション実験により、SPCとIMGの組み合わせが単独のコンポーネントを超えて時間的一貫性とモーション品質を向上させることが示されています。
論文の注目点
- RASAは、連続的な2D構造キャリブレーションのためのSPCと、同一性に依存しない3Dモーション意味論のためのIMGというデュアル事前知識設計を採用している。
- 著者らは、656本の厳選されたキャラクター動画を用い、現実的なポーズと参照のズレの下でクロスアイデンティティアニメーションを評価するCIM-Benchを構築した。
- 定量的結果およびアブレーション結果は、空間アライメントをモーション制御から分離することで、堅牢性、同一性の一貫性、時間的コヒーレンスが向上することを裏付けている。