LUNA: Learning Universal 3D Human Animation Beyond Skinning
Abstractの概要
本論文は、リニアブレンドスキニング(LBS)を回避し、多様な2D入力信号を直接標準3Dガウシアンアバターの変形にマッピングする、エンドツーエンドの3D人物アニメーションフレームワーク「LUNA」を提案する。この手法は、少数のアイデンティティ画像から標準ガウシアンを再構成し、グローバルな剛体運動とローカルな非剛体変形を分離するTransformerベースの暗黙的ニューラルアニメーターを使用する。2Dから3Dへの変換に伴う曖昧さに対処するため、学習スキームはフォトメトリックなレンダリング損失とLBS教師モデルからの蒸留を組み合わせ、ラベル付きデータと大規模なラベルなしのインザワイルド動画の両方をサポートする。写真のようなリアルさを維持しつつ、ポーズによるアーティファクトを減らし、画像、キーポイント、スケッチ、ドメイン外のキャラクターからのクロスアイデンティティおよびクロスモダリティアニメーションを可能にすることを目的として報告されている。
新規性
主な新規性は、明示的な身体フィッティングやパラメトリックなポーズ制御に依存せず、複数のモダリティにまたがる暗黙的な2D駆動をサポートする、LBSフリーのエンドツーエンド3Dアニメーションモデルを開発した点である。また、直接的な2Dから3Dへの変形マッピングを学習する一方で、LBSを柔らかな構造的制約としてのみ使用するハイブリッドな学習戦略を導入している。
成果
実験においてLUNAは、非剛体のCloth10Kベンチマークで比較手法を明白に上回り、PSNR 22.072、L1 0.027、LPIPS 0.131を達成しつつ、NeuManにおける強力なフィードフォワードのベースラインと同等の性能を維持した。また、時間的安定性を大幅に向上させ、最強のベースライン(MV-LHM)と比較してMSJの4.5倍の低減を達成するなど、MSJを0.0032、MAEを0.0225に減少させたと報告されている。NeuManでのクロスアイデンティティ駆動においては、自己再現に近い性能を保ち、比較手法の中で最も低い正規化2Dキーポイント誤差を達成した。
論文の注目点
- LUNAは、明示的な身体フィッティングや前処理を必要とせず、RGB画像、2Dキーポイント、スケッチ、未学習キャラクターの画像などの異種2D制御入力から標準3Dガウシアンを直接アニメーション化する。
- 提案アーキテクチャは、全体的な回転・移動と各ガウシアンの局所的な変形残差を分離し、関節の動きとゆったりとした衣服などの微細な非剛体効果の両方を捉えることを目的としている。
- 本提案のハイブリッドな学習手法は性能向上に重要であり、LBS指導による蒸留が幾何学的な崩壊を防ぎ、マルチビューの微調整が空間的なコンパクトさと視覚的品質を向上させることがアブレーションで示されている。