論文の概要: LUNA: Learning Universal 3D Human Animation Beyond Skinning
- arxiv url: http://arxiv.org/abs/2606.31981v1
- Date: Tue, 30 Jun 2026 17:19:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.325075
- Title: LUNA: Learning Universal 3D Human Animation Beyond Skinning
- Title(参考訳): LUNA:ユニバーサルな3Dアニメーションをスキンで学べる
- Authors: Peng Li, Rawal Khirodkar, Junxuan Li, Yuan Dong, Chen Cao, Yuan Liu, Wenhan Luo, Yike Guo, Shunsuke Saito,
- Abstract要約: LUNAは,画像,キーポイント,スケッチ,未知文字などの複数の2次元制御を3次元ガウス変形にマッピングする,普遍的なニューラルアニメーションモデルである。
実験により、LUNAはLBSベースのアプローチと比較して、光現実的な競合的な視覚的忠実性を達成することが示された。
我々の知る限りでは、LUNAは暗黙の2D駆動をサポートする最初のエンドツーエンドの3Dアニマタブルモデルである。
- 参考スコア(独自算出の注目度): 67.77753663598081
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Creating photorealistic, animatable 3D human avatars from monocular images still largely depends on Linear Blend Skinning (LBS) and parametric body models, which constrain expressivity and often introduce artifacts due to imperfect fitting. We propose LUNA, an LBS-free universal neural animation model that directly maps multiple 2D controls like images, keypoints, sketches, and unseen characters into 3D Gaussian deformations, bypassing explicit body fitting. At its core, a transformer-based motion regressor disentangles global rigid motion from fine-grained local dynamics to capture both coherent movement and subtle non-rigid effects. To resolve the inherent ambiguity of 2D-to-3D lifting while scaling beyond fitted datasets, we introduce hybrid supervision that distills soft structural priors from an LBS teacher and a loss that supports training on both limited fitted data and large in-the-wild unlabeled videos. Extensive experiments show LUNA achieves competitive visual fidelity compared to LBS-based approaches, while delivering realistic human motion and zero-shot cross-identity generalization across diverse driving modalities. To the best of our knowledge, LUNA is the first end-to-end 3D animatable model that supports implicit 2D driving.
- Abstract(参考訳): 光写実的でアニマタブルな3Dアバターをモノクロ画像から作成するには、リニアブレンドスキニング(LBS)とパラメトリックボディモデルに大きく依存する。
画像,キーポイント,スケッチ,未確認文字などの複数の2次元制御を直接3次元ガウス変形にマッピングし,明示的なボディーフィッティングを回避できるLBSフリーユニバーサルニューラルアニメーションモデルLUNAを提案する。
その中心となるのは、変圧器をベースとしたモーションレグレクタで、局所的な微細な力学から地球規模の剛体運動を解き放ち、コヒーレントな動きと微妙な非剛体効果の両方を捉える。
そこで本研究では,LBS教師からソフトな構造的先行性を抽出するハイブリッド・インスペクティブを導入するとともに,限定された装着データと大容量未ラベルビデオの両方のトレーニングを支援する損失を解消する。
広汎な実験により、LUNAはLBSベースのアプローチと比較して、競争力のある視覚的忠実性を達成する一方で、現実的な人間の動きとゼロショットのクロスアイデンティティの一般化を様々な駆動モードで実現している。
我々の知る限りでは、LUNAは暗黙の2D駆動をサポートする最初のエンドツーエンドの3Dアニマタブルモデルである。
関連論文リスト
- Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining [49.223455189395025]
Mocap-2-to-3は単分子入力からマルチビューリフトを実行する新しいフレームワークである。
豊富な2次元データを活用するため、複雑な3次元運動を多視点合成に分解する。
本手法は,カメラ空間のモーションリアリズムと世界空間の人間の位置決めの両面において,最先端のアプローチを超越した手法である。
論文 参考訳(メタデータ) (2025-03-05T06:32:49Z) - Lifting Motion to the 3D World via 2D Diffusion [19.64801640086107]
トレーニング用に2次元ポーズシーケンスのみを用いてグローバルな3次元動作を予測する新しいアプローチであるMVLiftを紹介する。
MVLiftは、人間のポーズ、人間とオブジェクトの相互作用、動物のポーズなど、さまざまな領域を一般化する。
論文 参考訳(メタデータ) (2024-11-27T23:26:56Z) - PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm [111.16358607889609]
本稿では,効率的な3D表現の獲得を容易にするために,新しいユニバーサル3D事前学習フレームワークを提案する。
PonderV2は、11の室内および屋外ベンチマークで最先端のパフォーマンスを達成したことで、その効果が示唆された。
論文 参考訳(メタデータ) (2023-10-12T17:59:57Z) - MoDA: Modeling Deformable 3D Objects from Casual Videos [84.29654142118018]
神経二元四元系ブレンドスキンニング(NeuDBS)を提案し,スキンを折り畳むことなく3次元点変形を実現する。
異なるフレーム間で2Dピクセルを登録する試みにおいて、標準空間内の3D点を符号化する標準特徴埋め込みの対応性を確立する。
本手法は,ヒトと動物の3Dモデルを,最先端の手法よりも質的,定量的な性能で再構築することができる。
論文 参考訳(メタデータ) (2023-04-17T13:49:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。