論文の概要: FaceSnap: Real-Time Personalized Lightstage Facial Performance Capture
- arxiv url: http://arxiv.org/abs/2608.31033v1
- Date: Mon, 31 Aug 2026 16:14:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.500685
- Title: FaceSnap: Real-Time Personalized Lightstage Facial Performance Capture
- Title(参考訳): FaceSnap: リアルタイムのパーソナライズされたライトステージの顔パフォーマンスキャプチャ
- Abstract要約: FaceSnapは2段階のアプローチでキャプチャを合理化するエンドツーエンドフレームワークである。
まず、移動範囲列からの1回のマルチビュー最適化により、幾何学と表現に依存した外観の両方を符号化したパーソナライズされたモデルを構築する。
このモデルは、単一の単眼の光ステージカメラから高忠実でリアルタイムな顔のパフォーマンスキャプチャを可能にする。
- 参考スコア(独自算出の注目度): 46.62583529452031
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Lightstage facial capture produces production-quality digital humans, but it is resource and labor-intensive. Multi-camera setups, hours of computation, and massive data storage create bottlenecks that hinder iterative workflows. This paper introduces FaceSnap, an end-to-end framework that streamlines capture via a two-stage approach. First, a one-time multi-view optimization from a range-of-motion sequence builds a personalized model encoding both geometry and expression-dependent appearance. This model then enables high-fidelity real-time facial performance capture from a single monocular lightstage camera, with no further multi-view capture required. FaceSnap jointly estimates geometry and dynamic 4K texture at 83 fps. The 4K texture is produced by a novel personalized residual upscaler that recovers subject-specific high-frequency detail, which generic upscalers fail to capture. FaceSnap achieves geometric accuracy competitive with full per-frame multi-view optimization while outperforming feed-forward methods trained on production-quality 3D data, all from a single camera view. Finally, we introduce Multi4D, a public benchmark for evaluating 4D facial reconstruction methods in lightstage environments, enabling topology-invariant geometric comparison across methods.
- Abstract(参考訳): 光ステージ顔認証は、生産品質の高いデジタル人間を生産するが、資源と労働集約性がある。
マルチカメラのセットアップ、計算時間、巨大なデータストレージは、反復的なワークフローを妨げるボトルネックを生み出します。
本稿では,2段階アプローチによるキャプチャの合理化を目的としたエンドツーエンドフレームワークであるFaceSnapを紹介する。
まず、移動範囲列からの1回のマルチビュー最適化により、幾何学と表現に依存した外観の両方を符号化したパーソナライズされたモデルを構築する。
このモデルにより、単一の単眼の光ステージカメラから高忠実でリアルタイムな顔のパフォーマンスをキャプチャできるが、それ以上のマルチビューキャプチャは不要である。
FaceSnapは83fpsで幾何学と動的4Kテクスチャを共同で推定する。
4Kテクスチャは、パーソナライズされたパーソナライズされたリザーブ・アップスケーラによって生成される。
FaceSnapは、単一のカメラビューから、プロダクション品質の3Dデータに基づいてトレーニングされたフィードフォワードメソッドよりも優れたパフォーマンスを保ちながら、フレーム毎のマルチビュー最適化と幾何的精度で競合する。
最後に,光ステージ環境における4次元顔の再構成手法を評価するための公開ベンチマークであるMulti4Dを導入し,手法間のトポロジ不変な幾何学的比較を可能にする。
関連論文リスト
- Full-4D: Generating Full-Scope 4D Scenes from a Single-View Video [63.61099683012546]
本稿では,同期マルチビュービデオのデータセットであるRealMV-4Dを紹介する。
次に、新しい融合時間(T)-ビュー(V)アテンション機構によって駆動される多視点ビデオ拡散モデルを訓練する。
実験により,本手法は視覚的忠実度と一貫性の両方において既存手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-05-25T06:59:26Z) - Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models [79.06910348413861]
Diff4Splatは、単一の画像から制御可能で明示的な4Dシーンを合成するフィードフォワード方式である。
単一の入力画像、カメラ軌跡、オプションのテキストプロンプトが与えられた場合、Diff4Splatは外見、幾何学、動きを符号化する変形可能な3Dガウス場を直接予測する。
論文 参考訳(メタデータ) (2025-11-01T11:16:25Z) - ShapeGen4D: Towards High Quality 4D Shape Generation from Videos [85.45517487721257]
ビデオからエンドツーエンドに1つの動的3次元表現を合成する,ネイティブなビデオから4次元の形状生成フレームワークを提案する。
本手法は,フレームごとの最適化を行なわずに,非剛性運動,体積変化,および位相遷移を正確にキャプチャする。
論文 参考訳(メタデータ) (2025-10-07T17:58:11Z) - 4D Driving Scene Generation With Stereo Forcing [62.47705572424127]
現在の生成モデルは、時間外挿と空間的新規ビュー合成(NVS)をシーンごとの最適化なしで同時にサポートする動的4D駆動シーンの合成に苦慮している。
PhiGenesisは、幾何学的・時間的整合性を持った映像生成技術を拡張する4次元シーン生成のための統合フレームワークである。
論文 参考訳(メタデータ) (2025-09-24T15:37:17Z) - Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation [3.1852855132066673]
現在のアプローチは、複雑なシーンダイナミクスを処理しながら、ビューの一貫性を維持するのに苦労することが多い。
このフレームワークは、リッチな時間的先行ビデオ拡散モデルと、再構成モデルの幾何学的認識の両方を活用する最初のものである。
これは4D生成を著しく促進し、既存の方法よりも高い品質(mPSNR、mSSIMなど)を示す。
論文 参考訳(メタデータ) (2025-08-11T08:55:47Z) - EX-4D: EXtreme Viewpoint 4D Video Synthesis via Depth Watertight Mesh [7.730901815595691]
EX-4DはDepth Watertight Mesh表現を通じてこれらの課題に対処する新しいフレームワークである。
この表現は、可視領域と隠蔽領域の両方を明示的にモデル化することで、頑健な幾何学的先行として機能する。
軽量なLoRAベースのビデオ拡散アダプタを用いて、高品質で物理的に整合性があり、時間的に整合した映像を合成する。
論文 参考訳(メタデータ) (2025-06-05T20:02:05Z) - DeepMultiCap: Performance Capture of Multiple Characters Using Sparse
Multiview Cameras [63.186486240525554]
deep multicapは、スパースマルチビューカメラを用いたマルチパーソンパフォーマンスキャプチャのための新しい手法である。
本手法では,事前走査型テンプレートモデルを用いることなく,時間変化した表面の詳細をキャプチャできる。
論文 参考訳(メタデータ) (2021-05-01T14:32:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。