論文の概要: PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing
- arxiv url: http://arxiv.org/abs/2603.19731v1
- Date: Fri, 20 Mar 2026 08:14:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.048564
- Title: PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing
- Title(参考訳): PerformRecast: ポートレートビデオ編集のための表現と頭部のゆがみ
- Authors: Jiadong Liang, Bojun Xiong, Jie Tian, Hua Li, Xiao Long, Yong Zheng, Huan Fu,
- Abstract要約: 本稿では主に,運転映像に基づく表情のみのポートレート・ビデオ・パフォーマンス編集の課題について考察する。
本稿では,既存の映画やアニメーションの演出をリキャストする多目的な表現専用ビデオ編集手法PerformRecastを提案する。
本手法は,運転映像に忠実な高品質な結果が得られ,制御性と効率性の両方において既存手法よりも優れていた。
- 参考スコア(独自算出の注目度): 13.257954925321835
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper primarily investigates the task of expression-only portrait video performance editing based on a driving video, which plays a crucial role in animation and film industries. Most existing research mainly focuses on portrait animation, which aims to animate a static portrait image according to the facial motion from the driving video. As a consequence, it remains challenging for them to disentangle the facial expression from head pose rotation and thus lack the ability to edit facial expression independently. In this paper, we propose PerformRecast, a versatile expression-only video editing method which is dedicated to recast the performance in existing film and animation. The key insight of our method comes from the characteristics of 3D Morphable Face Model (3DMM), which models the face identity, facial expression and head pose of 3D face mesh with separate parameters. Therefore, we improve the keypoints transformation formula in previous methods to make it more consistent with 3DMM model, which achieves a better disentanglement and provides users with much more fine-grained control. Furthermore, to avoid the misalignment around the boundary of face in generated results, we decouple the facial and non-facial regions of input portrait images and pre-train a teacher model to provide separate supervision for them. Extensive experiments show that our method produces high-quality results which are more faithful to the driving video, outperforming existing methods in both controllability and efficiency. Our code, data and trained models are available at https://youku-aigc.github.io/PerformRecast.
- Abstract(参考訳): 本稿では主に,アニメーションや映画産業において重要な役割を担っているドライビングビデオに基づく表情のみのポートレート・ビデオ・パフォーマンス・編集の課題について考察する。
既存の研究は主に肖像画のアニメーションに焦点を当てており、運転映像の顔の動きに応じて静的な肖像画をアニメーション化することを目的としている。
結果として、顔表情を頭部のポーズ回転から切り離すことは困難であり、顔表情を独立して編集する能力が欠如している。
本稿では,既存の映画やアニメーションの演出をリキャストする多目的な表現専用ビデオ編集手法PerformRecastを提案する。
本手法の主な知見は,顔の同一性,表情,頭部のポーズをパラメータ別にモデル化した3Dモーフブル顔モデル(3DMM)の特徴である。
そこで,従来手法のキーポイント変換式を改良して3DMMモデルとの整合性を高めた。
さらに,入力された肖像画の顔領域と非顔領域を分離し,教師モデルの事前訓練を行い,教師の指導を行う。
実験結果から,本手法は運転映像に忠実な高品質な結果が得られ,制御性と効率性の両方において既存手法よりも優れていたことが示唆された。
私たちのコード、データ、トレーニングされたモデルはhttps://youku-aigc.github.io/PerformRecast.comで利用可能です。
関連論文リスト
- FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint [49.80464592726769]
本研究では,映像拡散方式であるFacterPortraitを紹介する。
本手法は,運転映像から顔の表情や頭部の動きを移動させることにより,像を識別する。
提案手法は, 現実主義, 表現性, 制御精度, 視点整合性において, 既存の手法よりも優れる。
論文 参考訳(メタデータ) (2025-12-12T15:22:52Z) - DirectSwap: Mask-Free Cross-Identity Training and Benchmarking for Expression-Consistent Video Head Swapping [58.2549561389375]
ビデオヘッドスワップは、顔のアイデンティティ、頭の形、ヘアスタイルなど、ビデオ対象の頭部全体を参照画像に置き換えることを目的としている。
地対交換データがないため、従来の手法はビデオ内の同一人物のクロスフレームペアをトレーニングする。
我々は、画像U-Netをビデオ拡散モデルに拡張する、マスクのない直接ビデオヘッドスワッピングフレームワークであるDirectSwapを提案する。
論文 参考訳(メタデータ) (2025-12-10T08:31:28Z) - JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation [10.003794924759765]
JoyVASAは、音声駆動型顔アニメーションにおける顔の動きと頭部の動きを生成する拡散法である。
本研究では,静的な3次元顔表現から動的表情を分離する分離された顔表現フレームワークを提案する。
第2段階では、拡散変圧器を訓練し、文字の同一性によらず、オーディオキューから直接動作シーケンスを生成する。
論文 参考訳(メタデータ) (2024-11-14T06:13:05Z) - GaussianHeads: End-to-End Learning of Drivable Gaussian Head Avatars from Coarse-to-fine Representations [54.94362657501809]
マルチビュー画像から高ダイナミックで変形可能な人間の頭部アバターをリアルタイムで生成する手法を提案する。
本手法のコアとなるのは,顔表情と頭部運動の複雑なダイナミクスを捉えることができる頭部モデルの階層的表現である。
我々は、この粗い顔アバターモデルを、エンドツーエンドのフレームワークで学習可能なパラメータとして頭部ポーズとともに訓練する。
論文 参考訳(メタデータ) (2024-09-18T13:05:43Z) - Controllable Dynamic Appearance for Neural 3D Portraits [54.29179484318194]
実環境下での3D画像の完全制御を可能にするシステムであるCoDyNeRFを提案する。
CoDyNeRFは、動的外観モデルを通して照明依存効果を近似することを学ぶ。
本手法が明示的な頭部ポーズと表情制御を備えたポートレートシーンのフリービュー合成に有効であることを示す。
論文 参考訳(メタデータ) (2023-09-20T02:24:40Z) - AniPortraitGAN: Animatable 3D Portrait Generation from 2D Image
Collections [78.81539337399391]
顔の表情, 頭部ポーズ, 肩の動きを制御可能なポートレート画像を生成するアニマタブルな3D認識型GANを提案する。
これは、3Dやビデオデータを使用しない非構造化2次元画像コレクションで訓練された生成モデルである。
生成した顔の質を向上させるために,デュアルカメラレンダリングと対角学習方式を提案する。
論文 参考訳(メタデータ) (2023-09-05T12:44:57Z) - PIRenderer: Controllable Portrait Image Generation via Semantic Neural
Rendering [56.762094966235566]
ポートレート画像ニューラルレンダは、3次元の変形可能な顔モデルのパラメータで顔の動きを制御するために提案される。
提案モデルでは直感的な修正によって正確な動きで写真リアルなポートレート画像を生成することができる。
本モデルでは、単一の参照画像と駆動音声ストリームのみから、説得力のある動きでコヒーレントな動画を生成することができる。
論文 参考訳(メタデータ) (2021-09-17T07:24:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。