論文の概要: GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting
- arxiv url: http://arxiv.org/abs/2607.00959v1
- Date: Wed, 01 Jul 2026 13:56:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.925019
- Title: GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting
- Title(参考訳): GaussianEmoTalker: 音声駆動型およびブレンドシェープ型3次元ガウススプラッティングによるリアルタイム感情対話ヘッド合成
- Abstract要約: 本稿では,3次元ガウススプラッティングに基づくリアルタイム音声音声合成のための音声駆動フレームワークを提案する。
GaussianEmoTalkerは、競争力のあるビデオ品質、正確な唇同期、制御可能な感情表現、リアルタイムレンダリングを実現する。
- 参考スコア(独自算出の注目度): 28.604834460278706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-driven talking head synthesis has achieved impressive progress in lip synchronization and visual quality, yet generating expressive emotional avatars with controllable intensity remains challenging, especially under real-time constraints. In this paper, we present GaussianEmoTalker, an audio-driven framework for real-time emotional talking head synthesis based on 3D Gaussian Splatting. Instead of directly predicting the final emotional avatar from speech, we formulate emotional animation as a neutral-to-emotional residual deformation problem. GaussianEmoTalker first constructs an identity-specific neutral talking space with GaussianBlendshapes, which provides high-fidelity Gaussian attributes and phoneme-synchronized neutral motion. It then predicts an emotion-conditioned residual deformation by combining mesh displacement cues, audio features, emotion categories, and intensity encodings. To fuse these heterogeneous signals, we introduce a spatial-audio-emotion attention module that estimates the offsets of Gaussian attributes for expressive and temporally stable rendering. Extensive experiments demonstrate that GaussianEmoTalker achieves competitive video quality, accurate lip synchronization, controllable emotional expression, and real-time rendering compared with recent emotional talking head methods. Our project page is available at https://njust-yang.github.io/GaussianEmoTalker.github.io/
- Abstract(参考訳): 音声駆動音声頭合成は、特にリアルタイムの制約下では、唇の同期と視覚的品質において顕著な進歩を遂げているが、制御可能な強度を持つ表現力のある感情的なアバターを生成することは困難である。
本稿では,3次元ガウシアンスプラッティングに基づくリアルタイムな感情対話ヘッド合成のための音声駆動フレームワークであるガウシアンEmoTalkerを提案する。
音声から最終的な感情的アバターを直接予測する代わりに、感情的アニメーションを中立-感情的残留変形問題として定式化する。
GaussianEmoTalkerはまず、高忠実度ガウス属性と音素同期中性運動を提供するGaussianBlendshapesを用いて、アイデンティティ固有の中性会話空間を構築する。
次に、メッシュ変位キュー、オーディオ特徴、感情カテゴリ、エンテンシティエンコーディングを組み合わせることで、感情条件の残留変形を予測する。
これらの異種信号を融合するために,表現的かつ時間的に安定なレンダリングのためのガウス属性のオフセットを推定する空間音響強調モジュールを導入する。
広汎な実験により、ガウスアン・エモTalkerは、近年の感情的会話ヘッド法と比較して、競争力のあるビデオ品質、正確な唇同期、制御可能な感情表現、リアルタイムレンダリングを実現している。
私たちのプロジェクトページはhttps://njust-yang.github.io/GaussianEmoTalker.github.io/で公開されています。
関連論文リスト
- EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization [12.013744751827426]
本稿では,Pretrain-and-Adaptパラダイムをベースとした,数発の感情認識型3D音声ヘッド合成フレームワークであるEmoTaGを紹介する。
我々の重要な洞察は、3Dガウスを直接変形するのではなく、構造化FLAMEパラメータ空間の運動予測を再構成することである。
そこで我々は,頭部ポーズと上面手がかりを補足しながら,音声から情緒的韻律を捉えたGated Residual Motion Network (GRMN)を提案する。
論文 参考訳(メタデータ) (2026-03-22T17:17:01Z) - EmoCAST: Emotional Talking Portrait via Emotive Text Description [56.42674612728354]
EmoCASTは、正確なテキスト駆動感情合成のための拡散ベースのフレームワークである。
外観モデリングでは、感情的なプロンプトはテキスト誘導の分離された感情的モジュールを通して統合される。
EmoCASTは、現実的で感情的に表現され、音声同期されたトーキーヘッドビデオを生成する、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-08-28T10:02:06Z) - MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding [48.54455964043634]
MEDTalkは、きめ細かなダイナミックな会話ヘッド生成のための新しいフレームワークである。
音声と音声のテキストを統合し、フレームワイドの強度変化を予測し、静的な感情特徴を動的に調整し、リアルな感情表現を生成する。
生成した結果は、産業生産パイプラインに便利に統合できます。
論文 参考訳(メタデータ) (2025-07-08T15:14:27Z) - EmoTalkingGaussian: Continuous Emotion-conditioned Talking Head Synthesis [4.895009594051343]
3Dガウススプラッティングに基づく音声ヘッドは,高忠実度画像をリアルタイムの推論速度でレンダリングする能力に注目されている。
そこで我々は, 唇型感情顔生成装置を提案し, エモガウスモデルの訓練に利用した。
我々はEmoGaussianを公開ビデオで実験し、画像品質の点で最先端技術よりも優れた結果を得た。
論文 参考訳(メタデータ) (2025-02-02T04:01:54Z) - GaussianSpeech: Audio-Driven Gaussian Avatars [76.10163891172192]
本稿では,3次元頭部アバターの高忠実度アニメーションシーケンスを音声音声から合成する手法であるGaussianSpeechを紹介する。
本稿では,表情に依存した色を生成するコンパクトで効率的な3DGSベースのアバター表現を提案する。
論文 参考訳(メタデータ) (2024-11-27T18:54:08Z) - EmoFace: Audio-driven Emotional 3D Face Animation [3.573880705052592]
EmoFaceは、鮮やかな感情的ダイナミクスを備えた顔アニメーションを作成するための、新しいオーディオ駆動の方法論である。
提案手法では,複数の感情で表情を生成でき,ランダムだが自然な点滅や眼球運動を生成できる。
提案手法は、ビデオゲームでプレイ不可能なキャラクターの対話アニメーションを作成し、バーチャルリアリティ環境でアバターを駆動するのに有効である。
論文 参考訳(メタデータ) (2024-07-17T11:32:16Z) - EmoSpeaker: One-shot Fine-grained Emotion-Controlled Talking Face
Generation [34.5592743467339]
微粒な顔のアニメーションを生成する視覚属性誘導型オーディオデカップラを提案する。
より正確な感情表現を実現するために,よりきめ細かな感情係数予測モジュールを導入する。
提案手法であるEmoSpeakerは,表情の変動や唇の同期の点で,既存の感情音声生成法よりも優れていた。
論文 参考訳(メタデータ) (2024-02-02T14:04:18Z) - GMTalker: Gaussian Mixture-based Audio-Driven Emotional Talking Video Portraits [60.05683966405544]
GMTalkerはガウスの混合合成による感情的な音声画像生成フレームワークである。
具体的には,よりフレキシブルな感情操作を実現するために,連続的かつ不整合な潜在空間を提案する。
また,多種多様な頭部ポーズ,瞬き,眼球運動を生成するために,大規模データセット上で事前訓練された正規化フローベースモーションジェネレータを導入する。
論文 参考訳(メタデータ) (2023-12-12T19:03:04Z) - Emotional Speech-Driven Animation with Content-Emotion Disentanglement [51.34635009347183]
本研究では,感情表現の明示的な制御を可能にしつつ,音声からリップシンクを維持する3次元音声アバターを生成するEMOTEを提案する。
EmOTEは、同じデータでトレーニングされた最先端の方法よりも、リップシンクで音声駆動の顔アニメーションを生成する。
論文 参考訳(メタデータ) (2023-06-15T09:31:31Z) - DFA-NeRF: Personalized Talking Head Generation via Disentangled Face
Attributes Neural Rendering [69.9557427451339]
本稿では,高忠実度音声ヘッド生成のためのニューラルラジアンス場に基づくフレームワークを提案する。
具体的には、神経放射野は唇運動の特徴とパーソナライズされた属性を2つの不絡状態として捉えている。
本手法は最先端の手法よりもはるかに優れた結果が得られることを示す。
論文 参考訳(メタデータ) (2022-01-03T18:23:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。