論文の概要: Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation
- arxiv url: http://arxiv.org/abs/2608.00663v1
- Date: Sat, 01 Aug 2026 13:33:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.851637
- Title: Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation
- Title(参考訳): 幾何誘導型感情変調による制御可能・光リアルな会話顔生成
- Abstract要約: GemTalkは、暗黙の表現の意味的な豊かさと明示的な幾何学的事前の構造的精度を組み合わせた拡散ベースのフレームワークである。
視覚誘導型音声感情投影(V-AEP)モジュールを導入し、暗黙の感情的な唇と表情の特徴を抽出する。
同時に、拡散に基づく幾何優先発生器(D-GPG)は、明示的な構造的先行係数としてアイデンティティ認識ブレンド係数を生成する。
- 参考スコア(独自算出の注目度): 47.04292510603205
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Audio-driven emotional talking face generation aims to synthesize realistic videos with expressive facial dynamics. However, existing methods struggle to balance controllability and visual fidelity. Although implicit representations capture rich semantics, they lack structural guidance, often resulting in averaged emotional expressions. In contrast, explicit geometric methods offer better control over facial expressions but tend to sacrifice high-frequency texture details. To address it, we propose GemTalk, a diffusion-based framework that combines the semantic richness of implicit representations with the structural precision of explicit geometric priors. We introduce a Vision-guided Audio Emotion Projection (V-AEP) module to extract implicit emotional lip and expression features. At the same time, a Diffusion-based Geometric Priors Generator (D-GPG) generates identity-aware blendshape coefficients as explicit structural priors. Crucially, our Geometry-guided Emotion Modulation (GEM) module leverages these geometric priors to recalibrate the magnitude of implicit features, enabling precise, continuous control over emotional expressions, especially emotion intensity, without sacrificing visual quality. Extensive experiments show GemTalk achieves superior performance in photo-realism, and facial emotional dynamics.
- Abstract(参考訳): 音声による感情的な会話顔生成は、表情のダイナミックスでリアルなビデオを合成することを目的としている。
しかし、既存の手法は制御性と視覚的忠実さのバランスをとるのに苦労している。
暗黙的な表現は豊かな意味論を捉えるが、構造的なガイダンスが欠如しており、しばしば平均的な感情表現をもたらす。
対照的に、明示的な幾何学的手法は表情をよりよく制御するが、高周波テクスチャの詳細を犠牲にする傾向がある。
そこで我々は,暗黙表現の意味的豊かさと明示的幾何学的先行表現の構造的精度を組み合わせた拡散に基づくフレームワークGemTalkを提案する。
視覚誘導型音声感情投影(V-AEP)モジュールを導入し、暗黙の感情的な唇と表情の特徴を抽出する。
同時に、拡散に基づく幾何優先発生器(D-GPG)は、明示的な構造的先行因子としてアイデンティティを意識したブレンドシェイプ係数を生成する。
重要なことは、Geometry-Guided Emotion Modulation (GEM)モジュールは、これらの幾何学的事前情報を利用して暗黙的な特徴の規模を調整し、視覚的品質を犠牲にすることなく、感情表現、特に感情の強さを正確に連続的に制御することができる。
大規模な実験により、GemTalkはフォトリアリズムや顔の感情的ダイナミクスにおいて優れたパフォーマンスを発揮することが示された。
関連論文リスト
- SEDTalker: Emotion-Aware 3D Facial Animation Using Frame-Level Speech Emotion Diarization [14.632533340477591]
SEDTalkerは、音声駆動型3D顔アニメーションのための感情認識フレームワークである。
フレームレベルの音声感情ダイアリゼーションを用いて、きめ細かい表現制御を実現する。
論文 参考訳(メタデータ) (2026-04-14T22:55:09Z) - Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video [17.472242712450473]
C-MET(Cross-Modal Emotion Transfer)は、音声に基づく表情を生成する新しい手法である。
本手法は,最先端手法よりも感情の精度を14%向上させる。
論文 参考訳(メタデータ) (2026-04-09T04:28:03Z) - EmoCAST: Emotional Talking Portrait via Emotive Text Description [56.42674612728354]
EmoCASTは、正確なテキスト駆動感情合成のための拡散ベースのフレームワークである。
外観モデリングでは、感情的なプロンプトはテキスト誘導の分離された感情的モジュールを通して統合される。
EmoCASTは、現実的で感情的に表現され、音声同期されたトーキーヘッドビデオを生成する、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-08-28T10:02:06Z) - Taming Transformer for Emotion-Controllable Talking Face Generation [61.835295250047196]
本稿では,感情制御可能な発話顔生成タスクを個別に行うための新しい手法を提案する。
具体的には、2つの事前学習戦略を用いて、音声を独立したコンポーネントに分解し、映像を視覚トークンの組み合わせに定量化する。
我々は、複数の感情的オーディオで調整された映像の感情を制御するMEADデータセット上で実験を行う。
論文 参考訳(メタデータ) (2025-08-20T02:16:52Z) - Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation [7.362433184546492]
コンピュータビジョンとマルチモーダル人工知能の交差点における重要な研究領域として、感情的トーキー生成が出現している。
本研究では,2つの課題に対処するThink-Before-Drawフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-17T03:33:46Z) - MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding [48.54455964043634]
MEDTalkは、きめ細かなダイナミックな会話ヘッド生成のための新しいフレームワークである。
音声と音声のテキストを統合し、フレームワイドの強度変化を予測し、静的な感情特徴を動的に調整し、リアルな感情表現を生成する。
生成した結果は、産業生産パイプラインに便利に統合できます。
論文 参考訳(メタデータ) (2025-07-08T15:14:27Z) - Disentangle Identity, Cooperate Emotion: Correlation-Aware Emotional Talking Portrait Generation [63.94836524433559]
DICE-Talkは、感情と同一性を切り離し、類似した特徴を持つ感情を協調するフレームワークである。
我々は、モーダル・アテンションを通して、音声と視覚の感情の手がかりを共同でモデル化するアンタングル型感情埋め込み装置を開発した。
次に,学習可能な感情バンクを用いた相関強化感情調和モジュールを提案する。
第3に、拡散過程における感情の一貫性を強制する感情識別目標を設計する。
論文 参考訳(メタデータ) (2025-04-25T05:28:21Z) - DREAM-Talk: Diffusion-based Realistic Emotional Audio-driven Method for
Single Image Talking Face Generation [75.90730434449874]
DREAM-Talkは2段階の拡散に基づく音声駆動フレームワークで,多彩な表現と正確な唇同期の同時生成に適したフレームワークである。
唇の動きと音声との強い相関を考慮し、音声特徴と感情スタイルを用いて、唇同期精度を向上して力学を洗練する。
定量的かつ質的にも、DREAM-Talkは表現性、リップシンクの精度、知覚品質の点で最先端の手法より優れている。
論文 参考訳(メタデータ) (2023-12-21T05:03:18Z) - High-fidelity Generalized Emotional Talking Face Generation with
Multi-modal Emotion Space Learning [43.09015109281053]
よりフレキシブルで汎用的な顔生成フレームワークを提案する。
具体的には、テキストプロンプトで感情スタイルを補完し、テキスト、画像、音声の感情のモダリティを統一された空間に埋め込むためにアラインド・マルチモーダル・感情エンコーダを使用する。
感情条件と音声シーケンスを構造表現に接続する感情認識型オーディオ-to-3DMM変換器を提案する。
論文 参考訳(メタデータ) (2023-05-04T05:59:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。