論文の概要: SubtleTalk: Generating Controllable Weakly-correlated Facial Dynamics for 3D Talking Heads via Residual Flow Matching
- arxiv url: http://arxiv.org/abs/2608.06408v1
- Date: Mon, 03 Aug 2026 11:28:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.239557
- Title: SubtleTalk: Generating Controllable Weakly-correlated Facial Dynamics for 3D Talking Heads via Residual Flow Matching
- Title(参考訳): SubtleTalk:残差フローマッチングによる3次元トーキングヘッドの制御可能な弱相関顔のダイナミクスの生成
- Abstract要約: 音声駆動型3D顔アニメーションは、現実的かつ時間的に整合した動きを音声から合成することを目的としている。
本稿では,自然かつ制御可能な顔のダイナミックスを生成するためのフレームワークであるSubtleTalkを提案する。
本手法は, 唇の正確な同期を保ちながら, 弱相関顔力学の現実性と多様性を著しく向上させる。
- 参考スコア(独自算出の注目度): 21.891013914273714
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-driven 3D facial animation aims to synthesize realistic and temporally coherent motions from speech. Despite notable progress in lip synchronization, weakly correlated dynamics, including eyebrow movements, eye blinks, and head motion, which are essential to photorealistic facial animation, remain difficult to model faithfully and often appear static or unnaturally repetitive. We attribute this limitation to three factors: (a) insufficient conditioning for weakly correlated dynamics; (b) the limited ability of deterministic regression to capture diverse motion patterns; (c) data bottlenecks from unreliable upper-face pseudo-labels and limited dataset diversity. To address these issues, we propose SubtleTalk, a framework for generating natural and controllable weakly correlated facial dynamics via multi-condition modeling and residual flow matching. First, to compensate for the limited guidance of speech alone, we introduce interpretable controls, including prosody, regional intensity, and Valence-Arousal signals, to explicitly capture the timing, magnitude, and affective variation of weakly correlated dynamics. Second, to overcome the limited expressiveness of deterministic regression, we build residual flow matching based on a stable speech-driven motion prior, allowing the model to capture stochastic deviations beyond deterministic prediction. Third, to alleviate the data bottleneck, we construct SubtleTalk-Face, a large-scale 3D facial animation dataset comprising about 3,900 identities and 74 hours of data, built via a simple and scalable pseudo-labeling pipeline and featuring improved upper-face tracking and frame-level VA annotations. Extensive experiments demonstrate that our method significantly improves the realism and diversity of weakly correlated facial dynamics while preserving accurate lip synchronization.
- Abstract(参考訳): 音声駆動型3D顔アニメーションは、現実的かつ時間的に整合した動きを音声から合成することを目的としている。
リップ同期の顕著な進歩にもかかわらず、フォトリアリスティックな顔のアニメーションに不可欠な眼球運動、点眼、頭部運動などの弱い相関ダイナミクスは、忠実にモデル化することは困難であり、静的または非自然に繰り返し現れることが多い。
我々はこの制限を3つの要因とみなす。
(a)弱相関力学の条件付け不足
b) 多様な動きパターンを捉えるための決定論的回帰の限られた能力
(c) 信頼できない上面の擬似ラベルと限られたデータセットの多様性によるデータのボトルネック。
これらの問題に対処するために,多条件モデリングと残流マッチングにより自然かつ制御可能な顔力学を生成するためのフレームワークであるSubtleTalkを提案する。
まず,音声の限られた指導を補うために,韻律,局所強度,ヴァレンス・オーラル信号などの解釈可能な制御を導入する。
第二に、決定論的回帰の限られた表現性を克服するため、安定な音声駆動動作に基づく残流マッチングを構築し、決定論的予測以上の確率的偏差を捉えることができる。
第三に、データのボトルネックを軽減するために、約3,900のアイデンティティと74時間のデータからなる大規模な3D顔アニメーションデータセットであるSubtleTalk-Faceを構築し、シンプルでスケーラブルな擬似ラベルパイプラインを使用して構築し、上面追跡とフレームレベルのVAアノテーションを改善した。
本手法は, 唇の正確な同期を保ちながら, 弱相関顔力学の現実性と多様性を著しく向上することを示した。
関連論文リスト
- Dynamic-Robust Photometric-Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding [63.599342750566485]
SPARは、潜在空間アグリゲーションの前に過渡的ダイナミックノイズを明示的に分離する新しい意味幾何学的エンコーディングアーキテクチャである。
エンド・ツー・エンドのアプローチは例外的な新規なビュー合成品質を実現し、PSNRは22.15dB、23.33dBでそれぞれ3と4の入力ビューしか与えられなかった。
論文 参考訳(メタデータ) (2026-08-29T09:58:24Z) - ECHO: Dyadic 3D Facial Motion Generation with Asymmetric Deterministic Articulation and Stochastic Reaction [12.994613743334218]
厳密なデュアルストリーム音声のみの設定下での3次元顔動作生成のためのECHOを提案する。
この非対称性に対処するため、ECHOは動きを決定論的アンカーに分解し、安定した音声関連構造をキャプチャする。
ECHOは、単一の生成プロセスにおいて、話し側の明瞭さとリスニング側のリアリズムと多様性のバランスをとる。
論文 参考訳(メタデータ) (2026-08-29T01:48:51Z) - EmoZone-Talker: Regional Semantic Control of Audio-Driven 3DGS Talking Heads via Facial Action Units [28.454399017725006]
EmoZone-Talkerは、音声による顔のアニメーションを構造化された時空間調整問題として再構成する新しいフレームワークである。
提案手法は,上面の精度と時間的コヒーレンスを顕著に向上させ,表現制御性とリアリズムを向上させる。
論文 参考訳(メタデータ) (2026-06-14T15:10:05Z) - HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching [113.81911881001905]
HO-Flowはテキストと正準3Dオブジェクトから現実的な手動動作シーケンスを合成するためのフレームワークである。
まず、手動と物体の動きのシーケンスを統一された潜在多様体に符号化するために、相互作用を意識した変分オートエンコーダを用いる。
次に、自己回帰的時間的推論と連続的な潜伏生成を組み合わせたマスク付きフローマッチングモデルを利用する。
論文 参考訳(メタデータ) (2026-04-12T22:06:11Z) - A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning [49.61652671596548]
「多像幻覚推論」では、前頭と時頭クエリ間の大規模なパフォーマンス低下は、真に理解するのではなく、表面的なショートカットへの依存を示す。
これを軽減するために、我々は、チェーンステップへの詳細な推論と決定的な判断に基づく、時間的連鎖構築という新しいデータセットを開発する。
実験により,本手法は精度を向上するだけでなく,70%以上から6.53%まで,前向きのパフォーマンスギャップも改善することが示された。
論文 参考訳(メタデータ) (2026-04-12T07:48:44Z) - GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization [5.5806589487812746]
GDPO-Listenerは高度に表現力のある発話・聴取動作生成を実現する新しいフレームワークである。
本稿では,安定した教師付き学習を可能にする自動回帰フローマッチングアーキテクチャを提案する。
異なるFLAMEパラメータ群間で報酬正規化を分離することにより、GDPOは高分散表現世代を明示的にインセンティブ化する。
論文 参考訳(メタデータ) (2026-03-26T04:36:27Z) - NarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Control [59.6128550986024]
ナラスコア(NarraScore)は、感情が物語論理の高密度圧縮として働くという中心的な洞察に基づく階層的なフレームワークである。
NarraScoreは、グローバルな構造とローカルなダイナミズムを調和させるために、Dual-Branch Injection戦略を採用している。
NarraScoreは、無視可能な計算オーバーヘッドを伴う最先端の一貫性と物語のアライメントを実現している。
論文 参考訳(メタデータ) (2026-02-09T09:39:42Z) - MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation [16.202732894319084]
MoDiT は 3D Morphable Model (3DMM) と Diffusion-based Transformer を組み合わせた新しいフレームワークである。
i) 時間的注意と偏りのある自己/横断的意識のメカニズムを改良した階層的認知戦略により, モデルによる唇同期の洗練が可能となった。
2) 空間的制約を明確化し, 正確な3次元インフォームド光流予測を実現するための3次元MM係数の統合。
論文 参考訳(メタデータ) (2025-07-07T15:13:46Z) - AsynFusion: Towards Asynchronous Latent Consistency Models for Decoupled Whole-Body Audio-Driven Avatars [71.90109867684025]
全体オーディオ駆動型アバターポーズと表現生成は、生命に似たデジタル人間を作るための重要なタスクである。
本稿では,拡散変換器を応用し,結合表現とジェスチャ合成を実現する新しいフレームワークAsynFusionを提案する。
AsynFusionは、リアルタイムで同期された全身アニメーションを生成する際に最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-21T03:28:53Z) - TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting [21.474938045227702]
本研究では,高忠実度音声ヘッド合成のための変形型放射場フレームワークであるTalkingGaussianを紹介する。
提案手法は, 従来の方法と比較して, 顔の忠実度と効率性を向上し, 高品質な唇同期音声ヘッドビデオを生成する。
論文 参考訳(メタデータ) (2024-04-23T17:55:07Z) - Consistency Guided Scene Flow Estimation [159.24395181068218]
CGSFは立体映像からの3次元シーン構造と動きの同時再構成のための自己教師型フレームワークである。
提案モデルでは,課題の画像の相違やシーンフローを確実に予測できることを示す。
最先端技術よりも優れた一般化を実現し、目に見えない領域に迅速かつ堅牢に適応する。
論文 参考訳(メタデータ) (2020-06-19T17:28:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。