論文の概要: PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads
- arxiv url: http://arxiv.org/abs/2608.05218v1
- Date: Wed, 05 Aug 2026 10:31:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.74871
- Title: PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads
- Title(参考訳): PD-GS:音素駆動型音声通話用3DGS
- Abstract要約: 3D Gaussian Splatting (3DGS)は、高速でリアルなトーキングヘッドレンダリングを可能にする。
textbfPhoneme-Driven Gaussian Splatting (PD-GS) を提案する。
PD-GSは、画像再構成と唇のランドマーク監督を用いて、単眼ビデオから純粋に訓練されている。
- 参考スコア(独自算出の注目度): 4.214609374419344
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: 3D Gaussian Splatting (3DGS) enables fast, photorealistic talking-head rendering, yet accurate lip articulation remains elusive: mouth motion is often over-smoothed and may violate hard articulatory constraints such as bilabial closures, producing the notorious ``leaky mouth'' artifact. A key difficulty is that brief, discrete articulatory events are inferred from a continuous acoustic embedding under a regression objective, which biases predictions toward averaged mouth configurations. While modern self-supervised speech encoders provide rich prosodic and phonetic cues, they do not provide an explicit, frame-aligned linguistic target that reliably disambiguates closure-level events. We propose \textbf{Phoneme-Driven Gaussian Splatting (PD-GS)}, which augments a 3DGS talker with time-aligned phoneme tokens obtained from an automatic ASR and forced-alignment pipeline. Our core component, the \textbf{Linguistic Fusion Module (LFM)}, adaptively fuses continuous audio context with discrete phoneme embeddings through a learned gate, allowing the model to preserve smooth audio-driven dynamics while strengthening phoneme guidance on articulation-critical segments. PD-GS is trained purely from monocular video using image reconstruction and lip landmark supervision. On HDTF, PD-GS achieves the best lip geometry among the compared baselines (LMD 2.66) and qualitatively reduces closure violations in challenging phoneme sequences, yielding more linguistically faithful neural avatars.
- Abstract(参考訳): 3D Gaussian Splatting (3DGS) は、高速でフォトリアリスティックなトーキーヘッドレンダリングを可能にするが、正確な唇調音は未解決のままである。
重要な課題は、回帰目標の下で連続的な音響埋め込みから短い離散的な調音イベントが推定され、平均的な口構成に対する予測に偏りが生じることである。
現代の自己教師型音声エンコーダは豊かな韻律的・音声的手がかりを提供するが、閉鎖レベルの事象を確実に曖昧にする明示的でフレームに整合した言語的ターゲットは提供しない。
本稿では,自動ASRと強制アライメントパイプラインから得られるタイムアライメントな音素トークンを3DGSトーカに付加する「textbf{Phoneme-Driven Gaussian Splatting (PD-GS) 」を提案する。
我々の中心となるコンポーネントであるLFM(textbf{Linguistic Fusion Module)は、学習ゲートを介して個別の音素埋め込みと連続的な音素コンテキストを適応的に融合し、音素クリティカルセグメントの音素ガイダンスを強化しつつ、滑らかな音素駆動のダイナミクスを保たせる。
PD-GSは、画像再構成と唇のランドマーク監督を用いて、単眼ビデオから純粋に訓練されている。
HDTFでは、PD-GSは比較ベースライン(LMD 2.66)の中で最高の唇形状を達成し、挑戦的な音素配列におけるクロージャ違反を質的に低減し、より言語的に忠実なニューラルアバターを生み出す。
関連論文リスト
- Arti-JEPA: Adapting Video World Model to Real-Time MRI of the Vocal Tract for Speech-Production Analysis [37.674716609612325]
リアルタイムMRI (Real-time MRI) は音声中の声道全体の動態を捉える。
本稿では,声道rtMRIをモデル化するための組込み予測アーキテクチャであるArti-JEPAを紹介する。
論文 参考訳(メタデータ) (2026-09-09T05:58:40Z) - Toward Fine-Grained Facial Control in 3D Talking Head Generation [47.03887859473704]
Fine-Grained 3D Gaussian Splattingは、時間的に一貫した高忠実なヘッド生成を可能にする新しいフレームワークである。
提案手法は,高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細・高精細な音声
論文 参考訳(メタデータ) (2026-02-10T12:49:50Z) - D^3-Talker: Dual-Branch Decoupled Deformation Fields for Few-Shot 3D Talking Head Synthesis [28.923949756720425]
3Dトーキングヘッド合成における重要な課題は、スクラッチから新しいモデルをトレーニングするために、長期にわたるトーキングヘッドビデオに依存することである。
近年,事前学習モデルを用いて音声から一般特徴を抽出し,この問題に対処する手法が提案されている。
本稿ではD3-Talkerを提案する。これは静的な3次元ガウス属性場を構築し,音声信号と顔信号を用いた新しいアプローチである。
論文 参考訳(メタデータ) (2025-08-20T06:12:33Z) - InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing [66.48064661467781]
我々は、アイデンティティ、象徴的なジェスチャー、カメラ軌跡を維持するために参照を戦略的に保存する新しいパラダイムであるスパースフレームビデオダビングを導入する。
無限長長列ダビング用に設計されたストリーミングオーディオ駆動型ジェネレータであるInfiniteTalkを提案する。
HDTF、CelebV-HQ、EMTDデータセットの総合評価は、最先端の性能を示している。
論文 参考訳(メタデータ) (2025-08-19T17:55:23Z) - HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis [90.74616208952791]
HM-Talkerは、高忠実で時間的コヒーレントな話しヘッドを生成するための新しいフレームワークである。
AUs(Action Units)は、解剖学的に定義された顔面の筋肉の動きと、音素と視覚の相違を最小限に抑える暗黙的な特徴を使用する。
論文 参考訳(メタデータ) (2025-08-14T12:01:52Z) - Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering [53.2204901422631]
Text2Lipは、解釈可能な音声-視覚ブリッジを構築するビセメ中心のフレームワークである。
Text2Lipは、意味的忠実性、視覚的リアリズム、モダリティの堅牢性において、既存のアプローチよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-08-04T12:50:22Z) - PASE: Phoneme-Aware Speech Encoder to Improve Lip Sync Accuracy for Talking Head Synthesis [32.43276443363356]
PASE(Phoneme-Aware Speech)は,音素と音素のギャップを埋める新しい音声表現モデルである。
実験の結果,PASEはリップシンク精度を大幅に向上し,NeRFおよび3DGSベースのレンダリングフレームワーク間の最先端性能を実現している。
論文 参考訳(メタデータ) (2025-04-08T08:35:59Z) - LASER: Lip Landmark Assisted Speaker Detection for Robustness [30.82311863795508]
我々はロバストネスのためのリップランドマーク支援話者検出法(LASER)を提案する。
LASERは、唇の動きをオーディオに合わせることで、複雑な視覚シーンで話す個人を識別することを目的としている。
実験により、LASERは最先端のモデル、特に非同期音声や視覚のシナリオで性能が向上することが示された。
論文 参考訳(メタデータ) (2025-01-21T05:29:34Z) - GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer [26.567649613966974]
Graph Latent Transformerに基づく音声駆動型3次元顔アニメーションモデル
GLDiTalkerは、量子化された時間潜在空間内の信号を拡散することで、不一致を解消する。
Graph-Enhanced Space Quantized Learning Stageはリップ同期の精度を保証し、Space-Time Powered Latent Diffusion Stageは動きの多様性を高める。
論文 参考訳(メタデータ) (2024-08-03T17:18:26Z) - GSmoothFace: Generalized Smooth Talking Face Generation via Fine Grained
3D Face Guidance [83.43852715997596]
GSmoothFaceは、粒度の細かい3次元顔モデルによってガイドされる、2段階の一般化された話し顔生成モデルである。
スピーカーのアイデンティティを保ちながらスムーズな唇の動きを合成することができる。
定量的および定性的な実験は、リアリズム、唇の同期、視覚的品質の観点から、我々の方法の優位性を確認する。
論文 参考訳(メタデータ) (2023-12-12T16:00:55Z) - SVTS: Scalable Video-to-Speech Synthesis [105.29009019733803]
本稿では,ビデオ・トゥ・スペクトログラム予測器と事前学習したニューラルボコーダの2つのコンポーネントからなるスケーラブルなビデオ音声合成フレームワークを提案する。
私たちは、挑戦的なLSS3データセットで不可解な結果を示す最初の人です。
論文 参考訳(メタデータ) (2022-05-04T13:34:07Z) - FaceFormer: Speech-Driven 3D Facial Animation with Transformers [46.8780140220063]
音声駆動の3D顔アニメーションは、人間の顔の複雑な形状と、3Dオーディオ視覚データの利用が制限されているため、難しい。
本研究では,トランスフォーマーをベースとした自動回帰モデルFaceFormerを提案し,長期音声コンテキストを符号化し,アニメーション3D顔メッシュのシーケンスを自動回帰予測する。
論文 参考訳(メタデータ) (2021-12-10T04:21:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。