論文の概要: The Shape of Speech: A Geometric Measure of Coarticulation for Speech-Driven 3D Facial Animation
- arxiv url: http://arxiv.org/abs/2610.03436v1
- Date: Fri, 02 Oct 2026 15:16:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.439088
- Title: The Shape of Speech: A Geometric Measure of Coarticulation for Speech-Driven 3D Facial Animation
- Title(参考訳): 音声の形状:音声駆動型3次元顔アニメーションにおけるコースティックレーションの幾何学的計測
- Abstract要約: 音声駆動の3D顔アニメーションは、認識可能な口ポーズを再現することができる。
それらの間の動きを単純化し、その動きは、各音の周囲の音が関節を形作るように、粗い動きをもたらす。
音声セグメントの母音,子音,母音位置を通した最短経路と比較し,この軌跡形成の指標を提案する。
- 参考スコア(独自算出の注目度): 0.8594140167290095
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech-driven 3D facial animation can reproduce recognizable mouth poses. However, it can simplify the motion between them, and that motion carries coarticulation, the way the sounds around each sound shape its articulation. We introduce a geometric measure of this trajectory shaping: lip-path length compared with the shortest route through the vowel, consonant and vowel positions of a speech segment. In contrast to the endpoint chord, this consonant-aware route accounts for obligatory transit and avoids degeneracy, while preserving invariance to uniform motion gain. The measure needs only a forced alignment, so it applies where no ground truth exists. We demonstrate it on four state-of-the-art methods, one per architectural family, real-time and offline. All four trace flatter lip trajectories than captured speech. Against frame-rate-matched ground truth, DiffPoseTalk, ARTalk and FaceFormer show clear deficits, equivalent on this measure to removing 15-60% of real speech's fast articulatory component. CodeTalker is marginal on the primary measure and clear on a companion measure. A pre-registered study with 97 viewers and 3,523 judgments underpins the measured direction: controlled damping of real motion lowers the score and is penalized, whereas exaggeration shows no detected penalty over the tested range. Viewers also prefer real speech in 73.4% of sentence comparisons and, in the aggregate, on single words. Together, the measure, its calibration and the study identify a perceptually relevant loss of trajectory shaping and a concrete target for improving synthesized articulation.
- Abstract(参考訳): 音声駆動の3D顔アニメーションは、認識可能な口ポーズを再現することができる。
しかし、それらの間の動きを単純化し、その動きは、各音の周囲の音が関節を形作るように、粗い動きをもたらす。
音声セグメントの母音,子音,母音位置を通した最短経路と比較し,この軌跡形状の幾何学的測度を導入する。
終端コードとは対照的に、この子音対応経路は、一様運動ゲインに対する不変性を保ちながら、強制的なトランジットを考慮し、縮退を回避する。
この測度は強制的なアライメントのみを必要とするため、根拠となる真実が存在しない場合に適用される。
アーキテクチャファミリごとに1つ、リアルタイムとオフラインの4つの最先端のメソッドでそれを実証します。
4つの連続した唇の軌跡は、捕えられた音声よりも少ない。
DiffPoseTalk、ARTalk、FaceFormerはフレームレートマッチングされた地上の真実に対して明確な欠点を示しており、実際の音声の高速な調音成分の15~60%を除去している。
CodeTalkerは主要な尺度では限界であり、関連する尺度ではクリアである。
97人の視聴者と3,523人の判断で事前登録された研究では、実際の動きの制御された減衰がスコアを下げ、ペナル化される一方、誇張は検査範囲に対して検出されたペナルティを示さない。
視聴者はまた、文比較の73.4%で実際の音声を好む。
この測定, 校正, 研究により, 軌跡形成の知覚的損失と合成調音改善のための具体的目標が同定された。
関連論文リスト
- ArticulateArena: A Metric for Articulated Kinematics [56.23391152623764]
ArticulateArenaは、調音のためのチャンファー距離の表現不変である。
これは、それを符号化するパラメータではなく、1-DOF関節の運動を比較する。
ArticulateArena-20Kは19,977個の調音されたオブジェクトからなる新しいスイートで、キネマティクスを検証する。
論文 参考訳(メタデータ) (2026-09-27T21:19:22Z) - Seeing Speech: Learning Visible Articulatory Dynamics for Speech-Driven 3D Facial Animation [5.4007648253319305]
音声-調音記憶(SAM)は、音声環境下での音声とこれらの動きの対応をキャプチャする。
Topology-Aware Articulatory Composition (TAC)は、メッシュトポロジーの下で予測される方向の関節運動を統合し、表面一貫性のある3D顔の動きを生成する。
論文 参考訳(メタデータ) (2026-09-24T20:12:36Z) - ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance [50.482989497576476]
音声による会話キャラクタアニメーションは、自然な会話行動を伝えるライフライクなポートレートビデオを生成する。
既存のアプローチは通常、動的表情や頭部の動きに対して正確な音素間同期をオフにする。
本稿では,事前学習したビデオ生成モデルに基づく,フローマッチング型音声-画像間アニメーションフレームワークReFree-S2Vを提案する。
論文 参考訳(メタデータ) (2026-06-11T13:00:58Z) - Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering [53.2204901422631]
Text2Lipは、解釈可能な音声-視覚ブリッジを構築するビセメ中心のフレームワークである。
Text2Lipは、意味的忠実性、視覚的リアリズム、モダリティの堅牢性において、既存のアプローチよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-08-04T12:50:22Z) - Learning Phonetic Context-Dependent Viseme for Enhancing Speech-Driven 3D Facial Animation [8.75374562753977]
音声駆動型3D顔アニメーションは、音声と同期した現実的な顔の動きを生成することを目的としている。
従来の手法では、各フレームを接地構造に合わせることで、復元損失を最小化していた。
本稿では,音韻遷移に対する音韻文脈の影響を明示的にモデル化した新しい音韻文脈認識損失を提案する。
論文 参考訳(メタデータ) (2025-07-28T07:04:50Z) - Perceptually Accurate 3D Talking Head Generation: New Definitions, Speech-Mesh Representation, and Evaluation Metrics [14.290468730787772]
音声信号と3次元顔メッシュの複雑な対応をキャプチャする音声-メシュ同期表現を提案する。
実験の結果, 知覚的損失を伴う3次元音声音声生成モデルの訓練は, 知覚的に正確な唇同期の3つの側面を著しく改善することがわかった。
論文 参考訳(メタデータ) (2025-03-26T08:18:57Z) - Speech2Lip: High-fidelity Speech to Lip Generation by Learning from a
Short Video [91.92782707888618]
本稿では,音声の知覚と音声の知覚を両立させるSpeech2Lip(Speech2Lip)という分解合成フレームワークを提案する。
提案手法は,数分間のビデオで学習し,視覚的品質と音声・視覚的同期の両面において最先端のパフォーマンスを達成可能であることを示す。
論文 参考訳(メタデータ) (2023-09-09T14:52:39Z) - Pose-Controllable Talking Face Generation by Implicitly Modularized
Audio-Visual Representation [96.66010515343106]
ポーズ制御可能な発話顔を生成するためのクリーンで効果的なフレームワークを提案する。
我々は1枚の写真のみを識別基準として生の顔画像を操作する。
私達のモデルに極度な視野の堅牢性および話す表面前部化を含む複数の高度の機能があります。
論文 参考訳(メタデータ) (2021-04-22T15:10:26Z) - MeshTalk: 3D Face Animation from Speech using Cross-Modality
Disentanglement [142.9900055577252]
本研究では,顔全体の映像合成を高度に実現するための汎用的な音声駆動顔アニメーション手法を提案する。
このアプローチは、目のまばたきやまばたきなど、音声信号とは無関係な顔の一部のアニメーションを再現すると同時に、高精度な唇の動きを保証します。
論文 参考訳(メタデータ) (2021-04-16T17:05:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。