論文の概要: AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models
- arxiv url: http://arxiv.org/abs/2605.07478v1
- Date: Fri, 08 May 2026 09:23:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:38.950729
- Title: AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models
- Title(参考訳): AudioFace:マルチモーダル言語モデルを用いた言語支援音声駆動顔アニメーション
- Authors: Kai Zheng, Zejian Kang, Rui Mao, Hongyuan Zou, Yuanchen Fei, Xuanyang Xu, Xiangru Huang,
- Abstract要約: 音声駆動型顔アニメーションは、音響信号と顔の動きの正確な対応を必要とする。
音声駆動型ブレンドシェープ生成のための言語支援フレームワークであるAudioFaceを提案する。
- 参考スコア(独自算出の注目度): 7.050132224945414
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Speech-driven facial animation requires accurate correspondence between acoustic signals and facial motion, especially for articulation-related mouth movements. However, directly mapping speech audio to facial coefficients often overlooks the linguistic and phonetic structure underlying speech production. In this paper, we propose AudioFace, a language-assisted framework for speech-driven blendshape generation that treats mouth-related facial coefficient prediction as a structured generation problem guided by linguistic and articulatory information. Instead of relying solely on acoustic features, our method leverages the prior knowledge of multimodal large language models and introduces transcript- and phoneme-level cues to bridge speech signals with interpretable facial actions. Extensive experiments show that AudioFace achieves superior performance across multiple evaluation metrics, validating the effectiveness of language-assisted and multimodal-prior-guided speech-driven facial animation.
- Abstract(参考訳): 音声駆動型顔アニメーションは、特に調音関連口の動きに対して、音響信号と顔の動きの正確な対応を必要とする。
しかし、音声を直接顔の係数にマッピングすることは、しばしば音声生成の根底にある言語的・音声学的構造を見落としている。
本稿では,言語情報と調音情報によって導かれる構造的生成問題として,口頭関係の表情係数予測を取り扱う言語駆動型ブレンドシェープ生成のための言語支援フレームワークであるAudioFaceを提案する。
本手法は,音響的特徴のみに頼らず,マルチモーダルな大言語モデルの事前知識を活用し,音声信号に解釈可能な顔動作を組み込むための書き起こしと音素レベルの手がかりを導入する。
広汎な実験により、AudioFaceは複数の評価指標にまたがって優れた性能を達成し、言語支援およびマルチモーダル・プレモーダル誘導音声駆動顔画像の有効性を検証した。
関連論文リスト
- Polyglot: Multilingual Style Preserving Speech-Driven Facial Animation [24.33498946139279]
音声駆動顔アニメーション(SDFA)は、映画、ビデオゲーム、バーチャルリアリティーに応用されているため、注目されている。
本研究では,言語が音韻,リズム,イントネーション,表情に影響を及ぼすため,現実的な生成に不可欠である多言語SDFAに対処する。
既存の手法は言語固有の条件と話者固有の条件の両方に依存しているが、両方ではない。
パーソナライズされた多言語SDFAのための統合拡散型アーキテクチャであるPolyglotを紹介する。
論文 参考訳(メタデータ) (2026-04-17T14:43:33Z) - A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages [60.81571443992153]
音声による会話顔合成(TFS)は、音声入力から顔のアニメーションを生成することに焦点を当てている。
現在のモデルは英語ではうまく機能するが、英語以外の言語では不満足に機能し、間違った口の形と堅い表情を生み出している。
我々は,Phoneme-Guided Mixture-of-Expertsアーキテクチャを特徴とする新しいフレームワークであるMultilingual Experts (MuEx)を提案する。
論文 参考訳(メタデータ) (2025-10-08T03:46:39Z) - Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering [53.2204901422631]
Text2Lipは、解釈可能な音声-視覚ブリッジを構築するビセメ中心のフレームワークである。
Text2Lipは、意味的忠実性、視覚的リアリズム、モダリティの堅牢性において、既存のアプローチよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-08-04T12:50:22Z) - VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization [20.728919218746363]
VQTalkerは、ベクトル量子化に基づく多言語音声ヘッド生成フレームワークである。
我々のアプローチは、人間の発話は有限個の異なる音の単位からなるという音素原理に基づいている。
VQTalkerは、ビデオ駆動と音声駆動の両方のシナリオで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-13T06:14:57Z) - GaussianSpeech: Audio-Driven Gaussian Avatars [76.10163891172192]
本稿では,3次元頭部アバターの高忠実度アニメーションシーケンスを音声音声から合成する手法であるGaussianSpeechを紹介する。
本稿では,表情に依存した色を生成するコンパクトで効率的な3DGSベースのアバター表現を提案する。
論文 参考訳(メタデータ) (2024-11-27T18:54:08Z) - Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech [29.510756530126837]
音声中の人間の声道のMRIビデオにおいて,音声を視覚的に表現するデータ駆動方式を提案する。
先行知識に埋め込まれた大規模な事前学習音声モデルを用いて、視覚領域を一般化し、見当たらないデータを生成する。
論文 参考訳(メタデータ) (2024-09-23T20:19:24Z) - AVI-Talking: Learning Audio-Visual Instructions for Expressive 3D
Talking Face Generation [28.71632683090641]
本稿では,表情生成のための音声・視覚指導システムを提案する。
人間の音声から直接顔の動きを学習する代わりに、私たちの2段階の戦略はLLMが最初に音声情報を解釈することを含む。
この2段階のプロセスは、LLMの組み込みと組み合わせて、モデルの解釈可能性を高め、ユーザーに命令を理解する柔軟性を提供する。
論文 参考訳(メタデータ) (2024-02-25T15:51:05Z) - Imitator: Personalized Speech-driven 3D Facial Animation [63.57811510502906]
State-of-the-artメソッドは、ターゲットアクターの顔トポロジを変形させ、ターゲットアクターのアイデンティティ固有の話し方や顔の慣用性を考慮せずに入力オーディオを同期させる。
本稿では,音声による表情合成手法であるImitatorについて述べる。
提案手法は,ターゲットアクターの発話スタイルを保ちながら,入力音声から時間的コヒーレントな表情を生成する。
論文 参考訳(メタデータ) (2022-12-30T19:00:02Z) - Audio-Visual Speech Codecs: Rethinking Audio-Visual Speech Enhancement
by Re-Synthesis [67.73554826428762]
本稿では,AR/VRにおける高忠実度通信のための新しい音声・視覚音声強調フレームワークを提案する。
提案手法は音声・視覚音声の手がかりを利用してニューラル音声のコードを生成することで,ノイズ信号からクリーンでリアルな音声を効率的に合成する。
論文 参考訳(メタデータ) (2022-03-31T17:57:10Z) - MakeItTalk: Speaker-Aware Talking-Head Animation [49.77977246535329]
本稿では,音声を入力として1つの顔画像から表現力のある音声音声を生成する手法を提案する。
この中間表現に基づいて,本手法は全音声頭部の映像を全動作域で合成することができる。
論文 参考訳(メタデータ) (2020-04-27T17:56:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。