論文の概要: Polyglot: Multilingual Style Preserving Speech-Driven Facial Animation
- arxiv url: http://arxiv.org/abs/2604.16108v1
- Date: Fri, 17 Apr 2026 14:43:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.957969
- Title: Polyglot: Multilingual Style Preserving Speech-Driven Facial Animation
- Title(参考訳): Polyglot: 音声駆動型顔アニメーションを保存する多言語スタイル
- Authors: Federico Nocentini, Kwanggyoon Seo, Qingju Liu, Claudio Ferrari, Stefano Berretti, David Ferman, Hyeongwoo Kim, Pablo Garrido, Akin Caliskan,
- Abstract要約: 音声駆動顔アニメーション(SDFA)は、映画、ビデオゲーム、バーチャルリアリティーに応用されているため、注目されている。
本研究では,言語が音韻,リズム,イントネーション,表情に影響を及ぼすため,現実的な生成に不可欠である多言語SDFAに対処する。
既存の手法は言語固有の条件と話者固有の条件の両方に依存しているが、両方ではない。
パーソナライズされた多言語SDFAのための統合拡散型アーキテクチャであるPolyglotを紹介する。
- 参考スコア(独自算出の注目度): 24.33498946139279
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech-Driven Facial Animation (SDFA) has gained significant attention due to its applications in movies, video games, and virtual reality. However, most existing models are trained on single-language data, limiting their effectiveness in real-world multilingual scenarios. In this work, we address multilingual SDFA, which is essential for realistic generation since language influences phonetics, rhythm, intonation, and facial expressions. Speaking style is also shaped by individual differences, not only by language. Existing methods typically rely on either language-specific or speaker-specific conditioning, but not both, limiting their ability to model their interaction. We introduce Polyglot, a unified diffusion-based architecture for personalized multilingual SDFA. Our method uses transcript embeddings to encode language information and style embeddings extracted from reference facial sequences to capture individual speaking characteristics. Polyglot does not require predefined language or speaker labels, enabling generalization across languages and speakers through self-supervised learning. By jointly conditioning on language and style, it captures expressive traits such as rhythm, articulation, and habitual facial movements, producing temporally coherent and realistic animations. Experiments show improved performance in both monolingual and multilingual settings, providing a unified framework for modeling language and personal style in SDFA.
- Abstract(参考訳): 音声駆動顔アニメーション(SDFA)は、映画、ビデオゲーム、バーチャルリアリティーに応用されているため、注目されている。
しかし、既存のほとんどのモデルは単一の言語データに基づいて訓練されており、実世界の多言語シナリオにおける有効性を制限している。
本研究では,言語が音韻,リズム,イントネーション,表情に影響を及ぼすため,現実的な生成に不可欠である多言語SDFAに対処する。
話し方は言語だけでなく、個人差によっても形づくられる。
既存の手法は通常、言語固有の条件や話者固有の条件に依存するが、両方ではないため、相互作用をモデル化する能力は制限される。
パーソナライズされた多言語SDFAのための統合拡散型アーキテクチャであるPolyglotを紹介する。
提案手法では,テキスト埋め込みを用いて,参照顔系列から抽出した言語情報とスタイル埋め込みを符号化し,個々の発話特性をキャプチャする。
ポリグロットは事前定義された言語や話者ラベルを必要としないため、自己教師付き学習を通じて言語や話者を一般化することができる。
言語とスタイルを共同で条件付けすることで、リズム、調音、習慣的な顔の動きなどの表現的な特徴を捉え、時間的に一貫性のあるリアルなアニメーションを生成する。
実験では、単言語と多言語の両方のパフォーマンスが向上し、SDFAで言語と個人スタイルをモデリングするための統一されたフレームワークを提供する。
関連論文リスト
- A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages [60.81571443992153]
音声による会話顔合成(TFS)は、音声入力から顔のアニメーションを生成することに焦点を当てている。
現在のモデルは英語ではうまく機能するが、英語以外の言語では不満足に機能し、間違った口の形と堅い表情を生み出している。
我々は,Phoneme-Guided Mixture-of-Expertsアーキテクチャを特徴とする新しいフレームワークであるMultilingual Experts (MuEx)を提案する。
論文 参考訳(メタデータ) (2025-10-08T03:46:39Z) - Generalized Multilingual Text-to-Speech Generation with Language-Aware Style Adaptation [18.89091877062589]
LanStyleTTS は非自己回帰型言語対応の適応型 TTS フレームワークである。
言語固有のモデルを訓練することなく、正確で高品質な音声を生成することができる統合多言語TSモデルをサポートしている。
論文 参考訳(メタデータ) (2025-04-11T06:12:57Z) - VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization [20.728919218746363]
VQTalkerは、ベクトル量子化に基づく多言語音声ヘッド生成フレームワークである。
我々のアプローチは、人間の発話は有限個の異なる音の単位からなるという音素原理に基づいている。
VQTalkerは、ビデオ駆動と音声駆動の両方のシナリオで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-13T06:14:57Z) - Learning Cross-lingual Visual Speech Representations [108.68531445641769]
言語横断的な自己監督型視覚表現学習は、ここ数年、研究トピックとして成長している。
我々は最近提案したRAVEn(Raw Audio-Visual Speechs)フレームワークを用いて,未ラベルデータを用いた音声-視覚モデルの事前学習を行う。
1)データ量が多いマルチ言語モデルはモノリンガルモデルよりも優れているが、データの量を維持すると、モノリンガルモデルの性能が向上する傾向にある。
論文 参考訳(メタデータ) (2023-03-14T17:05:08Z) - Language-Guided Face Animation by Recurrent StyleGAN-based Generator [87.56260982475564]
本研究では,静的顔画像のアニメーション化を目的とした,言語指導型顔画像の新しいタスクについて検討する。
本稿では,言語から一連の意味情報と動作情報を抽出し,学習済みのStyleGANに視覚情報と共に供給し,高品質なフレームを生成するための繰り返し動作生成手法を提案する。
論文 参考訳(メタデータ) (2022-08-11T02:57:30Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z) - Vokenization: Improving Language Understanding with Contextualized,
Visual-Grounded Supervision [110.66085917826648]
我々は,言語トークンを関連画像に文脈的にマッピングすることで,言語のみのデータに対するマルチモーダルアライメントを補間する手法を開発した。
語彙化」は比較的小さな画像キャプションデータセットに基づいて訓練され、それを大規模言語コーパスのための語彙生成に適用する。
これらの文脈的に生成された語彙を用いて学習し、視覚的に制御された言語モデルにより、複数の純粋言語タスクにおいて、自己教師による代替よりも一貫した改善が示される。
論文 参考訳(メタデータ) (2020-10-14T02:11:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。