論文の概要: FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars
- arxiv url: http://arxiv.org/abs/2606.30145v1
- Date: Mon, 29 Jun 2026 11:22:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.203346
- Title: FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars
- Title(参考訳): FacePlex:会話アバターのための全二重関節音声-ファシアルモーション生成
- Authors: Habin Lim, Jae-Ho Lee, Hah Min Lew, Ji-Su Kang, Gyeong-Moon Park,
- Abstract要約: FacePlexは2つの主要なコンポーネントを備えた統合ストリーミングフレームワークである。
FacePlexは、オンラインストリーミング制約下でのフルフェイスの音声・顔動作生成を可能にする。
- 参考スコア(独自算出の注目度): 21.261785501498196
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Natural face-to-face conversation requires real-time speech generation together with synchronized facial motion. Existing systems only partially address this problem: speech-only full-duplex models can generate speech in real time but do not produce facial motion, while audio-driven facial motion models animate a face from already available audio rather than jointly generating speech and motion online. To bridge this gap, we first formalize full-duplex joint speech-facial motion generation, where speech tokens and facial motion tokens are produced together every step. Building on this formulation, we propose FacePlex, a unified streaming framework with two key components. First, Rolling Flow Matching adapts flow matching to online motion generation by committing new motion frames at each streaming step. Second, Rolling Cross-Attention couples the streaming audio queue with the motion queue, allowing speech and facial motion to condition each other as generation progresses. Through extensive experiments, ablation studies, and a user study, we show that FacePlex enables full-duplex joint speech-facial motion generation under online streaming constraints, while achieving stronger lip-sync quality and motion fidelity than audio-driven facial motion baselines.
- Abstract(参考訳): 自然な対面会話には、リアルタイム音声生成と同期顔の動きが必要である。
音声のみのフルデュプレックスモデルはリアルタイムで音声を生成することができるが、音声駆動の顔の動きモデルは、オンラインで音声や動きを共同生成するのではなく、既に利用可能な音声から顔をアニメーションする。
このギャップを埋めるために、私たちはまず、音声トークンと顔のモーショントークンを各ステップごとに同時に生成する、フル2倍の関節・顔のモーション生成を定式化する。
この定式化に基づいて、2つの主要なコンポーネントを持つ統合ストリーミングフレームワークであるFacePlexを提案する。
まず、ローリングフローマッチングは、各ストリーミングステップで新しいモーションフレームをコミットすることで、オンラインモーション生成にフローマッチングを適用する。
第二に、Rolling Cross-Attentionはストリーミングオーディオキューとモーションキューを結合し、世代が進むにつれて、音声と顔の動きが互いに条件付けされる。
広範にわたる実験,アブレーション研究,ユーザスタディを通じて,FacePlexは,音声駆動の顔動作ベースラインよりも強い唇の同期品質と動きの忠実性を実現しつつ,オンラインストリーミング制約下での2重結合型音声-顔動作生成を可能にすることを示した。
関連論文リスト
- ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance [50.482989497576476]
音声による会話キャラクタアニメーションは、自然な会話行動を伝えるライフライクなポートレートビデオを生成する。
既存のアプローチは通常、動的表情や頭部の動きに対して正確な音素間同期をオフにする。
本稿では,事前学習したビデオ生成モデルに基づく,フローマッチング型音声-画像間アニメーションフレームワークReFree-S2Vを提案する。
論文 参考訳(メタデータ) (2026-06-11T13:00:58Z) - MIBURI: Towards Expressive Interactive Gesture Synthesis [62.45332399212876]
Embodied Conversational Agents (ECA) は、音声、ジェスチャー、表情を通じて人間の対面相互作用をエミュレートすることを目的としている。
既存のECAの解は、人間のような相互作用には適さない剛性で低多様性の運動を生み出す。
MIBURIは,リアルタイム音声対話と同期した表現力のあるフルボディジェスチャーと表情を生成するための,最初のオンライン因果的フレームワークである。
論文 参考訳(メタデータ) (2026-03-03T18:59:51Z) - StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model [73.30619724574642]
音声駆動型3D顔アニメーションは、音声入力によって駆動される現実的で同期された顔の動きを生成することを目的としている。
近年,3次元顔アニメーションに音声条件拡散モデルが採用されている。
本稿では,ストリーミング方式で音声を処理する自己回帰拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-11-18T07:55:16Z) - SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation [18.719993633325522]
本稿では、対話型ビデオのための自己教師型事前学習フレームワークSyncLipMAEを紹介する。
ラベル付けされていないオーディオ・ビジュアルストリームから同期認識と転送可能な顔のダイナミクスを学ぶ。
論文 参考訳(メタデータ) (2025-10-11T07:12:44Z) - EMO2: End-Effector Guided Audio-Driven Avatar Video Generation [17.816939983301474]
本稿では,表現力の高い表情と手の動きを同時に生成できる新しい音声駆動音声ヘッド手法を提案する。
第1段階では、音声信号と手の動きの強い相関を利用して、音声入力から直接手振りを生成する。
第2段階では、拡散モデルを用いてビデオフレームを合成し、第1段階で生成されたポーズを取り入れ、現実的な表情と身体の動きを生成する。
論文 参考訳(メタデータ) (2025-01-18T07:51:29Z) - AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding [24.486705010561067]
AniTalkerは、1つのポートレートから、生き生きとした話し顔を生成するために設計されたフレームワークである。
AniTalkerは、微妙な表情や頭の動きを含む、幅広い顔のダイナミクスを効果的にキャプチャする。
論文 参考訳(メタデータ) (2024-05-06T02:32:41Z) - Audio-Driven Talking Face Generation with Diverse yet Realistic Facial
Animations [61.65012981435094]
DIRFAは、異なるが現実的な顔のアニメーションを同一の駆動音声から生成できる新しい方法である。
同一音声に対して妥当な顔のアニメーションの変動に対応するため,トランスフォーマーに基づく確率的マッピングネットワークを設計する。
DIRFAは現実的な顔のアニメーションを効果的に生成できることを示す。
論文 参考訳(メタデータ) (2023-04-18T12:36:15Z) - That's What I Said: Fully-Controllable Talking Face Generation [16.570649208028343]
各顔が同じ動きパターンを持つが、異なる同一性を持つ正準空間を提案する。
2つ目は、アイデンティティ情報を排除しながら、動きに関連する特徴のみを表現するマルチモーダルモーション空間をナビゲートすることである。
提案手法では, 顔の属性を完全に制御し, 正確な唇のシンクロ化を行うことができる。
論文 参考訳(メタデータ) (2023-04-06T17:56:50Z) - Freeform Body Motion Generation from Speech [53.50388964591343]
音声から体の動きを生成することは、音声から体の動きへの非決定論的マッピングのために本質的に困難である。
2ストリームアーキテクチャを組み込んだ新しいフリーフォームモーション生成モデル(FreeMo)を提案する。
実験は、いくつかのベースラインに対して優れたパフォーマンスを示す。
論文 参考訳(メタデータ) (2022-03-04T13:03:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。