論文の概要: EchoAvatar: Real-time Generative Avatar Animation from Audio Streams
- arxiv url: http://arxiv.org/abs/2605.28272v1
- Date: Wed, 27 May 2026 10:18:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.964806
- Title: EchoAvatar: Real-time Generative Avatar Animation from Audio Streams
- Title(参考訳): EchoAvatar:オーディオストリームからのリアルタイム生成アバターアニメーション
- Authors: Bohong Chen, Yumeng Li, Yinglin Xu, Youyi Zheng, Yanlin Weng, Kun Zhou,
- Abstract要約: 本稿では,低レイテンシでストリーミング音声と音楽から連続的でコヒーレントなフルボディモーションを生成するための新しいフレームワークを提案する。
この制御性とストリーム音声駆動合成を組み合わせることで,音声エージェントを対話型ヒューマノイドアバターに変換するためのプラグアンドプレイソリューションとして機能する。
- 参考スコア(独自算出の注目度): 31.328378976492775
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-time synthesis of high-fidelity 3D character motion from audio is a pivotal component for next-generation interactive avatars and virtual assistants. However, most existing approaches are limited to offline processing of complete audio sequences or are constrained to specific domains, rarely handling both speech and music effectively. In this paper, we introduce a novel framework designed to generate continuous, coherent full-body motion from streaming speech and music with low latency. Central to our approach is a unified streaming architecture capable of synthesizing continuous motion from incremental audio inputs. We employ a robust training strategy that enforces strong audio dependency, allowing the model to seamlessly generalize across conversational speech and rhythmic music without requiring explicit domain labels or mode switching. Additionally, we explored Reinforcement Learning to refine the quality of online generation. Furthermore, we bridge reactive animation with intent-driven behavior via a tool-call interface that allows upstream Large Language Models to inject explicit semantic control. By combining this controllability with stream audio-driven synthesis, our framework serves as a plug-and-play solution for transforming voice agents into interactive humanoid avatars. Extensive experiments demonstrate that our method outperforms state-of-the-art realtime baselines in motion quality and synchronization while maintaining the flexibility required for live deployment. Our code, pre-trained models, and videos are available at https://robinwitch.github.io/EchoAvatar-Page.
- Abstract(参考訳): オーディオから高忠実度3Dキャラクタ動作をリアルタイムに合成することは、次世代のインタラクティブアバターや仮想アシスタントにとって重要な要素である。
しかし、既存のアプローチのほとんどは、完全なオーディオシーケンスのオフライン処理に限られているか、特定のドメインに制限されているため、音声と音楽の両方を効果的に扱うことは滅多にない。
本稿では,低レイテンシでストリーミング音声と音楽から連続的かつ一貫性のあるフルボディモーションを生成するための新しいフレームワークを提案する。
我々のアプローチの中心は、インクリメンタルオーディオ入力から連続的な動きを合成できる統合ストリーミングアーキテクチャである。
我々は、強い音声依存を強制する堅牢なトレーニング戦略を採用し、明確なドメインラベルやモード切替を必要とせずに、会話音声とリズム音楽のシームレスな一般化を可能にする。
さらに、オンライン生成の質を高めるために強化学習について検討した。
さらに、上流の大規模言語モデルに明示的なセマンティックコントロールを注入できるツールコールインターフェースを通じて、リアクティブアニメーションをインテント駆動の動作でブリッジする。
この制御性とストリーム音声駆動合成を組み合わせることで,音声エージェントを対話型ヒューマノイドアバターに変換するためのプラグアンドプレイソリューションとして機能する。
大規模な実験により,本手法は,ライブデプロイメントに必要な柔軟性を維持しつつ,動作品質と同期性において,最先端のリアルタイムベースラインよりも優れることが示された。
私たちのコード、事前トレーニングされたモデル、ビデオはhttps://robinwitch.github.io/EchoAvatar-Page.comで公開されています。
関連論文リスト
- Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels [26.18760496276335]
対話型仮想エージェントを開発し、会話と聴取の両方に双方向の音声入力を同時に処理する。
我々の手法は文脈意味論と強い時間的アライメントを融合させ、非常に自然で応答性の高い対話型デジタル人間を生成するための新しい最先端技術を構築した。
論文 参考訳(メタデータ) (2026-04-11T22:34:21Z) - StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model [73.30619724574642]
音声駆動型3D顔アニメーションは、音声入力によって駆動される現実的で同期された顔の動きを生成することを目的としている。
近年,3次元顔アニメーションに音声条件拡散モデルが採用されている。
本稿では,ストリーミング方式で音声を処理する自己回帰拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-11-18T07:55:16Z) - Audio Driven Real-Time Facial Animation for Social Telepresence [65.66220599734338]
最小遅延時間で3次元顔アバターをアニメーションするオーディオ駆動リアルタイムシステムを提案する。
我々のアプローチの中心は、音声信号をリアルタイムに潜在表情シーケンスに変換するエンコーダモデルである。
我々は、リアルタイムなパフォーマンスを達成しつつ、自然なコミュニケーションに必要な表情の豊富なスペクトルを捉えている。
論文 参考訳(メタデータ) (2025-10-01T17:57:05Z) - AvatarSync: Rethinking Talking-Head Animation through Phoneme-Guided Autoregressive Perspective [15.69417162113696]
AvatarSyncは音素表現の自己回帰フレームワークであり、単一の参照画像からリアルなトーキングヘッドアニメーションを生成する。
AvatarSyncは,視覚的忠実度,時間的整合性,計算効率において,既存のトーキングヘッドアニメーション手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-09-15T15:34:02Z) - ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing [47.14083940177122]
ThinkSoundは、ビデオの段階的にインタラクティブなオーディオ生成と編集を可能にする新しいフレームワークである。
提案手法は,3つの相補的な段階 – セマンティック・コヒーレント,インタラクティブなオブジェクト中心の改良,ターゲット編集 – に分解する。
実験により、ThinkSoundはオーディオメトリクスとCoTメトリクスの両方で、ビデオからオーディオ生成における最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-06-26T16:32:06Z) - OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation [11.71823020976487]
音声駆動フルボディビデオ生成モデルであるOmniAvatarを紹介する。
人間のアニメーションを強化し、リップシンク精度と自然な動きを改善した。
実験では、顔と半体の両方のビデオ生成で既存のモデルを上回っている。
論文 参考訳(メタデータ) (2025-06-23T17:33:03Z) - Learning to Listen: Modeling Non-Deterministic Dyadic Facial Motion [89.01668641930206]
本稿では,対話における対話コミュニケーションをモデル化するための枠組みを提案する。
我々は、対応するリスナー動作の複数の可能性を自動回帰的に出力する。
本手法は,非言語的ダイアド相互作用の多モーダルおよび非決定論的性質を有機的に捕捉する。
論文 参考訳(メタデータ) (2022-04-18T17:58:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。