論文の概要: EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot
- arxiv url: http://arxiv.org/abs/2608.04709v1
- Date: Wed, 05 Aug 2026 11:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.838573
- Title: EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot
- Title(参考訳): EmpaAva: オープンソースのエージェント3D-アバター共感型ライブチャットボット
- Authors: Jie Yang, Wenhao Xu, Shuhui Lin, Hao Fei,
- Abstract要約: EmpaAvaは、最初のオープンソースのエージェント型3D-avatar共感型チャットボットである。
テキストのみの交換から、生きた対面インタラクションへの共感的な反応を生成する。
感情理解、応答品質、音声・視覚の整合性において、テキストのみ、2次元の会話面、マルチモーダルアバターのベースラインを超えている。
- 参考スコア(独自算出の注目度): 22.76715509354487
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This paper presents EmpaAva, to our knowledge the first open-source, agentic 3D-avatar empathetic chatbot, which carries empathetic response generation (ERG) from text-only exchanges into live, face-to-face interaction. Through a video-call-like interface, a user speaks to a 3D digital human that reads their affect from speech and optional vision, and replies with emotional speech, lip-synced facial motion, and photorealistic 3D Gaussian rendering. At its core, an LLM coordinates a Tri-Agent Architecture, in which perception, empathetic response planning, and embodied rendering form a closed loop, paired with a Response Planning layer that compiles each reply into an executable multimodal plan, keeping voice, expression, and rendering on one empathetic intent. Building on strong open-source modules, EmpaAva supplies the intelligence that binds them into one controllable, inspectable experience. In automatic and human evaluations, EmpaAva surpasses text-only, 2D talking-face, and multimodal avatar baselines in emotion understanding, response quality, and audio-visual consistency. We open-source EmpaAva with an online live demo.
- Abstract(参考訳): 本稿では,EmpaAvaについて,テキストのみの交換から顔対面インタラクションへの共感応答生成(ERG)を行う,オープンソースのエージェント型3D-avatar型共感チャットボットについて述べる。
ビデオ通話のようなインタフェースを通じて、ユーザーは音声とオプションの視覚から感情を読み取る3Dデジタル人間に話しかけ、感情的なスピーチ、唇同期顔の動き、フォトリアリスティックな3Dガウスレンダリングで返信する。
LLMはTri-Agent Architectureをコーディネートし、知覚、共感的応答計画、エンボディドレンダリングがクローズドループを形成し、各応答を実行可能なマルチモーダルプランにコンパイルし、音声、表現、レンダリングを1つの共感意図で維持するレスポンスプランニング層と組み合わせる。
EmpaAvaは強力なオープンソースモジュール上に構築されており、コントロール可能なインテリジェンスを1つのインスペクタ可能なエクスペリエンスにバインドする。
EmpaAvaは、感情理解、応答品質、オーディオ視覚の整合性において、テキストのみ、2次元の会話面、マルチモーダルなアバターベースラインを超えている。
オンラインライブデモでEmpaAvaをオープンソース化しました。
関連論文リスト
- ICo3D: An Interactive Conversational 3D Virtual Human [20.10210358626146]
対話型会話型3D仮想人間(Interactive Conversational 3D Virtual Human, ICo3D)は、対話型、対話型、3D人間のアバターを生成する方法である。
我々はアニマタブルな3D顔モデルとダイナミックな3Dボディモデルを作成し、どちらもガウス原始体をスプラッティングすることでレンダリングする。
会話中、アバターの音声音声は、顔モデルをアニメーション化するための駆動信号として使用され、正確な同期を可能にする。
論文 参考訳(メタデータ) (2026-01-19T15:30:08Z) - VisualSpeaker: Visually-Guided 3D Avatar Lip Synthesis [70.76837748695841]
視覚音声認識によって教師される写真リアルな微分可能レンダリングを用いてギャップを埋める新しい手法であるVisualSpeakerを提案する。
我々の貢献は、訓練中に訓練済みの視覚自動音声認識モデルを通して3Dガウス・スプティング・アバターレンダリングを通過させることによって得られる、知覚的な唇読影損失である。
MEADデータセットの評価は、VisualSpeakerが標準のLip Vertex Errorメトリックを56.1%改善し、生成されたアニメーションの知覚的品質を向上し、メッシュ駆動アニメーションの制御性を維持していることを示している。
論文 参考訳(メタデータ) (2025-07-08T15:04:17Z) - AV-Flow: Transforming Text to Audio-Visual Human-like Interactions [101.31009576033776]
AV-Flowは、テキスト入力のみを与えられた写真リアリスティックな4D音声アバターを識別するオーディオ視覚生成モデルである。
人間の音声合成, 唇の動きの同期, 表情の鮮やかさ, 頭ポーズを実演した。
論文 参考訳(メタデータ) (2025-02-18T18:56:18Z) - DEGAS: Detailed Expressions on Full-Body Gaussian Avatars [13.683836322899953]
顔表情の豊かなフルボディアバターに対する3次元ガウススティング(3DGS)に基づくモデリング手法であるDEGASを提案する。
本稿では,2次元の顔と3次元のアバターのギャップを埋めて,2次元の肖像画にのみ訓練された潜在空間を採用することを提案する。
論文 参考訳(メタデータ) (2024-08-20T06:52:03Z) - EmoTalk3D: High-Fidelity Free-View Synthesis of Emotional 3D Talking Head [30.138347111341748]
本稿では,3次元音声頭部を制御可能な感情で合成する新しい手法を提案する。
本モデルでは,生成した音声の感情を制御可能とし,広視野で表現することができる。
実験により,高忠実度・感情制御可能な3次元音声頭部の創出におけるアプローチの有効性を実証した。
論文 参考訳(メタデータ) (2024-08-01T05:46:57Z) - DialogueNeRF: Towards Realistic Avatar Face-to-Face Conversation Video
Generation [54.84137342837465]
対面会話は毎日の会話の大部分を占める。
既存の手法のほとんどは、一人称音声音声生成に重点を置いている。
ニューラルレイディアンスフィールド(NeRF)に基づく新しい統合フレームワークを提案する。
論文 参考訳(メタデータ) (2022-03-15T14:16:49Z) - Audio- and Gaze-driven Facial Animation of Codec Avatars [149.0094713268313]
音声および/またはアイトラッキングを用いて,コーデックアバターをリアルタイムにアニメーション化するための最初のアプローチについて述べる。
私たちのゴールは、重要な社会的シグナルを示す個人間の表現力のある会話を表示することです。
論文 参考訳(メタデータ) (2020-08-11T22:28:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。