論文の概要: Conversational Human Audio-visual Talking Dialogue Generation
- arxiv url: http://arxiv.org/abs/2607.02799v1
- Date: Thu, 02 Jul 2026 22:17:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.423046
- Title: Conversational Human Audio-visual Talking Dialogue Generation
- Title(参考訳): 対話型音声-視覚対話生成
- Abstract要約: 対話型対話型対話フレームワークCHATを提案する。
Chatは大きな言語モデルと対話型音声および顔行動改善モジュールで会話型顔モデルを統合する。
実験の結果,CHATは主観的評価と主観的評価の両方において,類似タスク用に設計された既存の関連手法よりも優れていた。
- 参考スコア(独自算出の注目度): 50.95039085506777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large-scale dyadic interactive audio-visual dialogue (DIAD) datasets provide fundamental data resources for developing humanoid interactive virtual agents and digital humans. However, collecting such data is time-consuming, expensive, and ethically sensitive. To address this, we propose CHAT, a new dyadic interactive audio-visual dialogue generation (DIADG) framework that generates diverse, paired, and mutually responsive speech-face dialogue clips from a single textual prompt. CHAT unifies large language models and talking face models with interactive audio and facial behaviour refinement modules, enabling the generation of aligned dyadic dialogue clips with diverse contents and facial identities. Experiments show that CHAT outperforms existing related methods designed for similar tasks under both objective and subjective evaluations. Moreover, our synthesised CHAT-AVD-50k dataset serves as effective pre-training data for downstream interactive head generation, consistently improving PerFRDiff and ReactDiff on REACT 2024. CHAT offers a scalable alternative to the costly and ethically sensitive collection of real dyadic interaction data.
- Abstract(参考訳): 大規模Dyadic Interactive audio-visual dialogue (DIAD)データセットは、ヒューマノイドの対話型仮想エージェントやデジタル人間を開発するための基本的なデータ資源を提供する。
しかし、そのようなデータの収集には時間がかかり、費用がかかり、倫理的に敏感である。
そこで本研究では,一文のプロンプトから多種多様でペア化され,相互に応答する音声-顔対話クリップを生成する,対話型音声-視覚対話生成(DIADG)フレームワークであるCHATを提案する。
CHATは、大きな言語モデルと対話型顔モデルと対話型音声および顔行動改善モジュールを統合し、多様な内容と顔の同一性を備えた、整列したダイアログクリップを生成する。
実験の結果,CHATは主観的評価と主観的評価の両方において,類似タスク用に設計された既存の関連手法よりも優れていた。
さらに、当社のCHAT-AVD-50kデータセットは、下流対話型ヘッド生成のための効果的な事前学習データとして機能し、REACT 2024上でのPerFRDiffとReactDiffを継続的に改善する。
CHATは、高コストで倫理的に敏感なリアルな対話データのコレクションに代わるスケーラブルな代替手段を提供する。
関連論文リスト
- TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation [72.46711449668814]
本稿では,対話型顔と会話型音声の両方を同期的に生成する統合フレームワークであるTAVIDを紹介する。
本システムの評価は, 顔のリアリズム, 頭部の応答性, ダイアディック相互作用, 音声品質の4つの側面にまたがる。
論文 参考訳(メタデータ) (2025-12-23T12:04:23Z) - Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset [113.25650486482762]
4000時間以上の対面インタラクション映像の大規模な収集であるSeamless Interactionデータセットを紹介した。
このデータセットは、ダイドの具体的ダイナミクスを理解するAIテクノロジの開発を可能にする。
そこで我々は,このデータセットを用いて,人間の発話に適応した動作ジェスチャーと表情を生成するモデル群を開発した。
論文 参考訳(メタデータ) (2025-06-27T18:09:49Z) - Aligning Spoken Dialogue Models from User Interactions [55.192134724622235]
本稿では,ユーザの対話からリアルタイム会話における音声対話モデルを改善するための新しい嗜好アライメントフレームワークを提案する。
AIフィードバックを付加した生のマルチターン音声会話から15万以上の好みペアのデータセットを作成する。
本研究は, 自然なリアルタイム音声対話システムにおいて重要な, 様々な力学におけるバランスの整合性の重要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-26T16:45:20Z) - REALTALK: A 21-Day Real-World Dataset for Long-Term Conversation [51.97224538045096]
本稿では、21日間のメッセージアプリ対話のコーパスであるREALTALKを紹介する。
EI属性とペルソナの整合性を比較し,現実世界の対話による課題を理解する。
その結果,モデルでは対話履歴のみからユーザをシミュレートすることが困難であり,特定のユーザチャットの微調整はペルソナのエミュレーションを改善することがわかった。
論文 参考訳(メタデータ) (2025-02-18T20:29:01Z) - OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios [45.78414948567598]
本稿では,多種多様なシナリオの対話モデルを強化するために合成データを活用することを提案する。
ShareChatXは、多様なシナリオにまたがる音声対話のための、最初の包括的な大規模データセットである。
また、合成データを用いた対話システムの訓練における重要な側面についても検討する。
論文 参考訳(メタデータ) (2025-01-02T17:58:23Z) - Dialogue History Matters! Personalized Response Selectionin Multi-turn
Retrieval-based Chatbots [62.295373408415365]
本稿では,コンテキスト応答マッチングのためのパーソナライズドハイブリッドマッチングネットワーク(phmn)を提案する。
1) ユーザ固有の対話履歴からパーソナライズされた発話行動を付加的なマッチング情報として抽出する。
ユーザ識別による2つの大規模データセット,すなわちパーソナライズされた対話 Corpus Ubuntu (P-Ubuntu) とパーソナライズされたWeiboデータセット (P-Weibo) のモデルを評価する。
論文 参考訳(メタデータ) (2021-03-17T09:42:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。