論文の概要: DuplexDrama: A Synthesized Dialogue Dataset with Scenarios, Full-Duplex Behaviors, Expressive Speech, and Sound Events
- arxiv url: http://arxiv.org/abs/2609.12872v1
- Date: Fri, 11 Sep 2026 13:56:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.768481
- Title: DuplexDrama: A Synthesized Dialogue Dataset with Scenarios, Full-Duplex Behaviors, Expressive Speech, and Sound Events
- Title(参考訳): DuplexDrama:シナリオ、フルダブルプレックス行動、表現型音声、音声イベントを備えた合成対話データセット
- Abstract要約: このデータセットは、次元を同時にカバーしている: (i)シナリオ設定、 (ii)感情ラベル付きフルアライメントのペルソナアライメント音声3つ、 (iv)スクリプト対応の音声イベント。
我々は、64声のプールが13歳から5歳までのバケツにまたがる2000時間以上のオーディオデータを作成しました。
完全な音声対話モデル研究を進めるため、6,400の対話のサブセットをリリースする。
- 参考スコア(独自算出の注目度): 19.85722293719675
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present DuplexDrama, the first synthesized spoken dialogue dataset that simultaneously covers four dimensions: (i) complete persona and scenario settings; (ii) three full-duplex behaviors (interruption, backchannel, incomplete); (iii) expressive speech with persona-aligned emotion labels; and (iv) script-aware sound events. DuplexDrama is built via a 4-stage pipeline; quality validation on both scripts and synthesized audio confirms its quality. We have produced more than 2,000 hours audio data with a 64-voice timbre pool spanning 13 personas and 5 age buckets; 3.8% of all turns carry at least one full-duplex behavior. This data has been validated through internal full-duplex model training. We will release a curated subset of 6,400 bilingual dialogues (800 h, Chinese ~500 h + English ~300 h) to advance full-duplex spoken dialogue model research. Data samples are available at our demo page and LLM-judge evaluation prompts will be released with the dataset.
- Abstract(参考訳): 4次元を同時にカバーする最初の合成音声対話データセットであるDuplexDramaを紹介する。
(i)完全なペルソナ及びシナリオ設定
(二)全二重動作(中断、バックチャネル、不完全)
三 人格対応の感情ラベルによる表現的スピーチ、及び
(4)スクリプト対応の音声イベント。
DuplexDramaは4段階のパイプラインで構築されている。
我々は、13人の人物と5人の年齢バケットにまたがる64声の音色プールを備えた2000時間以上の音声データを作成しました。
このデータは、内部のフルデュプレックスモデルトレーニングを通じて検証されている。
我々は、6,400のバイリンガル対話(800 h、中国語 ~500 h + English ~300)のキュレートされたサブセットをリリースする。
h) 全二重音声対話モデル研究を進めること。
データのサンプルはデモページで公開されており、LLM-judge評価プロンプトはデータセットでリリースされます。
関連論文リスト
- Realtime-Venus: A full-duplex interaction system with asynchronous delegation [59.69745588222872]
音声対話のためのリアルタイム・リアルタイム・オムニ・オーディオ・インタラクションとリアルタイム・オーディオ・スポーケンを提示する。
それぞれのモデルは完全な会話として機能し、連続認識、会話制御、およびネイティブ音声生成を統合する。
論文 参考訳(メタデータ) (2026-09-12T08:56:50Z) - ConversationalVoice: Full-Duplex Speech Data from Real Conversations through Source-Faithful Reconstruction and Conversation-Grounded Expansion [5.90805749495021]
完全な音声モデルは訓練を必要とするが、ノイズの多い現実世界の録音では、話者間で信号が絡み合っている。
安定な話者行動を持つパイプライントラックを提示し、データ特性のみを評価する。
フル-3.2%のモデルトレーニングで 下流での上昇は 今後も続く。
論文 参考訳(メタデータ) (2026-09-08T02:28:43Z) - Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework [51.969792455913655]
2 半対話システムシステムは応答する前にユーザのターン完了を待つ。
応答品質を犠牲にすることなくターンタイミングを予測します。
WildTurnは、顔と電話の会話から981時間のマルチターン会話を含む大規模な実世界の英語データセットで、5つのターンレベルの対話スタイルを持ち、WildTurn LPS-TCで訓練され、既存の静的ベンチマークでは捉えられないリッチな音声動特性を示すリッチな音声動特性を示し、リアルなストリーミング制約下でのインレベルタイミング精度とターンレベルの対話品質の両方を評価する2層評価スキームを導入する。
論文 参考訳(メタデータ) (2026-08-04T08:22:50Z) - BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM [37.246890931249496]
BayLing-Duplexはネイティブのフル世代のSpeechLMで、どの場所を聴くか、いつ話すか、いつ停止するかを補助的なターンテイクモジュールなしで決める。
InstructS2S-Evalでは92%のターンテイク成功、100%割り込み成功、Moshiでは2.17から3.39に改善した。
論文 参考訳(メタデータ) (2026-06-12T15:01:51Z) - VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents [27.786319380559515]
人間とエージェントの対話を成功させるためには、完全な視覚的会話をモデル化する必要がある。
AV2AVインタラクションの完全なオーディオヴィジュアルキャプションのための最初のベンチマークとして、VideoFDBは体系的な評価と進歩の基礎を確立している。
論文 参考訳(メタデータ) (2026-05-28T17:20:01Z) - X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning [62.740127542449166]
X-Voiceは、任意の音声をクローンし、誰でも30の言語を話せる多言語ゼロショット音声クローンモデルである。
X-Voiceは国際音声アルファベット(IPA)を統一表現として420K時間多言語コーパスで訓練されている。
論文 参考訳(メタデータ) (2026-05-07T02:57:53Z) - Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency [61.68376148916503]
FDB-v3 (Full-Duplex-Bench-v3) は、自然言語条件下での音声モデルの評価と多段階ツールの使用のためのベンチマークである。
以前の作業とは異なり、データセットは5つのディスフルカテゴリにアノテートされた実際の人間のオーディオで構成されており、4つのタスクドメインにチェーンされたAPI呼び出しを必要とするシナリオとペアリングされています。
GPT-Realtime、Gemini Live 2.5、Gemini Live 3.1、Grok、Ultravox v0.7、従来のカスケードパイプライン(Whisper$rightarrow$rightarrow$TTS)の6つのモデル構成を精度、レイテンシ、ターンで評価した。
論文 参考訳(メタデータ) (2026-04-06T16:46:52Z) - FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes [56.534404169212785]
FunCineForgeは、大規模なダビングデータセットのためのエンドツーエンド生産パイプラインと、さまざまな撮影シーン用に設計されたMLLMベースのダビングモデルで構成されている。
リッチアノテーションを用いた中国初のテレビダビングデータセットを構築し,その高品質性を実証する。
モノローグ,ナレーション,対話,マルチスピーカーシーンにおける実験により,我々のダビングモデルは音質,リップシンク,音色伝達,指示追従のSOTA手法より一貫して優れていた。
論文 参考訳(メタデータ) (2026-01-21T08:57:00Z) - Spoken DialogSum: An Emotion-Rich Conversational Dataset for Spoken Dialogue Summarization [21.32336226752075]
Spoken DialogSumは、生の会話音声を現実の要約、感情に富んだ要約、発話レベルラベルと整合させる最初のコーパスである。
まず、LLMがDialogSumスクリプトをSwitchboardスタイルのフィラーとバックチャネルで書き直し、各発話を感情、ピッチ、発話率でタグ付けする。
Spoken DialogSumは13,460の感情の異なる対話で構成され、それぞれが事実と感情に焦点を当てた要約をペアリングする。
論文 参考訳(メタデータ) (2025-12-16T18:54:20Z) - OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation [53.7173034249361]
エンド・ツー・エンドのGPTベースモデルであるOmniFlattenは、低レイテンシで自然な会話に固有の複雑な振る舞いを効果的にモデル化することができる。
提案手法は, 簡便なモデリング手法と, より効率的かつ自然な対話システムを構築するための研究の方向性を提供する。
論文 参考訳(メタデータ) (2024-10-23T11:58:58Z) - Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents [12.555910887280199]
フル同期音声対話モデルのための同期LLMを提案する。
実世界の音声対話データをわずか2k時間で有意義で自然な対話を生成するモデルを訓練する。
異なるデータセット上で訓練された2つのエージェント間の相互作用をシミュレートすることにより、モデルがフル同期対話に参加する能力を示す。
論文 参考訳(メタデータ) (2024-09-23T23:01:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。