論文の概要: DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects
- arxiv url: http://arxiv.org/abs/2608.08067v2
- Date: Fri, 14 Aug 2026 06:32:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.197337
- Title: DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects
- Title(参考訳): DialectS2S: 低音源中国語方言のエンドツーエンド音声対話モデリング
- Authors: Yi Shu, Tianyu Peng, Yingzhuo Deng, Wen Yang, Jun Lin, Changming Xie, Xinyu Yu, Jiajun Zhang,
- Abstract要約: 中国語方言におけるエンドツーエンド音声対話モデルDialectS2Sを提案する。
まず、効率的なデータ構築のためのスケーラブルな方言音声合成パイプラインを開発する。
本稿では,自己整合型音声指導による2段階後学習戦略を導入し,音声指導のセマンティック内容とモデルの進化したセマンティック表現とを整合させる。
- 参考スコア(独自算出の注目度): 20.435203165921134
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current end-to-end speech dialogue models are primarily optimized for mainstream languages and remain limited in low-resource dialect scenarios due to the scarcity of dialect speech data. Moreover, during dialect adaptation, the semantic representation space of speech dialogue models continuously evolves, while conventional speech supervision remains unchanged, leading to semantic inconsistency between hidden representations and speech targets and degrading speech stability and naturalness. To address these issues, we propose DialectS2S, an end-to-end speech dialogue model for Chinese dialects. We first develop a scalable dialect speech dialogue synthesis pipeline for efficient data construction. We further introduce a two-stage post-training strategy with self-aligned speech supervision, which aligns the semantic content of speech supervision with the evolved semantic representations of the model to improve dialect speech generation quality. Experimental results show that DialectS2S consistently outperforms existing baselines across multiple Chinese dialects in speech dialogue, achieving substantial improvements in dialect consistency, response quality, and speech intelligibility. Our work provides an efficient and scalable solution for end-to-end speech dialogue modeling in low-resource dialect scenarios. To facilitate future research and practical applications, we fully open-source the DialectS2S framework, including model checkpoints, training datasets, and fine-tuning code.
- Abstract(参考訳): 現在のエンドツーエンドの音声対話モデルは、主に主流言語に最適化されており、方言音声データの不足のため、低リソースの方言シナリオに限られている。
さらに、方言適応においては、音声対話モデルの意味表現空間は連続的に進化し、従来の音声指導は変わらず、隠れた表現と発話対象間の意味的不整合が生じ、音声の安定性と自然性を低下させる。
これらの問題に対処するため、中国語方言のエンドツーエンド音声対話モデルであるDilectS2Sを提案する。
まず、効率的なデータ構築のためのスケーラブルな方言音声合成パイプラインを開発する。
さらに,言語指導のセマンティック内容とモデルの進化したセマンティック表現とを整合させて,方言音声の質を向上させる,自己整合型音声指導による2段階後学習戦略を導入する。
実験結果から,DialectS2Sは複数の中国語方言の音声対話において,既存のベースラインを一貫して上回り,方言の整合性,応答品質,発話の可知性を大幅に向上させることがわかった。
我々の研究は、低リソースの方言シナリオにおけるエンドツーエンドの音声対話モデリングのための効率的でスケーラブルなソリューションを提供する。
今後の研究と実用化を容易にするため、モデルチェックポイント、データセットのトレーニング、微調整コードを含むDialectS2Sフレームワークをオープンソース化しました。
関連論文リスト
- MOSS-TTSD: Text to Spoken Dialogue Generation [62.04179716555789]
複数の言語にまたがる多人数会話音声のための音声対話合成モデルであるMOSS-TTSDを提案する。
長文モデリングの強化により、MOSS-TTSDは明示的な話者タグを持つ対話スクリプトから長文音声対話を生成する。
このモデルは、英語や中国語を含む様々な主流言語をサポートし、いくつかの長文のシナリオに適応している。
論文 参考訳(メタデータ) (2026-03-20T08:23:31Z) - RealTalk-CN: A Realistic Chinese Speech-Text Dialogue Benchmark With Cross-Modal Interaction Analysis [15.473595594666751]
本稿では,中国初のマルチターン・マルチドメイン音声文二重モーダルTODデータセットであるRealTalk-CNを紹介する。
RealTalk-CNは、注釈付き自然発話不一致を伴う多様な対話シナリオをキャプチャする。
本稿では,実世界のユーザインタラクションを忠実にシミュレートする,新しいクロスモーダルチャットタスクを提案する。
論文 参考訳(メタデータ) (2025-08-06T13:12:57Z) - Aligning Spoken Dialogue Models from User Interactions [55.192134724622235]
本稿では,ユーザの対話からリアルタイム会話における音声対話モデルを改善するための新しい嗜好アライメントフレームワークを提案する。
AIフィードバックを付加した生のマルチターン音声会話から15万以上の好みペアのデータセットを作成する。
本研究は, 自然なリアルタイム音声対話システムにおいて重要な, 様々な力学におけるバランスの整合性の重要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-26T16:45:20Z) - SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation [56.683846056788326]
本稿では,自発音声対話gEnerationのためのSLMとLLMの統合を提案する。
本研究では,テキスト対話を音素シーケンスに変換し,音素の持続時間を予測するために2tower変換器を用いた継続時間予測手法を提案する。
Fisherデータセットを用いた実験結果から,本システムは高意味的コヒーレンスを維持しつつ,自然な音声対話を生成可能であることが示された。
論文 参考訳(メタデータ) (2025-01-01T11:11:07Z) - WavChat: A Survey of Spoken Dialogue Models [66.82775211793547]
GPT-4oのようなシステムで実証された音声対話モデルの最近の進歩は、音声領域において大きな注目を集めている。
これらの高度な音声対話モデルは、音声、音楽、その他の音声関連の特徴を理解するだけでなく、音声のスタイリスティックな特徴や音節的な特徴も捉える。
音声対話システムの進歩にもかかわらず、これらのシステムを体系的に組織化し分析する包括的調査が欠如している。
論文 参考訳(メタデータ) (2024-11-15T04:16:45Z) - Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation [46.93969003104427]
本稿では,広範な音声テキストLLMフレームワークである統一音声対話モデル(USDM)を紹介する。
USDMは、与えられた入力音声に関連する自然な韻律的特徴を持つコヒーレントな音声応答を生成するように設計されている。
提案手法は,従来のベースラインとカスケードベースラインを超越した自然な音声応答を効果的に生成する。
論文 参考訳(メタデータ) (2024-02-08T14:35:09Z) - Acoustic Modeling for End-to-End Empathetic Dialogue Speech Synthesis
Using Linguistic and Prosodic Contexts of Dialogue History [38.65020349874135]
本稿では,エンド・ツー・エンド対話音声合成(DSS)モデルを提案する。
本モデルは,適切な対話コンテキストを予測するための言語的特徴と韻律的特徴の履歴によって条件付けられている。
共感的DSSモデルを効果的に訓練するために,1) 大規模音声コーパスで事前訓練された自己教師型学習モデル,2) 対話コンテキスト埋め込みによって予測される現在の発話の韻律埋め込みを用いたスタイル誘導学習,3) テキストと音声のモダリティを結合するクロスモーダルな注意,4) 発話のワイドなモデリングよりもきめ細かな韻律モデリングを実現するための文の埋め込みについて検討する。
論文 参考訳(メタデータ) (2022-06-16T09:47:25Z) - "How Robust r u?": Evaluating Task-Oriented Dialogue Systems on Spoken
Conversations [87.95711406978157]
本研究は、音声タスク指向会話における新しいベンチマークを示す。
マルチドメイン対話状態追跡と知識基底型対話モデルについて検討する。
我々のデータセットは,タスク指向対話システムの音声によるベンチマークを可能にする。
論文 参考訳(メタデータ) (2021-09-28T04:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。