論文の概要: Synthetic Speech, Real Signal: Paralinguistic Preservation and Cross-Lingual Augmentation via Voice Cloning
- arxiv url: http://arxiv.org/abs/2607.22304v1
- Date: Fri, 24 Jul 2026 13:46:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.138108
- Title: Synthetic Speech, Real Signal: Paralinguistic Preservation and Cross-Lingual Augmentation via Voice Cloning
- Title(参考訳): 合成音声, 実信号: 音声クローニングによるパラ言語的保存と言語間拡張
- Abstract要約: パブリックデータセットと臨床データセットにまたがる5つのパラ言語課題に対して,8つの音声クローンモデルをベンチマークした。
次に、英語の臨床音声を日本語にコピーし、クローン化されたデータの訓練が抑うつや不安検出のための言語間移動より優れていることを発見した。
- 参考スコア(独自算出の注目度): 34.17169366465841
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synthetic data augmentation in speech is common practice for linguistic tasks like ASR, but has seen far less work for paralinguistic ones, especially clinical tasks where labelled data is expensive and some patient groups are underrepresented. Voice cloning is one such augmentation approach, but is typically evaluated on speech intelligibility (WER) or speaker similarity (SS) rather than on downstream performance, and it remains unclear whether these preserve the paralinguistic signal such tasks depend on. We benchmark eight voice cloning models on five paralinguistic tasks across public and clinical datasets, showing most preserve signal with modest degradation. We then clone English clinical speech into Japanese and find that training on cloned data outperforms raw cross-lingual transfer for depression and anxiety detection on real Japanese speech, suggesting voice cloning is a promising direction for augmenting clinical speech data in low-resource languages.
- Abstract(参考訳): 音声における合成データ拡張は、ASRのような言語的タスクでは一般的な慣行であるが、パラ言語的タスク、特にラベル付きデータが高価であり、一部の患者群が不足している臨床タスクでは、はるかに少ない作業が見られた。
音声のクローン化はそのような拡張手法の1つであるが、典型的には下流の性能よりも音声のインテリジェンス(WER)や話者類似度(SS)に基づいて評価される。
我々は,公用および臨床用データセットにまたがる5つのパラ言語的タスクに対して8つの音声クローンモデルをベンチマークし,モデム劣化を伴う最も保存的な信号を示す。
次に、英語の音声を日本語にコピーし、クローンデータによる訓練は、実際の日本語音声における抑うつや不安検出のための生の言語間移動よりも優れており、音声のクローニングは低リソース言語における臨床音声データの増強に有望な方向であることを示唆する。
関連論文リスト
- Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction [6.724673957306738]
音声認識による認知スコアの予測を改善するために,大規模言語モデル(LLM)によるデータ拡張フレームワークを提案する。
日本語コーパスにおいて,各被験者が自発的な口頭物語と同一の臨床的刺激に対する書面応答の両方を提示する実験を行った。
論文 参考訳(メタデータ) (2026-05-15T15:39:22Z) - Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease [72.0406069194794]
音声表現は、しばしば言語に依存した構造を符号化する。
本稿では,ソース言語による自己教師型音声表現とターゲット言語分布とを一致させる表現レベル言語シフトを提案する。
チェコ語,ドイツ語,スペイン語におけるパーキンソン病音声データセットの経口DDK記録に対するアプローチについて検討した。
論文 参考訳(メタデータ) (2026-03-23T17:23:39Z) - SITA: Learning Speaker-Invariant and Tone-Aware Speech Representations for Low-Resource Tonal Languages [11.655315357810371]
SITAは、事前訓練されたwav2vecスタイルのエンコーダに対して、話者不変性とトーン認識を強制する軽量な適応レシピである。
音色を効果的に表現できない多言語エンコーダであるHmongを主眼として評価した。
論文 参考訳(メタデータ) (2026-01-14T00:42:27Z) - Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages [49.31519786009296]
音声変換モデルを英語の変形音声(UASpeech)に微調整し、話者特性と韻律歪みの両方を符号化する。
次に、健康な非英語音声(FLEURS)を非英語の変形性音声に変換する。
生成されたデータは、MMS(Massively Multilingually Speech)と呼ばれる多言語ASRモデルの微調整に使用される。
論文 参考訳(メタデータ) (2025-05-20T20:03:45Z) - Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology [0.0]
本研究は, 変形性関節症患者の独特のパターンを再現した合成音声を生成するために, 音声クローニングについて検討する。
TORGOデータセットを用いて,言語病理学におけるデータ不足とプライバシー問題に対処する。
我々は,義歯の音声とコントロールスピーカーの音声を商業的プラットフォームでクローンし,性別に適合した合成音声を保証した。
論文 参考訳(メタデータ) (2025-03-03T07:44:49Z) - Cross-Lingual Transfer Learning for Speech Translation [7.802021866251242]
本稿では,制限データを用いた音声基礎モデルの音声翻訳機能の拡張について検討する。
Whisperは、音声認識と英訳に強い性能を持つ音声基礎モデルであり、その例として用いられる。
音声から音声への検索を用いて,エンコーダが生成した音声表現を分析し,異なる言語からの発話を共有意味空間にマッピングすることを示す。
論文 参考訳(メタデータ) (2024-07-01T09:51:48Z) - Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer [53.72998363956454]
個別の自己教師付き表現を用いた音声音声合成(S2ST)は顕著な精度を達成している。
高品質な話者並列データの不足は、翻訳中にスタイル転送を学習する上での課題となる。
我々は、個別の自己教師付き音声表現と音色単位に基づいて、スタイル変換機能を備えたS2STパイプラインを設計する。
論文 参考訳(メタデータ) (2023-09-14T09:52:08Z) - Learning Cross-lingual Visual Speech Representations [108.68531445641769]
言語横断的な自己監督型視覚表現学習は、ここ数年、研究トピックとして成長している。
我々は最近提案したRAVEn(Raw Audio-Visual Speechs)フレームワークを用いて,未ラベルデータを用いた音声-視覚モデルの事前学習を行う。
1)データ量が多いマルチ言語モデルはモノリンガルモデルよりも優れているが、データの量を維持すると、モノリンガルモデルの性能が向上する傾向にある。
論文 参考訳(メタデータ) (2023-03-14T17:05:08Z) - Zero-Shot Cross-lingual Aphasia Detection using Automatic Speech
Recognition [3.2631198264090746]
失語症(英: Aphasia)は、一般的には脳損傷や脳卒中によって引き起こされる言語障害であり、世界中の何百万人もの人々に影響を及ぼす。
本稿では,言語間音声表現を共用する事前学習型自動音声認識(ASR)モデルを用いたエンドツーエンドパイプラインを提案する。
論文 参考訳(メタデータ) (2022-04-01T14:05:02Z) - Meta-Voice: Fast few-shot style transfer for expressive voice cloning
using meta learning [37.73490851004852]
テキスト音声合成(TTS)における音声クローンのための少数ショットスタイル転送の課題は、非常に限られた量の中立データを用いて、任意の音源話者の発話スタイルをターゲット話者の音声に転送することを目的としている。
学習アルゴリズムは、数発の音声クローンと話者/韻律のアンタングルを同時に扱う必要があるため、これは非常に難しい作業である。
本稿では,メタラーニングを用いた音声のクローン処理のための高速な数ショットスタイル転送手法を提案する。
論文 参考訳(メタデータ) (2021-11-14T01:30:37Z) - Cross-lingual Transfer for Speech Processing using Acoustic Language
Similarity [81.51206991542242]
言語間の移動は、このデジタル分割を橋渡しする魅力的な方法を提供する。
現在の言語間アルゴリズムは、テキストベースのタスクや音声関連タスクを低リソース言語で実現している。
本稿では,数百の言語をまたがる音響的言語間移動対を効率的に同定する言語類似性手法を提案する。
論文 参考訳(メタデータ) (2021-11-02T01:55:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。