論文の概要: Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)
- arxiv url: http://arxiv.org/abs/2607.04154v1
- Date: Sun, 05 Jul 2026 07:42:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.842209
- Title: Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)
- Title(参考訳): 情報幾何学的重畳母音の評価 : 第1報 モライク音節(日本語)
- Authors: Yusei Tamura, Shigekazu Ishihara, Ken Ito,
- Abstract要約: 本稿では、FAKE人間の発話を区別する新しい手法の原理と実例を示す。
学習スペクトルの限られた集合からの情報に基づいて合成音声を生成するため、母音の多様性が制限される。
自然な音声は、人間の調音器官の柔軟性により、より多様な母音スペクトルの分布を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This paper explains the principles and provides examples of a new method for distinguishing between FAKE human speech synthesized by generative AI and natural speech. Since synthetic speech is generated based on information from a limited set of training spectra, the variety of vowels - which are key to identifying individuals - is limited. In contrast, natural speech exhibits a more diverse distribution of vowel spectra due to the flexibility of the human articulatory organ. In this paper, using Japanese - a Syllabary limited to five vowel phonemes, each of which corresponds one-to-one with a specific sound - as an example, we outline a method for distinguishing between synthetic and natural speech reading the same text by analyzing the spectral distributions. If we normalize the spectra of speech sounds and regard them as probability density functions for the frequency bands received by the hair cells of the human cochlea, and evaluate the distance between spectra using the Wasserstein metric, the Wasserstein distances between the vowels of synthetic speech are short. By preserving this distance and performing a topological mapping using persistent homology, the spectral probability density functions of synthetic and natural speech can be decomposed into clusters.
- Abstract(参考訳): 本稿では、生成AIによって合成されたFAKE音声と自然言語を区別する新しい手法の原理と実例を示す。
限られた訓練スペクトルからの情報に基づいて合成音声を生成するため、個人を特定するための鍵となる母音の種類は限られている。
対照的に、自然な音声は、人間の関節器官の柔軟性による母音スペクトルのより多様な分布を示す。
本稿では,1対1の音に対応する5つの母音音素に制限された日本語の音節を用いて,スペクトル分布を解析して,同じテキストを読み取る合成音声と自然な音声を区別する方法を概説する。
音声のスペクトルを正規化し、それを人間の耳道の毛髪細胞から受信される周波数帯域の確率密度関数とみなし、ワッサーシュタイン計量を用いてスペクトル間の距離を評価すると、合成音声の母音間のワッサーシュタイン距離は短い。
この距離を保存し、永続ホモロジーを用いて位相マッピングを行うことで、合成音声と自然な音声のスペクトル確率密度関数をクラスタに分解することができる。
関連論文リスト
- VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech
Synthesis [43.369048727268506]
VoxGenesisは、教師なし音声合成フレームワークである。
教師なしで潜在話者多様体と有意義な音声編集方向を見つけることができる。
本稿では,VoxGenesisが従来のアプローチとは大きく異なる特徴を持つ,より多彩で現実的な話者を生成することを示す。
論文 参考訳(メタデータ) (2024-03-01T13:39:56Z) - Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and
Phoneme Duration for Multi-Speaker Speech Synthesis [16.497022070614236]
本稿では,ターゲット話者による発話数を用いて,音素長をモデル化するための音声リズムに基づく話者埋め込み手法を提案する。
提案手法の新たな特徴は、音素とその持続時間から抽出されたリズムに基づく埋め込みであり、発声リズムに関連することが知られている。
論文 参考訳(メタデータ) (2024-02-11T02:26:43Z) - EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech
Resynthesis [49.04496602282718]
テキストなし音声合成のための高品質な表現型音声データセットであるExpressoを紹介する。
このデータセットは、26の自発的表現スタイルで描画された読み上げ音声と即興対話の両方を含む。
自己監督型離散エンコーダの自動計測値を用いて再生品質を評価する。
論文 参考訳(メタデータ) (2023-08-10T17:41:19Z) - DSVAE: Interpretable Disentangled Representation for Synthetic Speech
Detection [25.451749986565375]
合成音声を検出するための音声信号の解釈可能な表現を生成するために,Dis Spectrogram Variational Autoentangle (DSVAE)を提案する。
実験の結果, 未知音声合成者11名中6名中10名中98%が, 高い精度 (>98%) を示した。
論文 参考訳(メタデータ) (2023-04-06T18:37:26Z) - Evaluating and reducing the distance between synthetic and real speech
distributions [8.908425534666353]
現代のテキスト音声合成システムは、自然な音声を生成することができるが、自然な音声データに見られる完全な多様性を再現することはできない。
発話レベルの統計量を用いて,実音声と合成音声の距離を定量化する。
最適システムは分布距離を10%削減する。
論文 参考訳(メタデータ) (2022-11-29T09:50:24Z) - Direct speech-to-speech translation with discrete units [64.19830539866072]
本稿では、中間テキスト生成に頼ることなく、ある言語から別の言語に音声を変換する直接音声音声翻訳(S2ST)モデルを提案する。
そこで本稿では,ラベルなし音声コーパスから学習した自己教師付き離散表現の予測を提案する。
対象のテキスト書き起こしが利用可能となると、同一の推論パスで2つのモード出力(音声とテキスト)を同時に生成できる、共同音声認識とテキストトレーニングを備えたマルチタスク学習フレームワークを設計する。
論文 参考訳(メタデータ) (2021-07-12T17:40:43Z) - Ctrl-P: Temporal Control of Prosodic Variation for Speech Synthesis [68.76620947298595]
テキストは音声形式を完全には規定しないので、テキストから音声へのモデルは、対応するテキストで説明されない方法で異なる音声データから学習できなければならない。
韻律の3つの一次音響相関に明示的に条件付けされた音声を生成するモデルを提案する。
論文 参考訳(メタデータ) (2021-06-15T18:03:48Z) - Speech Resynthesis from Discrete Disentangled Self-Supervised
Representations [49.48053138928408]
音声合成作業に自己教師付き離散表現を用いることを提案する。
音声コンテンツ、韻律情報、話者識別のための低ビット表現を抽出する。
得られた表現を使用することで、ベースラインメソッドよりも優れた音声品質を提供しながら、毎秒365ビットのレートが得られる。
論文 参考訳(メタデータ) (2021-04-01T09:20:33Z) - Vector-Quantized Timbre Representation [53.828476137089325]
本稿では, スペクトル特性の近似分解を生成的特徴の集合で学習することにより, 個々の音色をより柔軟に合成することを目的とする。
音量分布の量子化表現を学習するために、大音量から切り離された離散潜在空間を持つオートエンコーダを導入する。
オーケストラ楽器と歌唱音声間の音声の翻訳結果と、ボーカルの模倣音から楽器への変換結果について詳述する。
論文 参考訳(メタデータ) (2020-07-13T12:35:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。