論文の概要: Vocal Music under Phoneme-Conditional Analysis
- arxiv url: http://arxiv.org/abs/2608.30823v1
- Date: Mon, 31 Aug 2026 14:03:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.430273
- Title: Vocal Music under Phoneme-Conditional Analysis
- Title(参考訳): 音素連続分析による声道音楽
- Authors: Hayoon Kim, Kyogu Lee,
- Abstract要約: 音素条件解析を用いて,音素の音響的影響について検討する。
9つの類型的多様言語と数千曲の歌にまたがって、5つの音響次元に沿って効果を測定する。
その結果,音韻構造は各言語がどのように歌われているかを計測可能な痕跡を残していることが示唆された。
- 参考スコア(独自算出の注目度): 29.619759892670306
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The vocal music of each language carries a distinctive sonic identity, even without instrumental accompaniment. We ask whether these differences are measurable and traceable to specific phonemes. To tackle this question, we introduce phoneme-conditional analysis, which isolates the acoustic effect of typologically distinctive phonemes by comparing marker syllables against matched non-marker controls within the same song, holding singer, melody, and genre constant. Across nine typologically diverse languages and thousands of songs, we measure effects along five acoustic dimensions. Song-level profiles built from these effects identify the language of an unaccompanied vocal at 85.5% balanced accuracy in a nine-way classification with folds grouped by artist; whether the separability arises by accumulation of the phoneme-local effects themselves is left open. Our findings suggest that phonological structure leaves systematic and measurable traces in how each language is sung.
- Abstract(参考訳): それぞれの言語の声楽は、器楽伴奏なしでも独特なソニック・アイデンティティを持つ。
これらの違いが特定の音素に対して測定可能でトレース可能かどうかを問う。
この問題に対処するために,音素条件解析を導入し,同じ歌の中の一致した非マーカー制御と比較し,シンガー,メロディ,ジャンル定数を保持することで,音素の音素の音響的効果を分離する。
9つの類型的多様言語と数千曲の歌にまたがって、5つの音響次元に沿って効果を測定する。
これらの効果から構築された歌声レベルプロファイルは、アーティストによってグループ化された折りたたみの9方向分類において85.5%の精度で伴奏のない声の言語を識別する。
その結果,音韻構造は各言語がどのように歌われているかの体系的および測定可能な痕跡を残していることが示唆された。
関連論文リスト
- Open-Source Intelligence and Music Information Retrieval for Geographic Attribution of Musical Affect and the Ecological Limits of Population Inference [0.0]
メロディック構造におけるクロスカントリーの違いは、大きく、非常に重要である。
試験された8つの特徴は全てp0.001で国によって異なり、跳躍関連の特徴はp10-90に達する。
中国は顕著な広帯域かつ高活動的な署名を持っている。
論文 参考訳(メタデータ) (2026-07-14T08:51:32Z) - Beyond bouba/kiki: Multidimensional semantic signals are deeply woven into the fabric of natural language [0.0]
英語の個々の文字音素が構造化された多次元意味信号を持っていることを示す。
本研究は,音意味の象徴性は時折好奇心ではなく,音韻信号の広範で構造的な性質であることを示す。
論文 参考訳(メタデータ) (2026-03-18T03:02:10Z) - GTSinger: A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks [52.30565320125514]
GTSingerは、グローバルで、多技術で、無料で使える、高品質な歌唱コーパスで、リアルな音楽スコアがある。
高品質な歌声を80.59時間収集し、最大の歌唱データセットを形成する。
我々は,技術制御可能な歌唱音声合成,技術認識,スタイル伝達,音声歌唱変換の4つのベンチマーク実験を行った。
論文 参考訳(メタデータ) (2024-09-20T18:18:14Z) - A Phoneme-Informed Neural Network Model for Note-Level Singing
Transcription [11.951441023641975]
本稿では,歌唱の言語的特徴を活用して,より正確に歌唱音声の音節オンセットを見つける方法を提案する。
本手法は, 歌唱文の書き起こし性能を大幅に向上させ, 歌唱分析における言語的特徴の重要性を強調している。
論文 参考訳(メタデータ) (2023-04-12T15:36:01Z) - Multilingual analysis of intelligibility classification using English,
Korean, and Tamil dysarthric speech datasets [4.486141167325431]
本稿では,異なる韻律システムを持つ3言語(英語,韓国語,タミル語)の変形音声データセットを解析する。
音声品質,発音,韻律の3次元を反映した39の音響測定を行った。
論文 参考訳(メタデータ) (2022-09-27T09:00:41Z) - Differentiable Allophone Graphs for Language-Universal Speech
Recognition [77.2981317283029]
言語ユニバーサル音声認識システムを構築するには、言語間で共有可能な音声の音韻単位を生成する必要がある。
本稿では,音素転写と音声-音素マッピングのみから,音素レベルの監視を導出するための一般的な枠組みを提案する。
我々は,各言語に対する可読確率的音声-音素マッピングを用いた普遍的な電話ベース音声認識モデルを構築した。
論文 参考訳(メタデータ) (2021-07-24T15:09:32Z) - Phoneme Recognition through Fine Tuning of Phonetic Representations: a
Case Study on Luhya Language Varieties [77.2347265289855]
音韻アノテーションに基づく多言語認識手法であるAllosaurus を用いた音素認識に焦点を当てた。
挑戦的な実世界シナリオで評価するために,我々は,ケニア西部とウガンダ東部のluhya言語クラスタの2つの種類であるbukusuとsaamiaの音声認識データセットをキュレートした。
私たちは、アロサウルスの微調整がわずか100発話であっても、電話のエラー率を大幅に改善することが分かりました。
論文 参考訳(メタデータ) (2021-04-04T15:07:55Z) - Phonotactic Complexity and its Trade-offs [73.10961848460613]
この単純な測度により、言語間のエントロピーを比較することができる。
音素あたりのビット数と単語の平均長との間には-0.74の非常に強い負の相関関係を示す。
論文 参考訳(メタデータ) (2020-05-07T21:36:59Z) - Universal Phone Recognition with a Multilingual Allophone System [135.2254086165086]
言語に依存しない音素分布と言語に依存しない音素分布の連成モデルを提案する。
11言語での多言語ASR実験では、このモデルにより2%の音素誤り率でテスト性能が向上することがわかった。
我々の認識器は17%以上の精度向上を実現し、世界中のすべての言語で音声認識に一歩近づいた。
論文 参考訳(メタデータ) (2020-02-26T21:28:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。