論文の概要: Structured Phonological Representations for Audio-Articulatory rtMRI Speech Classification
- arxiv url: http://arxiv.org/abs/2608.09767v1
- Date: Mon, 10 Aug 2026 15:58:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.360255
- Title: Structured Phonological Representations for Audio-Articulatory rtMRI Speech Classification
- Title(参考訳): 音声・調音 rtMRI 音声分類のための構造的音韻表現法
- Abstract要約: リアルタイムMRIでは音声中の声道調音を観察できるが、これらの調音パターンを音韻・音韻のカテゴリーにマッピングすることは困難である。
構造的音韻特徴を認識するために訓練された音声ベースモデルであるPhonoQが、音響調音モデルに有用な情報を提供するかどうかを検討する。
- 参考スコア(独自算出の注目度): 9.697606604686817
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-time MRI makes it possible to observe vocal-tract articulation during speech, but mapping these articulatory patterns to phonetic and phonological categories remains challenging. We investigate whether PhonoQ, an audio-based model trained to recognize structured phonological features, provides useful information for audio--articulatory modeling. Specifically, we extract representations from PhonoQ's Conformer module, whose training is shaped by supervision for manner, place, voicing, and vowel features. Using articulatory contours with synchronized audio-derived features, we compare WavLM-large and HuBERT-large baselines with models that incorporate PhonoQ-derived representations. Across unseen-speech and unseen-subject settings, these features improve macro-F1 for phonological targets including manner, place, voicing, vowel height, and vowel backness, and also improve fine-grained 39-phoneme classification. In a contour-only inference setting, audio-derived teacher supervision yields modest but consistent gains over contour-only training, indicating that phonological information from synchronized audio can be partially transferred to articulatory models. Finally, posterior analyses show interpretable surface-sensitive patterns consistent with flapping-like /t/ realizations, /t/-/r/ retraction or affrication, and nasal place assimilation.
- Abstract(参考訳): リアルタイムMRIでは音声中の声道調音を観察できるが、これらの調音パターンを音韻・音韻のカテゴリーにマッピングすることは困難である。
構造的音韻特徴を認識するために訓練された音声ベースモデルであるPhonoQが、音響調音モデルに有用な情報を提供するかどうかを検討する。
具体的には, PhonoQ の Conformer モジュールから表現を抽出する。
音声を同期する特徴を持つ調音輪郭を用いて,WavLM-largeとHuBERT-largeのベースラインを,PhonoQ- derived representationを組み込んだモデルと比較する。
これらの特徴は、無音・無音・形容設定全体にわたって、音韻的対象の調音的対象に対するマクロF1の改善、音階、位置、発声、母音の高さ、母音のバックネスの向上、39音素のきめ細かい分類の改善などである。
輪郭のみの推論設定では、音声由来の教師監督は、輪郭のみの訓練よりも質素だが一貫した利得を得るので、同期音声からの音韻情報が部分的に調音モデルに転送可能であることを示す。
最後に, 後部分析では, 羽ばたきのような/t/実現, /t/-/r/除去, あるいは刺激, 鼻の場所同化と整合した解釈可能な表面感受性パターンを示した。
関連論文リスト
- UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions [55.622295453533475]
音声,音楽,音響効果を合成できる統合フローマッチングフレームワークUniSonateを紹介する。
本研究では,非構造環境音を時間潜在空間に投影する動的トークン注入機構を提案する。
実験により、UniSonateは、命令ベースのTSとTTMで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-04-24T04:26:04Z) - End-to-end Topographic Auditory Models Replicate Signatures of Human Auditory Cortex [6.412156163233532]
ヒトの聴覚的 fMRI 応答の予測において,皮質トポグラフィーは過去の最高性能モデルには存在しないことを示す。
地形組織の形成を促進するために,視覚知覚のために考案された皮質配線制約を適応させる。
TopoAudioは、初期地形を示す最初のエンド・ツー・エンドの生物学的基盤を持つ聴覚モデルである。
論文 参考訳(メタデータ) (2025-09-28T19:20:30Z) - Zero-shot text-to-speech synthesis conditioned using self-supervised
speech representation model [13.572330725278066]
提案手法の新たなポイントは、大量のデータで訓練された音声表現から組込みベクトルを得るためにSSLモデルを直接利用することである。
この不整合埋め込みにより、未知話者の再生性能が向上し、異なる音声によるリズム伝達が実現される。
論文 参考訳(メタデータ) (2023-04-24T10:15:58Z) - Towards Disentangled Speech Representations [65.7834494783044]
本研究では, ASR と TTS の合同モデリングに基づく表現学習タスクを構築する。
本研究は,その部分の音声信号と,その部分の音声信号とをアンタングルする音声表現を学習することを目的とする。
我々は,これらの特性をトレーニング中に強化することにより,WERを平均24.5%向上させることを示す。
論文 参考訳(メタデータ) (2022-08-28T10:03:55Z) - Self-supervised models of audio effectively explain human cortical
responses to speech [71.57870452667369]
我々は、自己教師型音声表現学習の進歩に乗じて、人間の聴覚システムの最先端モデルを作成する。
これらの結果から,ヒト大脳皮質における音声処理の異なる段階に関連する情報の階層構造を,自己教師型モデルで効果的に把握できることが示唆された。
論文 参考訳(メタデータ) (2022-05-27T22:04:02Z) - Fine-grained Noise Control for Multispeaker Speech Synthesis [3.449700218265025]
テキスト音声モデル(TTS)は、典型的には、内容、話者、韻律などの音声属性を非絡み合い表現に分解する。
近年の課題は, 音響条件を的確にモデル化することであり, 主要な音声要因を解消することである。
論文 参考訳(メタデータ) (2022-04-11T13:13:55Z) - Deep Neural Convolutive Matrix Factorization for Articulatory
Representation Decomposition [48.56414496900755]
この研究は、コンボリューティブスパース行列分解のニューラル実装を用いて、調音データを解釈可能なジェスチャーとジェスチャースコアに分解する。
音素認識実験も実施され、ジェスチャースコアが実際に音韻情報のコード化に成功していることが示された。
論文 参考訳(メタデータ) (2022-04-01T14:25:19Z) - Discretization and Re-synthesis: an alternative method to solve the
Cocktail Party Problem [65.25725367771075]
この研究は、初めて合成に基づくアプローチがこの問題にうまく対応できることを示した。
具体的には,離散シンボルの認識に基づく音声分離/強調モデルを提案する。
離散シンボルの入力による合成モデルを利用することで、離散シンボル列の予測後、各ターゲット音声を再合成することができる。
論文 参考訳(メタデータ) (2021-12-17T08:35:40Z) - Facetron: Multi-speaker Face-to-Speech Model based on Cross-modal Latent
Representations [22.14238843571225]
個人の顔の映像を条件付けして、話者固有の音声波形を合成する効果的な方法を提案する。
唇読解モデルを用いて唇の動きから言語的特徴を抽出し,顔画像から話者特性を予測する。
本稿では,従来の手法よりも客観評価と主観評価の両面において,提案手法の優位性を示す。
論文 参考訳(メタデータ) (2021-07-26T07:36:02Z) - Learning robust speech representation with an articulatory-regularized
variational autoencoder [13.541055956177937]
顎、舌、唇、椎骨の構成を記述する調音パラメータを声道形状およびスペクトル特徴と関連付けることができる調音モデルを開発する。
この調音制約は,収束までの時間を短縮し,コンバージェンスにおける再構成損失を低減し,モデルトレーニングを改善できることを示す。
論文 参考訳(メタデータ) (2021-04-07T15:47:04Z) - Any-to-Many Voice Conversion with Location-Relative Sequence-to-Sequence
Modeling [61.351967629600594]
本稿では,非並列音声変換手法である非並列音声変換法(seq2seq)を提案する。
本手法では,ボトルネック特徴抽出器(BNE)とセック2セック合成モジュールを組み合わせる。
主観的および主観的評価は,提案手法が自然性と話者類似性の両方において優れた音声変換性能を有することを示す。
論文 参考訳(メタデータ) (2020-09-06T13:01:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。