論文の概要: Phone Segmentation and Recognition through Phonological Activation Mapping
- arxiv url: http://arxiv.org/abs/2607.09020v1
- Date: Fri, 10 Jul 2026 01:05:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.761901
- Title: Phone Segmentation and Recognition through Phonological Activation Mapping
- Title(参考訳): 音韻的アクティベーションマッピングによる音声のセグメンテーションと認識
- Authors: Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh, Chin-Jou Li, Eunjung Yeo, Daisuke Saito, Nobuaki Minematsu, Shinji Watanabe, Jian Zhu, David Harwath, David R. Mortensen,
- Abstract要約: 携帯電話のセグメンテーションと認識は本質的に関連するタスクであるが、現代のアプローチは通常それらを個別にモデル化する。
我々は、音声構造が自己教師型音声モデル(S3M)の表現にすでに潜んでいることを論じる。
我々は,各S3M表現フレームを発声やナジーナリティなどの音韻的特徴活性化のベクトルにマッピングするSPAM(Phonological Activation Mapping)を利用する。
- 参考スコア(独自算出の注目度): 76.99244720091627
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Phone segmentation and recognition are inherently related tasks, yet modern approaches typically model them separately. We argue that phonetic structure is already latent in the representations of self-supervised speech models (S3Ms), and one only needs to steer them to solve both tasks. We leverage S3M-based Phonological Activation Mapping (SPAM), which maps each S3M representation frame to a vector of phonological feature activations, such as voicing and nasality. On top of SPAM, we introduce two simple but effective lightweight, gradient-descent-free prediction heads: a recognition head and a segmentation head. Our method requires less than a minute of phonetic transcriptions, and generalizes to unseen phones during training. Across a diverse range of datasets, our approach attains strong segmentation and recognition performance.
- Abstract(参考訳): 携帯電話のセグメンテーションと認識は本質的に関連するタスクであるが、現代のアプローチは通常それらを個別にモデル化する。
我々は、音声構造が自己教師型音声モデル(S3M)の表現にすでに潜んでいることを論じる。
我々は,各S3M表現フレームを発声やナジーナリティなどの音韻的特徴活性化のベクトルにマッピングするSPAM(Phonological Activation Mapping)を利用する。
また,SPAM上には,認識ヘッドとセグメンテーションヘッドという2つの単純な軽量で,勾配のない予測ヘッドを導入する。
本手法では1分以内の音声書き起こしを要し,訓練中に未確認の電話に一般化する。
多様なデータセットにまたがって、我々のアプローチは強力なセグメンテーションと認識性能を実現する。
関連論文リスト
- Self-Supervised Speech Representations are More Phonetic than Semantic [52.02626675137819]
自己教師付き音声モデル(S3Ms)は、音声応用の有効なバックボーンとなっている。
S3Msで符号化された単語レベルの言語特性のよりきめ細かい分析を求める。
本研究により,S3M表現は意味的類似性よりも連続的かつ顕著に音声的類似性を示すことが明らかとなった。
論文 参考訳(メタデータ) (2024-06-12T20:04:44Z) - Auxiliary Tasks Enhanced Dual-affinity Learning for Weakly Supervised
Semantic Segmentation [79.05949524349005]
AuxSegNet+は、サリエンシマップから豊富な情報を探索する弱教師付き補助学習フレームワークである。
また,サリエンシとセグメンテーションの特徴マップから画素レベルの親和性を学習するためのクロスタスク親和性学習機構を提案する。
論文 参考訳(メタデータ) (2024-03-02T10:03:21Z) - Learning Speech Representation From Contrastive Token-Acoustic
Pretraining [57.08426714676043]
本研究では、2つのエンコーダを用いて音素と音声を複数モーダル空間に導入するCTAP(Contrastive Token-Acoustic Pretraining)を提案する。
提案したCTAPモデルは、210k音声と音素ペアで訓練され、最小教師付きTS、VC、ASRを実現する。
論文 参考訳(メタデータ) (2023-09-01T12:35:43Z) - Representation Learning With Hidden Unit Clustering For Low Resource
Speech Applications [37.89857769906568]
本稿では,隠れ単位クラスタリング(HUC)フレームワークを用いた生音声からの自己教師付き表現学習のアプローチについて述べる。
モデルへの入力は、ウィンドウ化され、1次元畳み込み層で処理されるオーディオサンプルで構成されている。
HUCフレームワークは、表現を少数の音素のような単位に分類することができ、意味的に豊かな表現を学ぶためのモデルを訓練するために使用される。
論文 参考訳(メタデータ) (2023-07-14T13:02:10Z) - What Do Self-Supervised Speech Models Know About Words? [23.163029143563893]
自己教師型音声モデル(S3Ms)はここ数年で導入され、様々な音声タスクの性能とデータ効率が改善されている。
最近の研究は、S3Mが音声情報や話者情報などの特定の特性をエンコードする方法の分析を始めている。
我々は,S3Msで符号化されたセグメントレベルの言語特性を研究するために,軽量な解析手法を用いた。
論文 参考訳(メタデータ) (2023-06-30T22:36:41Z) - HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion
Recognition [41.837538440839815]
マルチモーダル感情認識のための階層的クロスアテンションモデル(HCAM)を提案する。
モデルへの入力は、学習可能なwav2vecアプローチによって処理される2つのモーダルデータと、変換器(BERT)モデルからの双方向エンコーダ表現を用いて表現されるテキストデータからなる。
文脈知識と2つのモードにまたがる情報を組み込むため、音声とテキストの埋め込みはコアテンション層を用いて結合される。
論文 参考訳(メタデータ) (2023-04-14T03:25:00Z) - Learning Phone Recognition from Unpaired Audio and Phone Sequences Based
on Generative Adversarial Network [58.82343017711883]
そこで本研究では,不適切な音声系列や発話から直接学習する方法について検討する。
GAN訓練を第1段階に導入し,無声音声と音声シーケンスのマッピング関係を求める。
第2段階では、発電機の出力からトレーニングするために別のHMMモデルが導入され、性能が向上する。
論文 参考訳(メタデータ) (2022-07-29T09:29:28Z) - Self-Supervised Speech Representation Learning: A Review [105.1545308184483]
自己教師付き表現学習法は、幅広いタスクやドメインに利益をもたらす単一の普遍的モデルを約束する。
音声表現学習は、生成的、コントラスト的、予測的という3つの主要なカテゴリで同様の進歩を経験している。
本稿では,自己指導型音声表現学習のアプローチと,他の研究領域との関係について述べる。
論文 参考訳(メタデータ) (2022-05-21T16:52:57Z) - Phoneme Boundary Detection using Learnable Segmental Features [31.203969460341817]
音素境界検出は様々な音声処理アプリケーションにおいて重要な第一歩となる。
本稿では,音素境界検出タスクのセグメント表現を学習するために,パラメータ化された構造的損失関数と結合したニューラルアーキテクチャを提案する。
論文 参考訳(メタデータ) (2020-02-11T14:03:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。