論文の概要: Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization
- arxiv url: http://arxiv.org/abs/2607.04064v1
- Date: Sun, 05 Jul 2026 00:39:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.809957
- Title: Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization
- Title(参考訳): Syllabic Tokenizationのための話者分散チャンクワイズ回帰
- Abstract要約: 教師なしシラビックトークン化は、生音声から潜在言語コンテンツ関連構造をキャプチャする離散シラビックトークンを学習することを目的としている。
近年のシラバストークン化手法では,教師が学習したHuBERTを蒸留して,潜在音声フレーム表現をシラバスセグメントに整理する手法が提案されている。
そこで本研究では, 教師対象を一定長のチャンク内に配置し, 教師対象に適応する話者分散型シラビック・トークンーザを提案する。
- 参考スコア(独自算出の注目度): 14.571581599991331
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unsupervised syllabic tokenization aims to learn discrete syllabic tokens that capture latent linguistic content-related structure from raw speech. Recent syllabic tokenization methods employ teacher-student distillation of the pretrained HuBERT to organize latent speech frame representations into syllabic segments. However, when trained with an utterance-level cross-entropy objective, the model predicts speaker identity rather than linguistic content, thereby compromising the purity of syllabic tokens. To address this problem, we propose a speaker-disentangled syllabic tokenizer that regresses speaker-perturbed student representations toward clean teacher targets within fixed-length chunks. Experimental results demonstrate that our proposed method achieves state-of-the-art performance in syllable boundary detection and syllabic segment clustering. Moreover, a speech language model trained on our syllabic tokens achieves a 7% relative improvement in syntactic and semantic understanding over the phone-level SpiRit-LM.
- Abstract(参考訳): 教師なしシラビックトークン化は、生音声から潜在言語コンテンツ関連構造をキャプチャする離散シラビックトークンを学習することを目的としている。
近年のシラバストークン化手法では,教師が学習したHuBERTを蒸留して,潜在音声フレーム表現をシラバスセグメントに整理する手法が提案されている。
しかし、発話レベルのクロスエントロピーの目標を用いて訓練すると、モデルは言語的内容よりも話者のアイデンティティを予測し、シラバストークンの純度を損なう。
この問題に対処するために,固定長チャンク内のクリーンな教師対象に向けて,話者が摂動する学生表現を回帰する話者分散シラビックトークンーを提案する。
実験により,提案手法は音節境界検出と音節セグメントクラスタリングにおける最先端性能を実現することを示す。
さらに,音節トークンに基づいて学習した音声モデルは,音声レベルのSpiRit-LMに対する構文的・意味的理解において,7%の相対的な改善を実現している。
関連論文リスト
- Speech Codec Probing from Semantic and Phonetic Perspectives [49.01048570474675]
音声トークン化器は,マルチモーダルシステムにおいて,音声を大言語モデル (LLM) に接続するために必須である。
新たな証拠は、音声表現において「意味」と呼ばれるものは、テキスト由来の意味論と一致しないことを示している。
論文 参考訳(メタデータ) (2026-03-11T03:32:25Z) - Sylber: Syllabic Embedding Representation of Speech from Raw Audio [25.703703711031178]
クリーンでロバストな音節構造を持つ音声表現を生成する新モデルSylberを提案する。
具体的には,Syllabicの埋め込みを自己教師なしのSyllabicセグメンテーションから抽出し,自己教師付き学習フレームワークを提案する。
1) 高速で線形な音節分割アルゴリズム,2) 平均4.27トークン毎の効率的な音節トークン化,3) 効率的な音声言語モデリングに適した新しい音韻単位,である。
論文 参考訳(メタデータ) (2024-10-09T17:59:04Z) - Self-Supervised Syllable Discovery Based on Speaker-Disentangled HuBERT [10.18337180909434]
非転写音声から意味のある特徴を抽出するためには,自己教師付き音声表現学習が不可欠である。
本稿では,音節単位を話者情報から分離する,音声のみの自己教師型微調整手法を提案する。
論文 参考訳(メタデータ) (2024-09-16T09:07:08Z) - Towards Unsupervised Speech Recognition Without Pronunciation Models [57.222729245842054]
本稿では,ペア音声とテキストコーパスを使わずにASRシステムを開発するという課題に取り組む。
音声合成とテキスト・テキスト・マスクによるトークン埋込から教師なし音声認識が実現可能であることを実験的に実証した。
この革新的なモデルは、レキシコンフリー環境下での以前の教師なしASRモデルの性能を上回る。
論文 参考訳(メタデータ) (2024-06-12T16:30:58Z) - SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT [45.729377551100676]
音声の文レベル表現の学習において,音節的組織が出現することを示す。
本稿では,音声の文レベル表現を評価するための新しいベンチマークタスクであるSpken Speech ABXを提案する。
論文 参考訳(メタデータ) (2023-10-16T20:05:36Z) - Audio-Visual Neural Syntax Acquisition [91.14892278795892]
視覚的音声からの句構造誘導について検討する。
本稿では,音声を聴いたり,画像を見たりすることでフレーズ構造を学習するAV-NSL(Audio-Visual Neural Syntax Learner)について述べる。
論文 参考訳(メタデータ) (2023-10-11T16:54:57Z) - Learning Speech Representation From Contrastive Token-Acoustic
Pretraining [57.08426714676043]
本研究では、2つのエンコーダを用いて音素と音声を複数モーダル空間に導入するCTAP(Contrastive Token-Acoustic Pretraining)を提案する。
提案したCTAPモデルは、210k音声と音素ペアで訓練され、最小教師付きTS、VC、ASRを実現する。
論文 参考訳(メタデータ) (2023-09-01T12:35:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。