論文の概要: Probing in the Wild: A Case Study of Self-Supervised Speech Representations on Mandarin Sub-dialects with Unsupervised Articulatory Analysis
- arxiv url: http://arxiv.org/abs/2606.25459v1
- Date: Wed, 24 Jun 2026 06:39:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.247605
- Title: Probing in the Wild: A Case Study of Self-Supervised Speech Representations on Mandarin Sub-dialects with Unsupervised Articulatory Analysis
- Title(参考訳): 野生におけるプロブリング:教師なし調音分析によるマンダリンサブダイアレクトの自己教師付き音声表現の一事例
- Abstract要約: 本稿では,全くラベルのない探索パイプラインを用いたマンダリン自己教師音声モデルにおける調音特徴表現のケーススタディを提案する。
以上の結果から,マンダリンサブディレクトにまたがる調音的特徴デオードビリティのパターンが明らかとなった。
以上の結果から,言語に依存しない調音探索が実際の方言コーパスに応用できることが示唆された。
- 参考スコア(独自算出の注目度): 1.6274707775531156
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While self-supervised speech models have achieved strong performance across speech tasks, relatively little is known about how their internal phonetic representations behave under fine-grained dialect variation. Existing probing studies typically rely on curated corpora with manual phonetic annotations, limiting their applicability to naturally occurring dialect speech. We present a case study of articulatory feature representations in a Mandarin self-supervised speech model using an entirely unlabeled probing pipeline. Phone sequences are generated using a language-agnostic universal phone recognizer and mapped to articulatory feature vectors, enabling frame-level probing without manual annotation. Our results reveal a structured pattern in articulatory feature decodability across Mandarin sub-dialects. Acoustically salient features such as labiality and stridency remain comparatively stable, whereas features associated with finer spectral distinctions exhibit larger dialect-dependent variation. This variation is driven primarily by elevated decodability for Beijing speech relative to other Mandarin sub-dialects. Layer-wise analyses further show distinct representational dynamics for these feature groups. These findings suggest that language-agnostic articulatory probing can be applied to real-world dialect corpora and that dialect sensitivity in self-supervised speech representations is unevenly distributed across articulatory dimensions.
- Abstract(参考訳): 自己教師付き音声モデルは、音声タスク全体で強いパフォーマンスを達成しているが、その内部の音声表現が、きめ細かな方言変化の下でどのように振る舞うかは、比較的分かっていない。
既存の調査研究は、通常、手動の音韻アノテーションによるキュレートされたコーパスに依存し、自然発生の方言音声に適用性を制限する。
本稿では,全くラベルのない探索パイプラインを用いたマンダリン自己教師音声モデルにおける調音特徴表現のケーススタディを提案する。
音声シーケンスは言語に依存しないユニバーサル電話認識器を用いて生成され、手動のアノテーションなしでフレームレベルの探索を可能にする。
以上の結果から,マンダリンサブディレクトにまたがる調音的特徴デオードビリティのパターンが明らかとなった。
口唇性やストリダンシーなどの音響的に健全な特徴は比較的安定しているが、より微細なスペクトルの区別に関連する特徴は方言依存の変異が大きい。
この変化は、主に、他のマンダリン方言と比較して北京のスピーチの難読化によって引き起こされる。
レイヤーワイズ解析はさらに、これらの特徴群に対して異なる表現力学を示す。
これらの結果から, 言語に依存しない調音探索が実世界の方言コーパスに適用可能であること, 自己教師型音声表現における弁別感度が, 調音次元に不均一に分散していることが示唆された。
関連論文リスト
- A Cross-lingual Comparison of Human and Classification Model Entrainment Behavior in Code-switched Speech Settings [10.889746985417675]
本稿では,マンダリン・イングリッシュ,ヒンディー・イングリッシュ,スパニッシュ・イングリッシュ・イングリッシュ・対話におけるエントレメンテーションの言語横断分析について述べる。
分類モデルがこれらの人間の行動パターンを捉えているかどうかを問う。
提案手法では,多言語スタイリスティックな文脈でモデル決定を評価するための人為的な枠組みを導入する。
論文 参考訳(メタデータ) (2026-07-28T02:16:41Z) - On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation [88.77441715819366]
大規模生音声で事前訓練された生成音声言語モデルは、適切な内容で音声プロンプトを継続することができる。
本稿では,グローバルトークンの難易度に代えて,多種多様な可能性・生成的評価手法を提案する。
論文 参考訳(メタデータ) (2026-01-09T22:01:56Z) - Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio [52.859261069569165]
音声テキスト生成のための手話,唇の動き,音声の多様な組み合わせを扱える最初の統一フレームワークを提案する。
i)不均一な入力を効果的に処理できる統一されたモダリティ非依存アーキテクチャの設計、(ii)モダリティ間の過小評価された相乗効果の探索、特に手話理解における非手動的手がかりとしての唇運動の役割、(iii)個々のタスクに特化した最先端モデルと同等以上のパフォーマンスを達成すること、の3つの目的に焦点をあてる。
論文 参考訳(メタデータ) (2025-08-28T06:51:42Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention [2.199918533021483]
アクセント、音声解剖学、言語音声構造などの声質特性の重複は、言語情報と話者情報の分離を複雑にする。
これらのコンポーネントの分離は、話者認識の精度を大幅に向上させる。
そこで本稿では,接頭辞付きクロスアテンションを通じて共同学習を統合する,新しい非絡み合い学習戦略を提案する。
論文 参考訳(メタデータ) (2025-06-02T10:59:31Z) - Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically [58.019484208091534]
事前訓練された言語モデル(LM)における言語間アライメントは、テキストベースのLMの効率的な転送を可能にしている。
テキストに基づく言語間アライメントの発見と手法が音声に適用されるかどうかについては、未解決のままである。
論文 参考訳(メタデータ) (2025-05-26T07:21:20Z) - Residual Speech Embeddings for Tone Classification: Removing Linguistic Content to Enhance Paralinguistic Analysis [2.0499240875882]
本稿では,言語コンテンツからパラ言語的特徴を引き離す手法を提案する。
本手法を複数の自己教師型音声埋め込みに適用して評価し,残差埋め込みがトーン分類性能を著しく向上させることを示した。
これらの知見は、感情分析、話者特性解析、パラ言語音声処理における残留埋め込みの可能性を明らかにするものである。
論文 参考訳(メタデータ) (2025-02-26T18:32:15Z) - Extracting Lexical Features from Dialects via Interpretable Dialect Classifiers [43.756851270091516]
本稿では,解釈可能な方言を用いて,方言の語彙的特徴を識別する新しい手法を提案する。
本手法は,方言の変種に寄与する重要な言語固有の語彙の特徴を同定し,その同定に有効であることを示す。
論文 参考訳(メタデータ) (2024-02-27T22:06:55Z) - Supervised Acoustic Embeddings And Their Transferability Across
Languages [2.28438857884398]
音声認識においては、話者変動や雑音など無関係な要因を排除しつつ、入力信号の音声内容のモデル化が不可欠である。
自己教師付き事前学習は、教師付き音声認識と教師なし音声認識の両方を改善する方法として提案されている。
論文 参考訳(メタデータ) (2023-01-03T09:37:24Z) - A unified one-shot prosody and speaker conversion system with
self-supervised discrete speech units [94.64927912924087]
既存のシステムは韻律と言語内容の相関を無視し、変換された音声の自然度を低下させる。
自己教師付き離散音声単位を言語表現として活用するカスケードモジュラーシステムを提案する。
実験により,本システムは,自然性,知性,話者伝達性,韻律伝達性において,従来の手法よりも優れていたことがわかった。
論文 参考訳(メタデータ) (2022-11-12T00:54:09Z) - Speech Enhancement using Self-Adaptation and Multi-Head Self-Attention [70.82604384963679]
本稿では,補助的話者認識機能を用いた音声強調のための自己適応手法について検討する。
テスト発話から直接適応に用いる話者表現を抽出する。
論文 参考訳(メタデータ) (2020-02-14T05:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。