論文の概要: Code-Switching Spoken Language Identification as Multi-Label Set Prediction
- arxiv url: http://arxiv.org/abs/2610.01450v1
- Date: Thu, 01 Oct 2026 10:46:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.062537
- Title: Code-Switching Spoken Language Identification as Multi-Label Set Prediction
- Title(参考訳): 複数ラベル集合予測のためのコードスイッチング音声言語同定
- Abstract要約: Code-switched (CS) 音声リークは、巨大な音声コーパスをキュレートするために使用されるモノリンガル言語識別フィルタを通して行われる。
発話レベルCS-LIDを多ラベル言語セット予測として定式化し,発話中の言語を直接出力するセット生成器を提案する。
本分析では, CS-LIDの基調性, しきい値不安定性, CSトレーニングデータにおける言語バイアス, 合成と現実のギャップなど, 頑健なCS-LIDの鍵となる障害を明らかにした。
- 参考スコア(独自算出の注目度): 53.57519778582482
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code-switched (CS) speech leaks through the monolingual language identification (LID) filters used to curate massive speech corpora, calling for CS-aware LID (CS-LID). We formulate utterance-level CS-LID as multi-label language-set prediction and propose a set generator that directly outputs the languages in an utterance, comparing it against atomic-pair and score-based classification baselines. Oracle Top-k is the strongest baseline, but thresholding fails because no single threshold separates CS from monolingual speech. Our set generator predicts the correct language count on unseen pairs without assuming the number of languages, but underperforms oracle Top-k in exact set accuracy. Our analysis identifies the key obstacles to robust CS-LID: oracle cardinality, threshold instability, language bias in CS training data, and the synthetic-to-real gap.
- Abstract(参考訳): Code-switched (CS) 音声リークは、CS-LID (CS-Aware LID) と呼ばれる巨大な音声コーパスをキュレートするために使用されるモノリンガル言語識別 (LID) フィルタを通して行われる。
発声レベルCS-LIDを多ラベル言語セット予測として定式化し、発声中の言語を直接出力するセットジェネレータを提案し、それをアトミックペアとスコアベースの分類基準と比較する。
Oracle Top-kは最強のベースラインだが、単一のしきい値がCSとモノリンガルなスピーチを分離しないため、しきい値設定は失敗する。
我々のセットジェネレータは、未知のペアに対して、言語数を仮定せずに正しい言語数を予測しますが、正確なセット精度でオラクルトップkを過小評価します。
本分析では, CS-LIDの基調性, しきい値不安定性, CSトレーニングデータにおける言語バイアス, 合成と現実のギャップなど, 頑健なCS-LIDの鍵となる障害を明らかにした。
関連論文リスト
- Towards Truly Multilingual ASR: Generalizing Code-Switching ASR to Unseen Language Pairs [4.697631271009118]
符号スイッチング ASR (CS-ASR) は、多言語CS音声資源の不足により、特に困難である。
既存のアプローチは、合成CS音声生成やペア固有微調整によりCS-ASR性能を向上させる。
限られた言語対から学習したCS能力が、未知の言語対に一般化できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-06-04T08:22:55Z) - What Language is This? Ask Your Tokenizer [32.28976119949841]
言語識別(LID)は多くの多言語自然言語処理パイプラインの重要なコンポーネントである。
我々は,UnigramLMトークン化アルゴリズムに基づくシンプルで効率的なLID手法UniLIDを紹介する。
我々の定式化は、データと計算効率が良く、既存のモデルを再訓練することなく、新しい言語の漸進的な追加をサポートしています。
論文 参考訳(メタデータ) (2026-02-19T18:58:39Z) - Tracing Multilingual Representations in LLMs with Cross-Layer Transcoders [51.380449540006985]
大規模言語モデル(LLM)は多くの言語を処理できるが、どのようにして内部的にこの多様性を表現しているのかは不明だ。
言語固有のデコーディングと多言語表現を共有できるのでしょうか?
層間トランスコーダ(CLT)と属性グラフを用いて内部メカニズムを解析する。
論文 参考訳(メタデータ) (2025-11-13T22:51:06Z) - Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training [58.696660064190475]
コンテクスト内の異なる言語間を交互に交換するコードスイッチの存在が、多言語機能の鍵であることに気付きました。
事前学習における言語アライメントのためのコードスイッチングのパワーをよりよく探求するために,合成コードスイッチングの戦略について検討する。
論文 参考訳(メタデータ) (2025-04-02T15:09:58Z) - Code-Switching without Switching: Language Agnostic End-to-End Speech
Translation [68.8204255655161]
我々は音声認識と翻訳を一貫したエンドツーエンドの音声翻訳問題として扱う。
LASTを両方の入力言語で訓練することにより、入力言語に関係なく、音声を1つのターゲット言語にデコードする。
論文 参考訳(メタデータ) (2022-10-04T10:34:25Z) - Multi-level Contrastive Learning for Cross-lingual Spoken Language
Understanding [90.87454350016121]
コントラスト学習のための難解なサンプルを, あらゆるレベルで生成するコードスイッチング手法を開発した。
言語間知識伝達にラベルセマンティクスを利用するラベル認識ジョイントモデルを開発した。
論文 参考訳(メタデータ) (2022-05-07T13:44:28Z) - Reducing language context confusion for end-to-end code-switching
automatic speech recognition [50.89821865949395]
本稿では,E2E符号スイッチングASRモデルの多言語コンテキストの混同を低減するための言語関連アテンション機構を提案する。
複数の言語のそれぞれの注意を計算することにより、豊かな単言語データから言語知識を効率的に伝達することができる。
論文 参考訳(メタデータ) (2022-01-28T14:39:29Z) - Integrating Knowledge in End-to-End Automatic Speech Recognition for
Mandarin-English Code-Switching [41.88097793717185]
Code-Switching (CS) は多言語コミュニティでよく見られる言語現象である。
本稿では,マンダリン・イングリッシュCS音声におけるエンドツーエンド音声認識の検討について述べる。
論文 参考訳(メタデータ) (2021-12-19T17:31:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。