論文の概要: Evaluation of forced alignment of code-mixed speech: the case of Hindi-English
- arxiv url: http://arxiv.org/abs/2607.25581v1
- Date: Tue, 28 Jul 2026 11:08:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.813711
- Title: Evaluation of forced alignment of code-mixed speech: the case of Hindi-English
- Title(参考訳): 符号混合音声の強制アライメントの評価-ヒンディー英語の場合-
- Abstract要約: モントリオール強制アリグナーを用いて,ヒンディー語と英語の符号化音声の強制アライメントを評価する。
我々は、母語対非母語対を含む自由なばらつきと、中間発話英単語の音素境界検出という2つの問題に対処する。
- 参考スコア(独自算出の注目度): 5.706697761527132
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Code-mixed speech poses unique challenges to forced alignment: expanded inventories, orthographic errors, and speaker variation. We evaluate forced alignment of Hindi-English code-mixed speech using the Montreal Forced Aligner. We address 2 problems: (1) free variation involving native vs non-native pairs and (2) phonemic boundary detection for mid-utterance English words. Bootstrapping strategies substantially outperform unmodified lexicons. Acoustic models trained on sentence-level code-mixed data achieve a mean error of 4.15ms, ie. ten times lower than monolingual Hindi (38.18ms) or isolated English (37.58ms) alternatives. Principled lexicon design and code-mixed training data are both essential for reliable alignment of bilingual speech.
- Abstract(参考訳): コードミキシングされたスピーチは、インベントリの拡張、正書法エラー、話者変動といった、強制アライメントに固有の課題を提起する。
モントリオール強制アリグナーを用いて,ヒンディー語と英語の符号化音声の強制アライメントを評価する。
本研究では,(1)母語対非母語対の自由変動と(2)中間発話英語単語の音素境界検出の2つの問題に対処する。
ブートストラッピング戦略は、修正されていないレキシコンを大幅に上回る。
文レベルのコード混合データに基づいて訓練された音響モデルは平均誤差4.15msとなる。
モノリンガルのヒンディー語(38.18ms)や孤立した英語(37.58ms)よりも10倍低い
バイリンガル音声の信頼できるアライメントには,原理的辞書設計とコード混合学習データの両方が不可欠である。
関連論文リスト
- Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR [11.507193494503754]
本研究では,英語,コード混在言語,ネイティブ言語入力のスペクトルにおいて,知識リコールの整合性がどのように変化するかを検討する。
ネイティブ言語と英語の精度ギャップは$sim$0.50に達するが、コード混合入力はそのほとんどを閉じている。
そこで我々は,言語変換の公開方法に異なるいくつかの促進策を評価する。
論文 参考訳(メタデータ) (2026-05-28T09:06:59Z) - Neither Here Nor There: Cross-Lingual Representation Dynamics of Code-Mixed Text in Multilingual Encoders [0.9523331544264052]
我々は、並列英語、ヒンディー語、ローマ字のコード混合文の統一的な三言語コーパスを構築した。
標準モデルは英語とヒンディー語をうまく一致させるが、コード混合入力はどちらの言語にもゆるやかに結びついている。
論文 参考訳(メタデータ) (2026-03-20T09:02:38Z) - Simultaneous Speech-to-Speech Translation Without Aligned Data [52.467808474293605]
同時音声翻訳では、ソース音声を対象言語にリアルタイムで翻訳する必要がある。
単語レベルのアライメントを完全に不要にするヒビキゼロを提案する。
Hibiki-Zeroは5つのX-英語タスクの翻訳精度、レイテンシ、音声転送、自然性において最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T17:41:01Z) - Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically [58.019484208091534]
事前訓練された言語モデル(LM)における言語間アライメントは、テキストベースのLMの効率的な転送を可能にしている。
テキストに基づく言語間アライメントの発見と手法が音声に適用されるかどうかについては、未解決のままである。
論文 参考訳(メタデータ) (2025-05-26T07:21:20Z) - Modular Sentence Encoders: Separating Language Specialization from Cross-Lingual Alignment [50.80949663719335]
多言語文エンコーダ(MSE)は、多言語言語モデルを訓練し、異なる言語からの文を共有意味空間にマッピングすることで一般的に得られる。
MSEは、パラメータ共有による単言語表現精度の喪失である多言語性の呪いを受ける。
我々は、異なる言語間タスクの矛盾する要求を解決するために、2つの異なるタイプのデータで言語間アダプタを訓練する。
論文 参考訳(メタデータ) (2024-07-20T13:56:39Z) - Multilingual self-supervised speech representations improve the speech
recognition of low-resource African languages with codeswitching [65.74653592668743]
微細な自己教師型多言語表現は絶対単語誤り率を最大20%削減する。
訓練データに制限のある状況では、自己教師付き表現を微調整することが、より良いパフォーマンスと実行可能なソリューションである。
論文 参考訳(メタデータ) (2023-11-25T17:05:21Z) - Reducing language context confusion for end-to-end code-switching
automatic speech recognition [50.89821865949395]
本稿では,E2E符号スイッチングASRモデルの多言語コンテキストの混同を低減するための言語関連アテンション機構を提案する。
複数の言語のそれぞれの注意を計算することにより、豊かな単言語データから言語知識を効率的に伝達することができる。
論文 参考訳(メタデータ) (2022-01-28T14:39:29Z) - Bridging the Modality Gap for Speech-to-Text Translation [57.47099674461832]
エンド・ツー・エンドの音声翻訳は、ある言語における音声を、エンド・ツー・エンドの方法で他の言語におけるテキストに変換することを目的としている。
既存のほとんどの手法では、音響表現と意味情報を同時に学習するために、単一のエンコーダを持つエンコーダ・デコーダ構造を用いる。
本稿では,音声とテキスト間のモダリティギャップを埋めることで,エンドツーエンドのモデル性能を向上させることを目的とした音声翻訳モデルのための音声テキスト適応手法を提案する。
論文 参考訳(メタデータ) (2020-10-28T12:33:04Z) - Learning not to Discriminate: Task Agnostic Learning for Improving
Monolingual and Code-switched Speech Recognition [12.354292498112347]
本稿では、ドメイン逆学習を用いてタスクモデルを訓練することにより、これまでの作業よりもさらに改善する。
提案手法は,単語誤り率(WER)を3つの言語対に対して単言語およびコード切替テストセットで削減する。
論文 参考訳(メタデータ) (2020-06-09T13:45:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。