論文の概要: Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion
- arxiv url: http://arxiv.org/abs/2607.02862v1
- Date: Fri, 03 Jul 2026 01:53:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.436852
- Title: Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion
- Title(参考訳): マルチモーダル特徴融合を用いたインド言語における方言識別とASRの併用改善
- Abstract要約: 音声認識(ASR)と対話識別(DID)を共同で改善するフレームワークを提案する。
本手法では,コンフォーマーに基づく音声表現から方言の特徴を抽出するBottleneckと,ASR生成した埋め込みを処理するRoBERTaエンコーダを用いる。
平均DID精度は81.63%,平均CERは4.65%,WERは17.73%である。
- 参考スコア(独自算出の注目度): 21.847446038429524
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic Speech Recognition (ASR) and Dialect Identification (DID) are crucial for Indian languages, many of which are low-resource and exhibit significant dialectal differences. Existing methods often optimize ASR or DID individually, resulting in performance trade-offs. In this work, we propose a multimodal framework that jointly improves ASR and DID. Our method employs a Bottleneck Encoder to extract dialectal features from Conformer-based speech representations and a RoBERTa encoder to process ASR-generated CTC embeddings. A gating mechanism merges these features, followed by an attention encoder to refine the representations. The learned embeddings are concatenated with Conformer outputs to enhance ASR features. Evaluated on eight Indian languages with thirty-three dialects, our method achieves an average DID accuracy of 81.63% and average CER and WER of 4.65% and 17.73%, respectively. These results highlight the effectiveness of our method for joint ASR-DID modeling.
- Abstract(参考訳): 自動音声認識(ASR)と方言識別(DID)はインド言語にとって重要であり、その多くが低リソースであり、方言の違いが顕著である。
既存の手法はしばしばASRまたはDIDを個別に最適化し、性能のトレードオフをもたらす。
本研究では,ASRとDIDを協調的に改善するマルチモーダルフレームワークを提案する。
本手法では,コンフォーマーに基づく音声表現から方言の特徴を抽出するBottleneck Encoderと,ASR生成したCTC埋め込みを処理するRoBERTaエンコーダを用いる。
ゲーティング機構はこれらの機能をマージし、次にアテンションエンコーダで表現を洗練させる。
学習した埋め込みは、ASR機能を強化するためにConformer出力と結合される。
3つの方言を持つ8つのインド語で評価し、平均DID精度は81.63%、平均CERとWERはそれぞれ4.65%、平均17.73%である。
これらの結果は,共同ASR-DIDモデリングにおける本手法の有効性を浮き彫りにしたものである。
関連論文リスト
- Building Robust and Scalable Multilingual ASR for Indian Languages [0.5352699766206809]
本稿では,インド工科大学マドラス校のSPRING LabがASRU MADASR 2.0チャレンジのために開発したシステムについて述べる。
これらのシステムは、33の方言にまたがる8つの言語間の発話の言語と方言の予測を改善するために、ASRシステムを適用することに焦点を当てている。
論文 参考訳(メタデータ) (2025-11-19T13:17:16Z) - Efficient Multilingual ASR Finetuning via LoRA Language Experts [59.27778147311189]
本稿では,WhisperをベースとしたLoRA言語エキスパートによる多言語ASRをカスタマイズするための効率的な微調整フレームワークを提案する。
LoRAエキスパート融合や知識蒸留により,本手法は従来の微調整法よりも目標言語での認識性能が向上する。
実験の結果,提案モデルでは,言語認識および言語認識のシナリオにおいて,約10%と15%の性能向上が得られた。
論文 参考訳(メタデータ) (2025-06-11T07:06:27Z) - AdaCS: Adaptive Normalization for Enhanced Code-Switching ASR [1.8533128809847572]
文内コードスイッチングは,音声認識システムにおいて重要な課題である。
AdaCSは、適応バイアスアテンションモジュールをエンコーダ・デコーダネットワークに統合する正規化モデルである。
実験の結果,AdaCSはベトナムのCS ASR正規化において,従来の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2025-01-13T07:27:00Z) - Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling [50.62091603179394]
最も先進的なASRモデルの1つであるWhisperは99の言語を効果的に扱う。
しかし、ウィスパーは未確認の言語と戦っているが、それらは事前訓練には含まれていない。
本研究では,これらの関係を利用して未知言語上でのASR性能を向上させる手法を提案する。
論文 参考訳(メタデータ) (2024-12-21T04:05:43Z) - Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking [68.77659513993507]
我々は,多言語ASRの精度を向上させるため,単純かつ効果的なN-best再分類手法を提案する。
その結果, 音声認識の精度は8.7%, 6.1%, 単語誤り率は3.3%, 単語誤り率は2.0%であった。
論文 参考訳(メタデータ) (2024-09-27T03:31:32Z) - MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition [62.89464258519723]
異なるレベルのオーディオ/視覚エンコーダに融合することで、各モードの表現を促進する多層クロスアテンション融合に基づくAVSR手法を提案する。
提案手法は第1位システムを超え,新たなSOTA cpCERの29.13%をこのデータセット上に構築する。
論文 参考訳(メタデータ) (2024-01-07T08:59:32Z) - Unified model for code-switching speech recognition and language
identification based on a concatenated tokenizer [17.700515986659063]
Code-Switching (CS) Multilingual Automatic Speech Recognition (ASR) モデルは会話中に2つ以上の交互言語を含む音声を転写することができる。
本稿では,純粋にモノリンガルなデータソースからASRデータセットをコードスイッチングする新しい手法を提案する。
新たな Concatenated Tokenizer により、ASR モデルは既存のモノリンガルトークンを再利用しながら、出力されたテキストトークンごとに言語IDを生成することができる。
論文 参考訳(メタデータ) (2023-06-14T21:24:11Z) - From English to More Languages: Parameter-Efficient Model Reprogramming
for Cross-Lingual Speech Recognition [50.93943755401025]
言語間音声認識のためのニューラルモデル再プログラミングに基づく新しいパラメータ効率学習フレームワークを提案する。
我々は、学習可能な事前学習機能強化に焦点を当てた、異なる補助的ニューラルネットワークアーキテクチャを設計する。
提案手法は,既存のASRチューニングアーキテクチャとその拡張性能を自己監督的損失で向上させる。
論文 参考訳(メタデータ) (2023-01-19T02:37:56Z) - Multilingual and code-switching ASR challenges for low resource Indian
languages [59.2906853285309]
インドの7つの言語に関連する2つのサブタスクを通じて、多言語およびコードスイッチングASRシステムの構築に重点を置いている。
これらの言語では、列車とテストセットからなる600時間分の音声データを合計で提供します。
また,マルチリンガルサブタスクとコードスイッチサブタスクのテストセットでは,それぞれ30.73%と32.45%という,タスクのベースラインレシピも提供しています。
論文 参考訳(メタデータ) (2021-04-01T03:37:01Z) - Streaming End-to-End Bilingual ASR Systems with Joint Language
Identification [19.09014345299161]
本稿では,ASRと言語識別の両方を実行するストリーミング,エンドツーエンド,バイリンガルシステムを提案する。
提案手法は、アメリカ合衆国で話される英語とスペイン語、インドで話される英語とヒンディー語という2つの言語対に適用される。
論文 参考訳(メタデータ) (2020-07-08T05:00:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。