論文の概要: Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
- arxiv url: http://arxiv.org/abs/2604.04598v1
- Date: Mon, 06 Apr 2026 11:23:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.176925
- Title: Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
- Title(参考訳): Pashto上での多言語音声モデルのベンチマーク:ゼロショットASR,スクリプトエラー,ドメイン間評価
- Authors: Hanif Rahman,
- Abstract要約: Pashtoは、約6000~8000万人が話すが、共有公開テストセット上での多言語自動音声認識(ASR)のベンチマークは公開されていない。
本稿では,公開Pashtoデータに対する最初の再現可能なマルチモデル評価を行い,ゼロショットASR,スクリプトレベルの故障,微調整モデルのクロスドメイン評価について報告する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pashto is spoken by approximately 60--80 million people but has no published benchmarks for multilingual automatic speech recognition (ASR) on any shared public test set. This paper reports the first reproducible multi-model evaluation on public Pashto data, covering zero-shot ASR, script-level failure, and cross-domain evaluation of fine-tuned models. For zero-shot ASR, ten models (all seven Whisper sizes, MMS-1B, SeamlessM4T-v2-large, and OmniASR-CTC-300M) are evaluated on the FLEURS Pashto test set and a filtered Common Voice~24 subset; zero-shot Whisper WER ranges from 90% to 297%, with the medium model collapsing to 461% on Common Voice~24 consistent with decoder looping. SeamlessM4T achieves 39.7% WER on Common Voice~24 (the best zero-shot result reported to date, as of submission); MMS-1B achieves 43.8% on FLEURS. For script failure, a language-identification audit shows that no Whisper model produces Pashto-script output in more than 0.8% of utterances, while MMS-1B, SeamlessM4T, and OmniASR each exceed 93% Pashto-script fidelity; WER alone does not reveal this failure, since a model generating Arabic-script output on Pashto audio has not achieved ASR in any interpretable sense. For cross-domain evaluation, five fine-tuned Pashto ASR models are evaluated on both test sets: published WER figures of 14% degrade to 32.5--59% on out-of-distribution sets, while one augmented model achieves 35.1% on both sets with zero cross-domain degradation. Character-class error stratification confirms that Pashto-unique phonemes (the retroflex series and lateral fricatives) account for disproportionate error mass. All evaluations cover read speech only. Five structural impediments to cumulative progress are identified and five ordered research priorities are argued.
- Abstract(参考訳): Pashtoは、約6000~8000万人が話すが、共有公開テストセット上での多言語自動音声認識(ASR)のベンチマークは公開されていない。
本稿では,公開Pashtoデータに対する最初の再現可能なマルチモデル評価を行い,ゼロショットASR,スクリプトレベルの故障,微調整モデルのクロスドメイン評価について報告する。
ゼロショットASRでは、FLEURS PashtoテストセットとフィルタされたCommon Voice~24サブセットで10モデル(全7つのWhisperサイズ、MMS-1B、SeamlessM4T-v2-large、OmniASR-CTC-300M)を評価する。
SeamlessM4T は 39.7% の WER を Common Voice~24 で達成し、MMS-1B は FLEURS で 43.8% を達成した。
一方、MMS-1B、SeamlessM4T、OmniASRはそれぞれ93%のPashto-script忠実度を超えている。
クロスドメイン評価では、5つの微調整されたPashto ASRモデルを両方のテストセットで評価する: 発行されたWERの14%の数値はアウト・オブ・ディストリビューション・セットで32.5-59%に減少し、一方の強化モデルはクロスドメインの劣化をゼロに両方のセットで35.1%を達成する。
文字階級の誤り階層化は、パシュト・ユニク音素(反射列と横摩擦音素)が不均等な誤り質量であることを示す。
全ての評価は読み上げ音声のみをカバーする。
累積進行に対する5つの構造障害が同定され、5つの順序付けられた研究優先順位が議論される。
関連論文リスト
- BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR [9.626217175791572]
本稿では,外部の音声エンコーダや事前訓練された大言語モデル(LLM)を使わずに,音声とテキストを単一のスタックで処理する,自動音声認識(ASR)のためのデコーダのみのコンバータを提案する。
モデルは、モダリティを意識した専門家のスパース混合(MoE: Disjoint expert pools for speech and text with hard routing and top-1 selection, embedded in hybrid-causality Conformer block)を使用する。
5言語に1つの多言語モデルを持つCommon Voice 16.1では、平均WERを12.2%から10.6%に削減する。
論文 参考訳(メタデータ) (2026-02-13T02:53:54Z) - Qwen3-ASR Technical Report [71.87071808763484]
2つの強力なオールインワン音声認識モデルと、新しい非自己回帰音声強制アライメントモデルを含むQwen3-ASRファミリを紹介する。
Qwen3-ASR-1.7BとQwen3-ASR-0.6Bは、言語識別と52の言語および方言のASRをサポートするASRモデルである。
論文 参考訳(メタデータ) (2026-01-29T06:58:13Z) - Kunnafonidilaw ka Cadeau: an ASR dataset of present-day Bambara [0.7999703756441755]
クンカド (Kunkado) は、マリの無線アーカイブから収集された160時間のBambara ASRデータセットである。
コードスイッチ、ノイズ、バックグラウンドノイズ、実際のASRシステムが現実世界で遭遇する重複スピーカーなどが含まれる。
論文 参考訳(メタデータ) (2025-12-22T13:52:33Z) - The ML-SUPERB 2.0 Challenge: Towards Inclusive ASR Benchmarking for All Language Varieties [107.57160730151975]
我々は200以上の言語、アクセント、方言のデータからなる新しいテストスイートを構築し、SOTA多言語音声モデルを評価する。
その結果, LIDの精度は23%, CERは18%向上した。
アクセントと方言のデータでは、最も良い提出は30.2%低いCERと15.7%高いLIDの精度を得た。
論文 参考訳(メタデータ) (2025-09-08T18:42:36Z) - One Whisper to Grade Them All [10.035434464829958]
複数部からなる第2言語テストの総合的自動発話評価(ASA)に対して,効率的なエンドツーエンドアプローチを提案する。
我々のシステムの主な特徴は、4つの音声応答を1つのWhisper小エンコーダで処理できることである。
このアーキテクチャは、書き起こしや部品ごとのモデルの必要性を排除し、推論時間を短縮し、ASAを大規模コンピュータ支援型言語学習システムに活用する。
論文 参考訳(メタデータ) (2025-07-23T20:31:40Z) - Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking [68.77659513993507]
我々は,多言語ASRの精度を向上させるため,単純かつ効果的なN-best再分類手法を提案する。
その結果, 音声認識の精度は8.7%, 6.1%, 単語誤り率は3.3%, 単語誤り率は2.0%であった。
論文 参考訳(メタデータ) (2024-09-27T03:31:32Z) - Developing a Multilingual Dataset and Evaluation Metrics for Code-Switching: A Focus on Hong Kong's Polylingual Dynamics [0.5700195008916903]
我々は,Multi-Agent Data Generation Framework (MADGF) を用いた混合カントンと英語(MCE)音声の34.8時間データセットを開発した。
我々は,オープンソースの多言語自動音声認識(ASR)モデルであるWhisperをMCEデータセットで微調整し,印象的なゼロショット性能を実現した。
論文 参考訳(メタデータ) (2023-10-27T08:01:55Z) - Exploration of End-to-End ASR for OpenSTT -- Russian Open Speech-to-Text
Dataset [73.66530509749305]
本稿では,ロシア最大のオープンソース言語データセットであるOpenSTTのエンドツーエンド自動音声認識システム(ASR)について検討する。
CTC/Attention, RNN-Transducer, Transformer など,既存のエンドツーエンドアプローチの評価を行った。
利用可能な3つの検証セット(電話、YouTube、書籍)について、私たちの最高のエンドツーエンドモデルは、それぞれ34.8%、19.1%、および18.1%のワードエラー率(WER)を達成する。
論文 参考訳(メタデータ) (2020-06-15T10:35:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。