論文の概要: SHAMS: An Audio-Grounded Pronunciation Benchmark for Levantine Arabic
- arxiv url: http://arxiv.org/abs/2610.01427v1
- Date: Thu, 01 Oct 2026 10:26:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.054955
- Title: SHAMS: An Audio-Grounded Pronunciation Benchmark for Levantine Arabic
- Title(参考訳): SHAMS:レバンタアラビア語の発音ベンチマーク
- Abstract要約: SHAMS(SHAMI Annotated Multi-dialect Speech)は,オープンオーディオコーパスから1,300発の音声を抽出したベンチマークである。
各発声は、音声、未発声正書法、発音テキスト、音声書き起こしの4つの階層にまたがる。
この構造は, ダイアログ化, グラフ音素変換, 自動音声認識, 音声音素変換など, 様々なダウンストリームタスクの評価を支援する。
- 参考スコア(独自算出の注目度): 6.655837620295535
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Levantine Arabic (LA) is spoken by tens of millions of people, creating a pressing need for shared benchmarks to evaluate LA speech-language technologies. Evaluating such technology is particularly challenging given LA's internal diversity and its opaque and non-standardized orthography. We present SHAMS (SHami Annotated Multi-dialect Speech), a benchmark comprising 1,300 utterances drawn from open audio corpora, balanced across five LA varieties (Urban and Rural Palestinian, and Urban Jordanian, Lebanese, and Syrian). Each utterance is represented across four aligned tiers: audio, unvocalized orthography, diacritized text, and phonetic transcription. This structure supports evaluation of various downstream tasks such as diacritization, grapheme-to-phoneme conversion, automatic speech recognition, and audio-to-phoneme, grounded in audio and stratified by variety. We benchmark open and proprietary models across these tasks to demonstrate the utility of this benchmark for measuring progress across LA. We release SHAMS at https://shams-nlp.github.io .
- Abstract(参考訳): レバンタイン・アラビア(LA)は何千万人もの人々が話し合っており、LAの音声言語技術を評価するための共有ベンチマークの必要性が高まっている。
このような技術を評価することは、LAの内部の多様性とその不透明で標準化されていない正書法を考えると、特に困難である。
SHAMS(Shami Annotated Multi-dialect Speech)は、オープンオーディオコーパスから1,300の発話を抽出し、5種類のLA品種(ウルバン語とラララ・パレスチナ語、アーバン・ヨルダン語、レバノン語、シリア語)でバランスをとるベンチマークである。
各発声は、音声、未発声正書法、発音テキスト、音声書き起こしの4つの階層にまたがる。
この構造は, 音声に接地し, 様々な階層化を行う, ダイアライゼーション, グラフ音素変換, 自動音声認識, 音声音素変換など, 様々な下流タスクの評価を支援する。
これらのタスクに対して、オープンでプロプライエタリなモデルをベンチマークし、このベンチマークがLA全体の進捗を計測するための有用性を実証します。
私たちはSHAMSをhttps://shams-nlp.github.ioでリリースします。
関連論文リスト
- Qwen-Audio-3.0-ASR Technical Report [52.28849889799101]
本稿では,Mixture-of-Experts (MoE) LLM-based ASRシステムであるQwen-Audio-3.0-ASRを提案する。
Qwen-Audio-3.0-ASRは8つの主要方言領域にまたがる30の言語と16の中国語方言の転写をサポートしている。
レイテンシに敏感なアプリケーションのための専用ストリーミング変種Qwen-Audio-3.0-ASR-Streamingを開発した。
論文 参考訳(メタデータ) (2026-09-07T14:30:56Z) - Bulbul: A Dataset for Dialectal Arabic Speech Recognition [23.17840151160424]
アラブ11カ国275人の話者から収集した多言語アラビア語のASRデータセットであるBULBULについて述べる。
BULBULは、構造化された方言と副方言のカバー、および、彼らの母語方言アクセントの参加者によって話される古典アラビア語と現代アラビア語の録音を含んでいる。
論文 参考訳(メタデータ) (2026-08-22T13:27:12Z) - PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark [4.352747055546777]
PARSA-Benchはペルシア語と文化に関する大規模なオーディオ言語モデルを評価するための最初のベンチマークである。
16のタスクと8000以上のサンプルで構成されており、音声理解、パラ言語分析、文化的な音声理解にまたがっている。
詩のメーターやスタイル検出、ペルシア音楽の伝統的な理解、コードスイッチング検出など、新たに10のタスクが導入されている。
論文 参考訳(メタデータ) (2026-03-15T16:06:24Z) - SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases [27.340743922132067]
SCENEBenchは、背景音の理解、雑音の局所化、言語間音声の理解、発声者認識という4つの現実世界のカテゴリーにまたがる音声理解の幅広い形態をターゲットにしている。
このベンチマークスイートの目的は、発言される単語だけでなく、その発言の仕方や音声の非音声成分を評価することである。
我々は5つの最先端のLALMを評価し、重要なギャップを見出す: タスクによってパフォーマンスが異なり、いくつかのタスクはランダムな確率以下で実行され、他のタスクは高い精度を達成する。
論文 参考訳(メタデータ) (2026-03-10T16:15:12Z) - ARCADE: A City-Scale Corpus for Fine-Grained Arabic Dialect Tagging [4.23980289430769]
我々は、都市レベルの方言の粒度を明示的に設計した最初のアラビア語音声データセットARCADEを提示する。
コーパスは、アラブ世界のストリーミングサービスから収集されたアラビアのラジオ音声で構成されている。
その結果得られたコーパスは、19か国58都市にまたがる6,907のアノテーションと3,790のユニークなオーディオセグメントで構成されている。
論文 参考訳(メタデータ) (2026-01-05T15:32:17Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models [58.43486430996411]
LALM(Large Audio-Language Models)は、最近、人間との直接の音声交換を可能にする音声対話機能をアンロックした。
オープンエンド音声対話理解におけるLALMの性能を評価するための音声対話理解ベンチマーク(ADU-Bench)を提案する。
ADU-Benchには、LALMの評価のための2万以上のオープンエンドオーディオダイアログが含まれている。
論文 参考訳(メタデータ) (2024-12-06T16:34:15Z) - LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT [65.69648099999439]
Generative Pre-trained Transformer (GPT) モデルは、様々な自然言語処理タスクにおいて顕著なパフォーマンスを実現している。
音声認識, 理解, 生成のための新しい音声・テキストGPTベースのLLMであるLauraGPTを提案する。
論文 参考訳(メタデータ) (2023-10-07T03:17:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。