論文の概要: EDRAC: Benchmarking Arabic Dialect Reading Comprehension
- arxiv url: http://arxiv.org/abs/2609.01113v1
- Date: Tue, 01 Sep 2026 11:51:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.612575
- Title: EDRAC: Benchmarking Arabic Dialect Reading Comprehension
- Title(参考訳): EDRAC:アラビア方言読解のベンチマーク
- Authors: Noor Abo Mokh, Kirill Chirkunov, Teresa Lynn, Nizar Habash, Reham Marzouk, Malik H. Altakrori, Younes Samih, Muhammed Abu Odeh, Nour Rabih, Rahaf Alshahrani, Hamad Alshehhi, Hamdan Al-Ali, Muhra Almahri, Besher Hassan, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Alham Fikri Aji,
- Abstract要約: EDRACは、方言のアラビア機械読解(MRC)と生成的QAのための最初の大規模ベンチマークである。
EDRACは、自然発生の音声相互作用に由来する499の通路と、対応する4,977のQA対を含む。
その結果,意味的回答の品質と方言の忠実度の間には大きなギャップがあることがわかった。
- 参考スコア(独自算出の注目度): 43.861708347921336
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Dialectal Arabic (DA) remains under-resourced compared to Modern Standard Arabic (MSA), particularly for machine reading comprehension (MRC) and question answering (QA). Existing Arabic QA benchmarks primarily focus on formal written MSA or multiple-choice QA, with limited coverage of naturally spoken dialects. Here, we aim to bridge this gap. We introduce EDRAC, the first large-scale benchmark for dialectal Arabic machine reading comprehension (MRC) and generative QA, covering five major dialects: Egyptian, Moroccan, Emirati, Syrian, and Saudi Arabic. EDRAC contains 499 passages derived from naturally occurring spoken interactions and 4,977 corresponding QA pairs generated through a human--LLM collaborative pipeline combining iterative generation, LLM-as-a-judge evaluation, and human verification. We benchmark Arabic-centric and multilingual LLMs on EDRAC using lexical and semantic metrics. Our results reveal substantial gaps between semantic answer quality and dialectal fidelity, highlighting the limitations of existing evaluation metrics for dialectal Arabic generation. EDRAC provides a realistic and challenging MRC benchmark for future research on dialectal Arabic NLP.
- Abstract(参考訳): 特に機械読解 (MRC) や質問応答 (QA) では、現代標準アラビア語 (MSA) と比較して、方言アラビア語 (DA) は未資源のままである。
既存のアラビア語のQAベンチマークは主に形式的なMSAまたは複数選択QAに焦点を合わせており、自然に話される方言は限られている。
ここでは、このギャップを埋めることを目指しています。
EDRACは、エジプト語、モロッコ語、エミラティ語、シリア語、サウジアラビア語の5つの主要な方言をカバーする、方言のアラビア語機械読解(MRC)と生成的QAのための最初の大規模ベンチマークである。
EDRACは、自然発生の音声対話に由来する499の通路と、反復生成、LLM-as-a-judge評価、および人間の検証を組み合わせた人間-LLM協調パイプラインによって生成された4,977のQAペアを含む。
我々は、語彙と意味のメトリクスを用いて、EDRAC上のアラビア語中心および多言語LLMをベンチマークする。
以上の結果から,意味的回答の品質と方言の忠実度の間には,既存のアラビア語生成評価指標の限界が顕著に現れている。
EDRACは、将来の方言アラビアNLP研究のための現実的で挑戦的なMCCベンチマークを提供する。
関連論文リスト
- Bulbul: A Dataset for Dialectal Arabic Speech Recognition [23.17840151160424]
アラブ11カ国275人の話者から収集した多言語アラビア語のASRデータセットであるBULBULについて述べる。
BULBULは、構造化された方言と副方言のカバー、および、彼らの母語方言アクセントの参加者によって話される古典アラビア語と現代アラビア語の録音を含んでいる。
論文 参考訳(メタデータ) (2026-08-22T13:27:12Z) - DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models [54.10223256792762]
アラビア方言における大規模言語モデル(LLM)の性能評価のための新しいベンチマークであるDialectalArabicMMLUを提案する。
MMLU-Redux フレームワークを手動で翻訳し、3K 個の質問応答対を5つの主要な方言に適応することで拡張する。
論文 参考訳(メタデータ) (2025-10-31T15:17:06Z) - Assessing Dialect Fairness and Robustness of Large Language Models in Reasoning Tasks [68.33068005789116]
本稿では、標準英語とAAVEで1.2K以上の並列クエリペアを含むベンチマークであるReDialを紹介する。
我々は、GPT、Claude、Llama、Mistral、Phiモデルファミリーなど、広く使われているモデルを評価した。
我々の研究は、方言クエリにおけるLLMバイアスを分析するための体系的で客観的な枠組みを確立する。
論文 参考訳(メタデータ) (2024-10-14T18:44:23Z) - AraDiCE: Benchmarks for Dialectal and Cultural Capabilities in LLMs [22.121471902726892]
本稿ではアラビア方言と文化評価のベンチマークであるAraDiCEを紹介する。
湾岸地域、エジプト地域、レバント地域の文化意識を評価するために設計された最初のきめ細かいベンチマーク。
論文 参考訳(メタデータ) (2024-09-17T17:59:25Z) - ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic [51.922112625469836]
アラビア語における最初のマルチタスク言語理解ベンチマークである、データセット名を提案する。
我々のデータは、現代標準アラビア語(MSA)における40のタスクと14,575のマルチチョイス質問で構成されており、地域の母語話者と協調して慎重に構築されている。
35モデルについて評価した結果,特にオープンソースモデルにおいて,改善の余地がかなり高いことが判明した。
論文 参考訳(メタデータ) (2024-02-20T09:07:41Z) - AceGPT, Localizing Large Language Models in Arabic [73.39989503874634]
本稿では,アラビア語のテキストによる事前学習,ネイティブなアラビア語命令を利用したSFT(Supervised Fine-Tuning),アラビア語のGPT-4応答を含む総合的なソリューションを提案する。
目標は、文化的に認知され、価値に整合したアラビア語のLLMを、多様で応用特有のアラビア語コミュニティのニーズに適応させることである。
論文 参考訳(メタデータ) (2023-09-21T13:20:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。