論文の概要: ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification
- arxiv url: http://arxiv.org/abs/2608.01291v1
- Date: Sun, 02 Aug 2026 15:00:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.150942
- Title: ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification
- Title(参考訳): アラビア語DialectSafety:アラビア語コンテンツ安全分類のための方言認識ベンチマーク
- Authors: Wajdi Zaghouani, Md. Rafiul Biswas, Kholoud Khalil Aldous, Mabrouka Bessghaier,
- Abstract要約: そこで本研究では,6種類のアラビア種を対象とする人為的アラビア安全データセット25,071件について紹介する。
データセットには、方言ラベルと7つのきめ細かい調和カテゴリが注釈付けされている。
教師付きおよび生成モデル7つをベンチマークした結果、微調整されたMARBERTv2が最も高い性能が得られることがわかった。
- 参考スコア(独自算出の注目度): 1.4665143197624044
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present ArabicDialectSafety, a human-curated Arabic safety dataset of 25,071 prompts covering six Arabic varieties: Modern Standard Arabic, Syrian, Egyptian, Algerian, Palestinian, and Moroccan. The dataset is annotated with dialect labels and seven fine-grained harm categories. We introduce a dual-task evaluation framework for binary safe/unsafe detection and granular harm classification across dialects. Benchmarking seven supervised and generative models, we find that fine-tuned MARBERTv2 achieves the strongest performance, with Macro-F1 scores of 0.95 for binary classification and 0.90 for granular classification, substantially outperforming prompted frontier LLMs, including Arabic-specialized models. Our analyses show that dialect conditioning is most effective when integrated at the representation level, while significant performance gaps remain for low-resource Maghrebi dialects. We further evaluate seven frontier LLMs as response generators on harmful dialectal Arabic prompts and observe unsafe generation rates below 5 percent across models. We release the dataset and code upon acceptance to support future research on dialect-aware Arabic safety evaluation. Warning: This paper contains examples of harmful and potentially offensive content included solely for research purposes.
- Abstract(参考訳): これは、現代標準アラビア語、シリア語、エジプト語、アルジェリア語、パレスチナ語、モロッコの6種類のアラビアの品種をカバーする。
データセットには、方言ラベルと7つのきめ細かい調和カテゴリが注釈付けされている。
本稿では、二項安全/不安全検出と方言間のきめ細かい調和分類のためのデュアルタスク評価フレームワークを提案する。
教師付きモデルと生成モデルとをベンチマークした結果,MARBERTv2は2進分類では0.95点,粒度分類では0.90点,アラビア特殊化モデルを含むフロンティアLLMよりもかなり優れていた。
分析の結果,低リソースのMaghrebi方言では大きな性能差が残っており,表現レベルでは方言条件付けが最も有効であることが示唆された。
さらに、7つのフロンティアLSMを有害な方言アラビア語のプロンプトに対する応答生成剤として評価し、モデル全体で5%未満の不安全発生率を観察した。
本研究は、方言を意識したアラビア語の安全性評価に関する今後の研究を支援するためのデータセットとコードをリリースする。
警告: 本論文は, 研究目的にのみ含まれる有害かつ潜在的に攻撃的な内容の例を含む。
関連論文リスト
- Evaluation of Adversarial Robustness in Arabic Language Models [2.1665689529884697]
本研究は、アラビア語に対する攻撃の異なるセットの下で、最先端の5つのアラビア語モデルの堅牢性を評価することを目的としている。
ダイアクリティカルティクスの挿入は、低距離を維持しながら、いくつかのモデルの精度を92%削減することができる。
単語レベルの攻撃では、アラビア語の接続を操作することは、高い意味的類似度スコア、低い距離を保持し、最大58%の精度低下をもたらす。
文レベルの攻撃では、パラフレーズ化は犠牲者モデルの性能を平均で76%削減することで効果を証明している。
論文 参考訳(メタデータ) (2026-07-28T14:58:28Z) - MentalMARBERT: Domain-Adaptive Pre-training and Two-Stage Fine-Tuning for Arabic Mental Health Disorders Detection [0.7039739305668745]
本研究では、アラビア語のメンタルヘルステキスト分類のための2段階の枠組みを提案する。
フェーズ1では、3つのアラビア語事前訓練された言語モデルがドメイン適応およびタスク適応事前訓練を受けている。
フェーズ2では、選択されたモデルは、完全な微調整と低ランク適応の4つの構成で評価される。
論文 参考訳(メタデータ) (2026-06-10T20:20:41Z) - LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety [88.98698230989186]
大規模言語モデル(LLM)は、しばしば高リソース言語で強力な安全性性能を示すが、低リソース言語では深刻な脆弱性を示す。
このギャップは、言語に依存しない意味理解能力と、高リソース言語に偏った言語に支配的な安全アライメントのミスマッチによるものと考えられる。
セマンティック・アライメント(LASA)を提案し,セマンティック・ボトルネックに直接安全アライメントを固定する。
論文 参考訳(メタデータ) (2026-04-13T15:59:50Z) - SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models [6.0860786631767185]
本稿ではアラビア語モデル(ALM)の安全性を評価する統一ベンチマークであるSalamaBenchを紹介する。
このベンチマークを用いて,Fanar 1,2,ALLaM 2,Falcon H1R,Jais 2の5つの最先端ALMを複数のセーフガード構成で評価した。
論文 参考訳(メタデータ) (2026-02-03T12:13:42Z) - OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models [54.80460603255789]
マルチモーダル時代に設計された,最も包括的なコンテンツ安全性評価テストスイートであるOutSafe-Benchを紹介する。
OutSafe-Benchには、4つのモダリティにまたがる大規模なデータセットが含まれており、18,000以上のバイリンガル(中国語と英語)テキストプロンプト、4500のイメージ、450のオーディオクリップ、450のビデオが9つの重要なコンテンツリスクカテゴリで体系的に注釈付けされている。
このデータセットに加えて,多次元クロスリスクスコア(Multidimensional Cross Risk Score, MCRS)も導入した。
論文 参考訳(メタデータ) (2025-11-13T13:18:27Z) - Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation [0.0]
その重要性にもかかわらず、アラビア語は資金不足に直面している。
大きな注釈付きデータセットの不足は、アラビア語の主観分析のための正確なツールの開発を妨げている。
近年のディープラーニングとトランスフォーマーの進歩は、英語とフランス語のテキスト分類に非常に効果的であることが証明されている。
論文 参考訳(メタデータ) (2025-08-27T15:20:12Z) - Lemmatization as a Classification Task: Results from Arabic across Multiple Genres [9.896789483253189]
アラビア語のような曖昧な正書法を持つ形態学的に豊かな言語におけるNLPタスクには、レマタイゼーションが不可欠である。
本稿では,Lemma-POS-Gloss (LPG) タグセットの分類として,補題化を枠組み化する2つの新しい手法を提案する。
また、既存のデータセットと共に標準化された様々なジャンルをカバーする新しいアラビア語の補題化テストセットも提示する。
論文 参考訳(メタデータ) (2025-06-23T08:34:33Z) - AceGPT, Localizing Large Language Models in Arabic [73.39989503874634]
本稿では,アラビア語のテキストによる事前学習,ネイティブなアラビア語命令を利用したSFT(Supervised Fine-Tuning),アラビア語のGPT-4応答を含む総合的なソリューションを提案する。
目標は、文化的に認知され、価値に整合したアラビア語のLLMを、多様で応用特有のアラビア語コミュニティのニーズに適応させることである。
論文 参考訳(メタデータ) (2023-09-21T13:20:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。