論文の概要: Redteaming Leading Arabic LLMs with ASAS
- arxiv url: http://arxiv.org/abs/2608.21985v1
- Date: Sat, 22 Aug 2026 14:34:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.55106
- Title: Redteaming Leading Arabic LLMs with ASAS
- Title(参考訳): ASASによるアラビア語LLMのリピート
- Abstract要約: 大型言語モデル (LLM) をリピートする最初の完全人為的なアラビア語ベンチマークである、アラビア安全指数 (ASAS) を紹介する。
ASASには8つの安全カテゴリーと8つの攻撃戦略にまたがる801のプロンプトがあり、モダンスタンダードアラビア(MSA)の理想的な応答がある。
我々は、GPT-4o、Claude 3.7 Sonnet、ALaM、FANARなどの地域モデルを含む、アラビアの能力を持つ7つの主要なモデルに対して、リピーピング評価を行う。
人間のアノテータは、構造化された4ポイントの安全尺度を使用してレスポンスを評価し、ほとんどのモデルが安全でないプロンプトの50%に対して防御に失敗していることを明らかにした。
- 参考スコア(独自算出の注目度): 7.552587851046888
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As the adoption of large language models (LLMs) grows in Arabic-speaking regions, ensuring their safety and cultural alignment is increasingly critical. However, Arabic LLM safety remains underexplored, especially in adversarial evaluation settings. We introduce the Arabic Safety Index (ASAS), the first fully human-curated Arabic benchmark for redteaming LLMs. ASAS contains 801 prompts spanning 8 safety categories and 8 attack strategies, with ideal responses in Modern Standard Arabic (MSA). We conduct a redteaming evaluation across seven leading models with Arabic capabilities, including GPT-4o, Claude 3.7 Sonnet, and regional models such as ALLaM and FANAR. Human annotators rate responses using a structured 4-point safety scale, revealing that most models fail to defend against 50% of unsafe prompts. Our findings highlight major safety gaps in high-harm categories such as weapons and illicit substances, with direct and obfuscation-based attacks proving most effective. The results also show that language alignment does not readily transfer across languages, and that automated safety judges (e.g., GPT-4o) perform poorly compared to human annotators. ASAS provides a culturally grounded benchmark and redteaming protocol to drive progress in Arabic LLM safety.
- Abstract(参考訳): アラビア語圏で大型言語モデル(LLMs)の採用が進むにつれ、その安全性と文化の整合性を確保することがますます重要になっている。
しかし、アラビア語の LLM の安全性は、特に敵対的な評価設定では未調査のままである。
アラビア安全指数 (ASAS) は, LLMをリピートする最初の完全人為的なアラビアベンチマークである。
ASASには8つの安全カテゴリーと8つの攻撃戦略にまたがる801のプロンプトがあり、モダンスタンダードアラビア(MSA)の理想的な応答がある。
我々は、GPT-4o、Claude 3.7 Sonnet、ALaM、FANARなどの地域モデルを含む、アラビアの能力を持つ7つの主要なモデルに対して、リピーピング評価を行う。
人間のアノテータは、構造化された4ポイントの安全尺度を使用してレスポンスを評価し、ほとんどのモデルが安全でないプロンプトの50%に対して防御に失敗していることを明らかにした。
本研究は, 兵器や違法物質などの高害なカテゴリーにおいて, 直接的および難読化による攻撃が最も効果的であることが示唆された。
また, 言語アライメントが言語間で容易に伝達されないこと, 自動安全判断器(例えば GPT-4o)が人間のアノテータと比較して性能が劣ることを示した。
ASASは、アラビア語のLLM安全性の進歩を促進するために、文化的に根拠付けられたベンチマークとリピートプロトコルを提供する。
関連論文リスト
- Evaluation of Adversarial Robustness in Arabic Language Models [2.1665689529884697]
本研究は、アラビア語に対する攻撃の異なるセットの下で、最先端の5つのアラビア語モデルの堅牢性を評価することを目的としている。
ダイアクリティカルティクスの挿入は、低距離を維持しながら、いくつかのモデルの精度を92%削減することができる。
単語レベルの攻撃では、アラビア語の接続を操作することは、高い意味的類似度スコア、低い距離を保持し、最大58%の精度低下をもたらす。
文レベルの攻撃では、パラフレーズ化は犠牲者モデルの性能を平均で76%削減することで効果を証明している。
論文 参考訳(メタデータ) (2026-07-28T14:58:28Z) - LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety [88.98698230989186]
大規模言語モデル(LLM)は、しばしば高リソース言語で強力な安全性性能を示すが、低リソース言語では深刻な脆弱性を示す。
このギャップは、言語に依存しない意味理解能力と、高リソース言語に偏った言語に支配的な安全アライメントのミスマッチによるものと考えられる。
セマンティック・アライメント(LASA)を提案し,セマンティック・ボトルネックに直接安全アライメントを固定する。
論文 参考訳(メタデータ) (2026-04-13T15:59:50Z) - SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models [6.0860786631767185]
本稿ではアラビア語モデル(ALM)の安全性を評価する統一ベンチマークであるSalamaBenchを紹介する。
このベンチマークを用いて,Fanar 1,2,ALLaM 2,Falcon H1R,Jais 2の5つの最先端ALMを複数のセーフガード構成で評価した。
論文 参考訳(メタデータ) (2026-02-03T12:13:42Z) - LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies [63.10843814055688]
M-ALERTは5つの言語における大規模言語モデルの安全性を評価するベンチマークである。
M-ALERTには言語毎に15kの高品質なプロンプトが含まれており、合計で75k、カテゴリワイドアノテーションがある。
39種類のLLMに関する実験は,言語固有の安全性解析の重要性を強調した。
論文 参考訳(メタデータ) (2024-12-19T16:46:54Z) - Arabic Dataset for LLM Safeguard Evaluation [62.96160492994489]
本研究では,アラビア語における大言語モデル(LLM)の安全性と,その言語的・文化的複雑さについて考察する。
本稿では, 直接攻撃, 間接攻撃, センシティブな単語による無害な要求を含む5,799の質問からなるアラブ地域固有の安全評価データセットを提案する。
論文 参考訳(メタデータ) (2024-10-22T14:12:43Z) - CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference [29.55937864144965]
この研究は,大規模言語モデル(LLM)におけるマルチターン対話コアの安全性を初めて研究したものである。
私たちは14のカテゴリで1,400の質問のデータセットを作成しました。
LLaMA2-Chat-7bモデルでは56%、Mistral-7B-Instructモデルでは13.9%であった。
論文 参考訳(メタデータ) (2024-06-25T15:13:02Z) - ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming [64.86326523181553]
ALERTは、新しいきめ細かいリスク分類に基づいて安全性を評価するための大規模なベンチマークである。
脆弱性を特定し、改善を通知し、言語モデルの全体的な安全性を高めることを目的としている。
論文 参考訳(メタデータ) (2024-04-06T15:01:47Z) - AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic [0.0]
AraTrustはアラビア語でLarge Language Models(LLMs)の総合的信頼性ベンチマークである。
GPT-4は最も信頼できるLCMであり、特にAceGPT 7BやJais 13Bといったオープンソースモデルはベンチマークで60%のスコアを得るのに苦労しました。
論文 参考訳(メタデータ) (2024-03-14T00:45:24Z) - All Languages Matter: On the Multilingual Safety of Large Language Models [96.47607891042523]
我々は、大規模言語モデル(LLM)のための最初の多言語安全ベンチマークを構築した。
XSafetyは、複数の言語ファミリーにまたがる10言語にわたる14種類の一般的な安全問題をカバーしている。
本稿では,ChatGPTの多言語安全性向上のための簡易かつ効果的なプロンプト手法を提案する。
論文 参考訳(メタデータ) (2023-10-02T05:23:34Z) - Safety Assessment of Chinese Large Language Models [51.83369778259149]
大規模言語モデル(LLM)は、侮辱や差別的なコンテンツを生成し、誤った社会的価値を反映し、悪意のある目的のために使用されることがある。
安全で責任があり倫理的なAIの展開を促進するため、LLMによる100万の強化プロンプトとレスポンスを含むセーフティプロンプトをリリースする。
論文 参考訳(メタデータ) (2023-04-20T16:27:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。