論文の概要: Evaluation of Adversarial Robustness in Arabic Language Models
- arxiv url: http://arxiv.org/abs/2607.25814v1
- Date: Tue, 28 Jul 2026 14:58:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.875659
- Title: Evaluation of Adversarial Robustness in Arabic Language Models
- Title(参考訳): アラビア語モデルにおける対向ロバスト性の評価
- Abstract要約: 本研究は、アラビア語に対する攻撃の異なるセットの下で、最先端の5つのアラビア語モデルの堅牢性を評価することを目的としている。
ダイアクリティカルティクスの挿入は、低距離を維持しながら、いくつかのモデルの精度を92%削減することができる。
単語レベルの攻撃では、アラビア語の接続を操作することは、高い意味的類似度スコア、低い距離を保持し、最大58%の精度低下をもたらす。
文レベルの攻撃では、パラフレーズ化は犠牲者モデルの性能を平均で76%削減することで効果を証明している。
- 参考スコア(独自算出の注目度): 2.1665689529884697
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The emergence of the recent outstanding capabilities of Arabic Language Models has opened doors for exposing their vulnerabilities. One of the major security risks associated with such Natural Language Processing models is adversarial attacks. These attacks can deceive the model into the wrong prediction, raising critical model security and safety concerns. This study aims to assess the robustness of five state-of-the-art Arabic Language Models under a distinct set of Arabic adversarial attacks applied at various levels of granularity and using different example generation strategies. We also explore a defense technique based on adversarial training to enhance model robustness. The results show that insertion of diacritics can reduce the accuracy of some models by 92% while maintaining a low perturbation distance. For word-level attacks, manipulating Arabic conjunctions preserves high semantic similarity scores, low perturbation distance, and leads to an accuracy degradation of up to 58%. For sentence-level attacks, paraphrasing proves its effectiveness by an average reduction of 76% in the victim models' performance. While adversarial training improves overall resilience, with MARBERT being the most robust and AraBERT showing the greatest relative gains, challenges persist, particularly against character-level noise. These findings highlight both the potential and limitations of current defense strategies in morphologically rich languages like Arabic.
- Abstract(参考訳): アラビア語モデルの最近の卓越した能力の出現は、その脆弱性を公開するための扉を開いた。
このような自然言語処理モデルに関連する大きなセキュリティリスクの1つは、敵攻撃である。
これらの攻撃は、モデルを誤った予測に騙し、重要なモデルのセキュリティと安全性の懸念を引き起こす可能性がある。
本研究の目的は、さまざまな粒度で適用されたアラビア語対逆攻撃の異なるセットと、異なるサンプル生成戦略を用いて、最先端の5つのアラビア語モデルの堅牢性を評価することである。
また、モデルロバスト性を高めるために、敵の訓練に基づく防御手法についても検討する。
その結果,低摂動距離を維持しながらダイアクリティカルティクスを挿入することで,モデルの精度を92%削減できることがわかった。
単語レベルの攻撃では、アラビア語の接続を操作することは、高い意味的類似度スコア、低い摂動距離を保持し、最大58%の精度低下をもたらす。
文レベルの攻撃では、パラフレーズ化は犠牲者モデルの性能を平均で76%削減することで効果を証明している。
MARBERTは最も堅牢で、AraBERTは最も高い相対的なゲインを示すが、特に文字レベルのノイズに対する課題は持続する。
これらの知見は、アラビア語のような形態学的に豊かな言語における現在の防衛戦略の可能性と限界の両方を浮き彫りにしている。
関連論文リスト
- Threats to Arabic Handwriting Recognition: Investigating Black-Box Adversarial Attacks on embedded ConvNet models [0.2519906683279152]
本研究は、敵のブラックボックス攻撃に対するハイパフォーマンスモデルの脆弱性を実証する。
アラビア文字を含む2つのベンチマークAHRデータセットで実験を行った。
論文 参考訳(メタデータ) (2026-05-18T08:45:16Z) - LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models [49.92148175114169]
制御された摂動を7次元にわたって導入することにより,系統的な脆弱性解析を行う。
モデルは、カメラの視点やロボットの初期状態を含む摂動要因に対して極端に敏感である。
驚くべきことに、モデルは言語の変化にほとんど敏感であり、さらなる実験により、モデルは言語命令を完全に無視する傾向があることが明らかになった。
論文 参考訳(メタデータ) (2025-10-15T14:51:36Z) - Differential Robustness in Transformer Language Models: Empirical Evaluation Under Adversarial Text Attacks [3.3772986620114387]
RoBERTa-BaseとFlanT5は、高度な攻撃を受けた場合でも精度を保ち、優れたレジリエンスを示した。
BERT-Baseはかなりの脆弱性を示し、TextFoolerはモデルの精度を48%から3%に下げて93.75%の成功率を達成した。
論文 参考訳(メタデータ) (2025-09-05T21:43:06Z) - Adversarial Training for Defense Against Label Poisoning Attacks [53.893792844055106]
ラベル中毒攻撃は機械学習モデルに重大なリスクをもたらす。
本稿では,これらの脅威に対処するために,サポートベクトルマシン(SVM)に基づく新たな対角的防御戦略を提案する。
提案手法は, 様々なモデルアーキテクチャに対応し, カーネルSVMを用いた予測勾配降下アルゴリズムを用いて, 対向学習を行う。
論文 参考訳(メタデータ) (2025-02-24T13:03:19Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z) - Scaling Trends in Language Model Robustness [7.725206196110384]
言語モデルのロバスト性は,いくつかの分類課題,モデルファミリー,敵対的攻撃にまたがって研究される。
明確な安全性トレーニングがなければ、より大きなモデルの方が一貫して堅牢ではないことが分かっています。
攻撃の規模は、研究対象の全モデルにまたがる敵の訓練をはるかに上回るが、より大きな敵の訓練を受けたモデルは、長期的には防衛上の優位性をもたらす可能性がある。
論文 参考訳(メタデータ) (2024-07-25T17:26:41Z) - Certified Robustness Against Natural Language Attacks by Causal
Intervention [61.62348826831147]
Causal Intervention by Semantic Smoothing (CISS)は、自然言語攻撃に対する堅牢性に向けた新しい枠組みである。
CISSは単語置換攻撃に対して確実に堅牢であり、未知の攻撃アルゴリズムによって摂動が強化されたとしても経験的に堅牢である。
論文 参考訳(メタデータ) (2022-05-24T19:20:48Z) - Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of
Language Models [86.02610674750345]
AdvGLUE(Adversarial GLUE)は、様々な種類の敵攻撃の下で、現代の大規模言語モデルの脆弱性を調査し評価するための新しいマルチタスクベンチマークである。
GLUEタスクに14の逆攻撃手法を適用してAdvGLUEを構築する。
テストしたすべての言語モデルとロバストなトレーニングメソッドは、AdvGLUEではパフォーマンスが悪く、スコアは明確な精度よりもはるかに遅れています。
論文 参考訳(メタデータ) (2021-11-04T12:59:55Z) - Evaluating Deception Detection Model Robustness To Linguistic Variation [10.131671217810581]
認知ニュース検出の設定における言語的変化に対するモデル堅牢性の解析を提案する。
2つの予測タスクを検討し,3つの最先端組込みを比較して,モデル性能の一貫した傾向を強調する。
キャラクタあるいは混合アンサンブルモデルが最も効果的な防御であり,キャラクタ摂動に基づく攻撃戦術がより成功していることがわかった。
論文 参考訳(メタデータ) (2021-04-23T17:25:38Z) - Learning to Attack: Towards Textual Adversarial Attacking in Real-world
Situations [81.82518920087175]
敵攻撃は、敵の例でディープニューラルネットワークを騙すことを目的としている。
本稿では、攻撃履歴から学習し、より効率的に攻撃を開始することができる強化学習に基づく攻撃モデルを提案する。
論文 参考訳(メタデータ) (2020-09-19T09:12:24Z) - Defense for Black-box Attacks on Anti-spoofing Models by Self-Supervised
Learning [71.17774313301753]
本研究では,自己指導型高水準表現の堅牢性について,敵攻撃に対する防御に利用して検討する。
ASVspoof 2019データセットの実験結果は、Mockingjayによって抽出されたハイレベルな表現が、敵の例の転送可能性を妨げることを示した。
論文 参考訳(メタデータ) (2020-06-05T03:03:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。