論文の概要: Quality-Diversity Evolution for Discovering Diverse Vulnerabilities in LLM Safety
- arxiv url: http://arxiv.org/abs/2606.00801v1
- Date: Sat, 30 May 2026 16:40:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.782023
- Title: Quality-Diversity Evolution for Discovering Diverse Vulnerabilities in LLM Safety
- Title(参考訳): LLM安全における多変量検出のための品質多様性の進化
- Authors: Subhadip Mitra,
- Abstract要約: セマンティックレベルで機能する品質多様性進化フレームワークを導入する。
我々は行動的な側面をまたいだ多様な攻撃のアーカイブを維持している。
意味表現は、体系的、モデル固有の弱点を示す解釈可能な攻撃を生成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current approaches to LLM adversarial testing suffer from coverage gaps: manual red-teaming does not scale, LLM-as-attacker methods exhibit mode collapse, and gradient-based approaches produce uninterpretable gibberish. We introduce a quality-diversity evolutionary framework that operates at the semantic level, evolving interpretable attack strategies rather than token sequences. Using MAP-Elites, we maintain a diverse archive of attacks across behavioral dimensions (strategy type, encoding method, prompt length). In experiments across GPT-4o-mini, Claude 3.5 Sonnet, Gemini 2.0 Flash, and an open-weight coding model (Devstral-small-2), we discover distinct vulnerability profiles: GPT-4o-mini is vulnerable to hypothetical and multi-turn framing combined with ROT13 encoding (fitness 0.8), Gemini to direct attacks with ROT13 and multi-turn with Leetspeak (0.8), while Claude shows uniformly ambiguous responses across all strategies (max 0.4). The semantic representation produces interpretable attacks that reveal systematic, model-specific weaknesses, providing actionable insights for improving LLM safety and a reproducible baseline for evaluating future frontier models. Code and experiment artifacts are released at https://github.com/bassrehab/red-queen.
- Abstract(参考訳): 手動のレッドピーキングはスケールせず、LCM-as-アタックアー法はモード崩壊を示し、勾配に基づくアプローチは解釈不能なジベリッシュを生成する。
意味レベルで機能する品質多様性の進化フレームワークを導入し,トークンシーケンスではなく,解釈可能な攻撃戦略を進化させる。
MAP-Elitesを用いて,行動次元(ストラテジー型,エンコーディング方式,プロンプト長)にわたる多様な攻撃のアーカイブを維持する。
GPT-4o-miniは、ROT13エンコーディング(適合率0.8)と組み合わせた仮説的およびマルチターンフレーミングに対して脆弱であり、GeminiはROT13によるダイレクトアタックとLeetspeakによるマルチターン(0.8)に対して、Claudeはすべての戦略(max 0.4)に対して均一にあいまいな応答を示す。
セマンティック表現は、体系的なモデル固有の弱点を明らかにするための解釈可能な攻撃を生成し、LCMの安全性を改善するための実用的な洞察と、将来のフロンティアモデルを評価するための再現可能なベースラインを提供する。
コードと実験成果物はhttps://github.com/bassrehab/red-queen.comで公開されている。
関連論文リスト
- Towards Understanding the Robustness of Sparse Autoencoders [13.16745936025085]
本稿では,事前学習したSAEを推論時に変圧器残流に組み込むことについて検討する。
SAE強化モデルは、未定義のベースラインに対するジェイルブレイク成功率を最大5倍に向上させる。
論文 参考訳(メタデータ) (2026-04-20T19:00:09Z) - DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection [45.67420390185547]
本稿では,プロンプトインジェクションに対するロバスト性を評価するためのセマンティックキャラクタであるPromptFuzz-SCを提案する。
Epsilon-greedy 探索とヒルクライミングの改良を組み合わせたハイブリッド探索手法を採用し,高品質な対向プロンプトを効率的に発見する。
DeepSeekの実験結果によると、二重空間変異は攻撃性能が最強であることが示されている。
論文 参考訳(メタデータ) (2026-04-14T10:20:15Z) - OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs [36.57820295876294]
MLLMの安全性評価のための統一的,モジュール型,高スループットのRed-teamingフレームワークであるOpenRTを紹介した。
OpenRTのコアとなるのは,5次元にわたるモジュール分離を可能にする対角カーネルを導入することで,自動化された再チームのパラダイムシフトだ。
このフレームワークは、ホワイトボックス勾配、マルチモーダル摂動、高度なマルチエージェント進化戦略など、37の多様な攻撃手法を統合している。
論文 参考訳(メタデータ) (2026-01-04T16:41:33Z) - The Trojan in the Vocabulary: Stealthy Sabotage of LLM Composition [31.827344197678126]
トケナイザー移植はサプライチェーンの脆弱性を導入する。
係数再利用の幾何学を利用して、我々の攻撃は非対称的な実現可能性ギャップを生み出す。
実験的に、攻撃は訓練なしで、スペクトルの模倣を達成し、異常検出を回避する。
論文 参考訳(メタデータ) (2025-12-31T19:00:03Z) - Evaluating Adversarial Vulnerabilities in Modern Large Language Models [0.0]
本稿では、2つの主要な公開言語モデル(LLM)に対するジェイルブレイク攻撃に対する感受性の比較分析を行う。
この研究は「自己バイパス」と「横断バイパス」の2つの主要なバイパス戦略を利用した。
攻撃の成功は、禁止されたコンテンツの生成によって決定され、ジェイルブレイクの成功によって重度スコアが割り当てられた。
論文 参考訳(メタデータ) (2025-11-21T01:23:56Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - Robust Anti-Backdoor Instruction Tuning in LVLMs [53.766434746801366]
大規模視覚言語モデル(LVLM)のための軽量で認証に依存しない防御フレームワークについて紹介する。
私たちのフレームワークは、命令チューニングの下で、アダプタモジュールとテキスト埋め込み層のみを微調整します。
Flickr30kとMSCOCOに対する7つの攻撃に対する実験は、我々の攻撃の成功率をほぼゼロに低下させることを示した。
論文 参考訳(メタデータ) (2025-06-04T01:23:35Z) - Learning diverse attacks on large language models for robust red-teaming and safety tuning [126.32539952157083]
レッドチーム、あるいは有害な応答を誘発するプロンプトの特定は、大きな言語モデルの安全なデプロイを保証するための重要なステップである。
新規性と多様性を優先する明確な規則化であっても、既存のアプローチはモード崩壊または効果的な攻撃を発生させることができないことを示す。
我々は,GFlowNetの微調整と二次平滑化フェーズを用いて,多種多様な効果的な攻撃プロンプトを生成するために攻撃モデルを訓練することを提案する。
論文 参考訳(メタデータ) (2024-05-28T19:16:17Z) - Prompt Leakage effect and defense strategies for multi-turn LLM interactions [95.33778028192593]
システムプロンプトの漏洩は知的財産を侵害し、攻撃者に対する敵の偵察として機能する可能性がある。
我々は, LLM sycophancy 効果を利用して, 平均攻撃成功率 (ASR) を17.7%から86.2%に高めるユニークな脅威モデルを構築した。
7つのブラックボックス防衛戦略の緩和効果と、漏洩防止のためのオープンソースモデルを微調整する。
論文 参考訳(メタデータ) (2024-04-24T23:39:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。