論文の概要: DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection
- arxiv url: http://arxiv.org/abs/2607.19829v1
- Date: Wed, 22 Jul 2026 07:08:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.997594
- Title: DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection
- Title(参考訳): DARWIN: LLMの安全評価と保護のための脱獄対策とガードレールの展開
- Authors: Weiwei Qi, Zefeng Wu, Zhilin Guo, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui Ren,
- Abstract要約: DARWIN-Attackは、ジェイルブレイクをオープンエンド進化プロセスとして定式化する進化的攻撃防御フレームワークである。
DarWIN-Guardは、DARWIN-Attackが生み出した新たな敵のサンプルから反復的に学習するオンライン逆行訓練パラダイムである。
DarWIN-Guardは12の安全ベンチマークで平均91.6%の安全でないリコールを達成し、YuFeng-XGuardやNemotron Guardといった強力なガードレールを上回った。
- 参考スコア(独自算出の注目度): 39.80800694486431
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most existing LLM safety evaluation and defense methods follow a static formulation: jailbreak vulnerabilities are evaluated with fixed attack methods, and guardrails are trained on fixed malicious prompt datasets. However, real-world adversaries continuously evolve their capabilities and expand the attack space. To address this challenge, we propose DARWIN, an evolutionary attack-defense framework that formulates jailbreaking as an open-ended evolution process and continuously updates guardrails through an evolving attack-defense loop. DARWIN-Attack is an evolutionary adversary that expands its capabilities through strategy discovery, mutation, selection, and feedback-driven composition. It collects strategies from broad external sources, generates new variants through self-reflection and genetic evolution, and retains effective strategies based on their performance against aligned LLMs. During attack execution, DARWIN-Attack adaptively selects and combines evolved strategies according to feedback from target LLMs and guardrails. Across frontier models and guardrails, it achieves state-of-the-art attack success rates, including nearly 100% on DeepSeek-V4-Pro and YuFeng-XGuard and over 90% on GPT-5.5. On the defense side, we introduce DARWIN-Guard, an online adversarial training paradigm that iteratively learns from emerging adversarial samples generated by DARWIN-Attack. To improve robustness without sacrificing utility, DARWIN-Guard jointly trains on malicious and benign disguised queries, encouraging the model to identify underlying intent rather than superficial attack patterns. DARWIN-Guard achieves an average unsafe recall of 91.6% across 12 safety benchmarks, outperforming strong guardrails such as YuFeng-XGuard and Nemotron Guard, while maintaining a nearly 100% pass rate on standard benign datasets.
- Abstract(参考訳): ジェイルブレイク脆弱性は、固定された攻撃方法で評価され、ガードレールは、固定された悪意のあるプロンプトデータセットでトレーニングされる。
しかし、現実世界の敵は継続的にその能力を進化させ、攻撃空間を広げる。
この課題に対処するため、我々は、Jailbreakingをオープンな進化プロセスとして定式化し、進化するアタック・ディフェンス・ループを通じてガードレールを継続的に更新する進化的アタック・ディフェンス・フレームワークであるDARWINを提案する。
DARWIN-Attackは、戦略発見、突然変異、選択、フィードバックによる構成を通じてその能力を拡大する進化的敵である。
幅広い外部ソースから戦略を収集し、自己回帰と遺伝的進化を通じて新しい変種を発生させ、協調LDMに対するパフォーマンスに基づく効果的な戦略を維持している。
攻撃実行中、DARWIN-AttackはターゲットのLSMとガードレールからのフィードバックに応じて、進化した戦略を適応的に選択し、組み合わせる。
フロンティアモデルとガードレール全体では、DeepSeek-V4-ProとYuFeng-XGuardで100%近く、GPT-5.5で90%以上を含む最先端の攻撃成功率を達成した。
DARWIN-Guardは、DARWIN-Attackが生み出した新たな敵検体から反復的に学習するオンライン逆検訓練パラダイムである。
実用性を犠牲にすることなく堅牢性を向上させるため、DARWIN-Guardは悪意のある偽りのクエリを共同でトレーニングし、表面的な攻撃パターンではなく、基盤となる意図を特定することを奨励する。
DARWIN-Guardは12の安全ベンチマークで平均91.6%の安全でないリコールを達成し、YuFeng-XGuardやNemotron Guardのような強力なガードレールを上回り、標準の良性データセットの100%パスレートを維持している。
関連論文リスト
- On the Vulnerability of Parameter-Level Defenses to Model Merging [75.62810606927121]
我々は,既存の安全対策を回避するため,アンカー誘導攻撃(AGA)を提案する。
AGAは、現実的な防衛非依存シナリオの下で、個々の防衛と複合防衛の両方を一貫してバイパスする。
我々は、AGAが活用するアンカーの優位性を軽減するために、アンカー推進ファインチューニング(ARF)を提供する。
論文 参考訳(メタデータ) (2026-06-29T14:26:13Z) - Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution [43.00984815993804]
EvoSafetyは、永続的で検査可能で再利用可能な外部構造を中心に構築された安全フレームワークである。
レッドチームでは、EvoSafetyは攻撃ポリシーに敵のスキルライブラリを装備し、継続的な脆弱性調査を可能にする。
防衛学習のために、EvoSafetyは、モデル固有の安全性の微調整を、メモリ検索を付加した軽量な補助防衛モデルに置き換える。
論文 参考訳(メタデータ) (2026-05-13T12:07:05Z) - CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks [31.582651893036683]
CoopGuardは、協調エージェントに基づくステートフルなマルチラウンドLLM防衛フレームワークである。
補助的なラウンドレベル戦略のために3つの特殊エージェントを雇用している。
実験によると、CoopGuardは最先端の防御に対して攻撃の成功率を78.9%削減している。
論文 参考訳(メタデータ) (2026-04-05T11:06:13Z) - MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety [28.246225272659917]
本稿では,新しいマルチターンマルチエージェント強化学習フレームワークであるtextbfMAGICを紹介する。
大規模言語モデルの安全性アライメントを敵非対称ゲームとして定式化する。
本フレームワークは, モデルの有用性を損なうことなく, 優れた防衛成功率を示す。
論文 参考訳(メタデータ) (2026-02-02T02:12:28Z) - An Automated Framework for Strategy Discovery, Retrieval, and Evolution in LLM Jailbreak Attacks [9.715575204912167]
攻撃戦略を自律的に発見し,回収し,進化させる脱獄フレームワークを提案する。
ASTRAは平均アタック成功率(ASR)が82.7%に達し、ベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2025-11-04T08:24:22Z) - The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections [74.60337113759313]
現在のジェイルブレイクとプロンプトインジェクションに対する防御は、通常、有害な攻撃文字列の静的セットに対して評価される。
我々は,この評価プロセスに欠陥があることを論じる。代わりに,攻撃戦略を明示的に修正したアダプティブアタッカーに対する防御を,防衛設計に対抗して評価すべきである。
論文 参考訳(メタデータ) (2025-10-10T05:51:04Z) - MARS: A Malignity-Aware Backdoor Defense in Federated Learning [51.77354308287098]
最近提案されたSOTA攻撃(3DFed)は、ディフェンダーがバックドアモデルを受け入れたかどうかを判断するためにインジケータ機構を使用する。
本稿では,各ニューロンの有害な範囲を示すためにバックドアエネルギーを利用するMARS(Maignity-Aware backdooR defenSe)を提案する。
実験により、MARSはSOTAのバックドア攻撃に対して防御でき、既存の防御を著しく上回っていることが示された。
論文 参考訳(メタデータ) (2025-09-21T14:50:02Z) - SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks [53.28390057407576]
現代のNLPモデルは、様々なソースから引き出された公開データセットでしばしば訓練される。
データ中毒攻撃は、攻撃者が設計した方法でモデルの振る舞いを操作できる。
バックドア攻撃に伴うリスクを軽減するために、いくつかの戦略が提案されている。
論文 参考訳(メタデータ) (2024-05-19T14:50:09Z) - Guided Adversarial Attack for Evaluating and Enhancing Adversarial
Defenses [59.58128343334556]
我々は、より適切な勾配方向を見つけ、攻撃効果を高め、より効率的な対人訓練をもたらす標準損失に緩和項を導入する。
本稿では, クリーン画像の関数マッピングを用いて, 敵生成を誘導するGAMA ( Guided Adversarial Margin Attack) を提案する。
また,一段防衛における最先端性能を実現するためのGAT ( Guided Adversarial Training) を提案する。
論文 参考訳(メタデータ) (2020-11-30T16:39:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。