論文の概要: The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
- arxiv url: http://arxiv.org/abs/2605.09225v1
- Date: Sat, 09 May 2026 23:51:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.124833
- Title: The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
- Title(参考訳): ジェイルブレイクの芸術: バイナリスコーリングを超えたLLMセキュリティのためのジェイルブレイク攻撃をフォーミュラ化
- Abstract要約: 我々は, JailBreakV-28Kから125個の有害シードプロンプトに912個の合成戦略を適用し,114,000個の敵プロンプトを構築した。
私たちは、推論時に有害なシードから、流動的なjailbreakプロンプトを合成するモデルを作ります。
安全フィルタ回避率は0.29-0.51 MalであるAutoDANとAmpleGCGは24-39対40-140である。
- 参考スコア(独自算出の注目度): 1.0262304700896199
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Jailbreak attacks -- adversarial prompts that bypass LLM alignment through purely linguistic manipulation -- pose a growing operational security threat, yet the field lacks large-scale, reproducible infrastructure for generating, categorizing, and evaluating them systematically. This paper addresses that gap with three contributions. (1) Large-scale compositional jailbreak dataset. We construct 114,000 adversarial prompts by applying 912 composing strategies to 125 harmful seed prompts from JailBreakV-28K. Every prompt is assigned to one of 14 cybersecurity attack categories (e.g., malware, phishing, privilege escalation) via a six-model majority-vote pipeline, and each strategy is ranked by effectiveness per category, enabling principled strategy selection grounded in concrete adversarial objectives. (2) Automated jailbreak generation. We instruction-fine-tune category-aware LLMs on Moderate and Optimal subsets, producing models that synthesize fluent jailbreak prompts from a harmful seed at inference time -- no templates, no gradient search. Our generators achieve perplexity 24-39 versus 40-140 for AutoDAN and AmpleGCG, with safety-filter evasion rates of 0.29-0.51 Mal (LlamaPromptGuard-2-86M), enabling controllable, scalable red-teaming under realistic adversarial conditions. (3) OPTIMUS: a training-free jailbreak evaluator. OPTIMUS is a continuous metric J(S,H) that jointly captures semantic similarity between the harmful seed and the jailbreak (S) and harmfulness probability (H) via calibrated penalty functions. Unlike binary attack success rate (ASR), OPTIMUS requires no task-specific training, generalizes across evolving strategies, and exposes a stealth-optimal regime (S*=0.57, H*=0.43) that ASR misses. Experiments across 114,000 prompts confirm that OPTIMUS separates Weak, Moderate, and Optimal jailbreaks with category-level evidence binary evaluation cannot supply.
- Abstract(参考訳): ジェイルブレイク攻撃は、LLMのアライメントを純粋に言語操作でバイパスするという敵対的な行為は、運用上のセキュリティ上の脅威を増大させるが、現場には、それらを生成、分類、体系的に評価するための大規模で再現可能なインフラが欠けている。
本稿では,そのギャップを3つのコントリビューションで解決する。
1)大規模構成ジェイルブレイクデータセット。
我々は, JailBreakV-28Kから125個の有害シードプロンプトに912個の合成戦略を適用し,114,000個の敵プロンプトを構築した。
各プロンプトは6モデルの多数決投票パイプラインを介して14のサイバーセキュリティ攻撃カテゴリ(マルウェア、フィッシング、特権エスカレーションなど)に割り当てられ、それぞれの戦略はカテゴリごとに有効性によってランク付けされ、具体的な敵の目的に根ざした原則化された戦略選択を可能にする。
2)自動ジェイルブレイク発生
私たちは、ModerateとOptimalのサブセットに、微妙なカテゴリを意識したLLMを指示し、推論時に有害なシードから、流動的なjailbreakプロンプトを合成するモデルを作成します。
筆者らはAutoDANとAmpleGCGで24-39対40-140のパープレキシティを実現し, 安全フィルタ回避率は0.29-0.51 Mal (LlamaPromptGuard-2-86M) であり, 現実的な対向条件下での可制御性, 拡張性を実現している。
(3) OPTIMUS: フリージェイルブレイク評価器。
OPTIMUSは、有害種子とジェイルブレイク(S)と有害確率(H)の相似性を校正されたペナルティ関数を介して共同にキャプチャする連続計量 J(S,H) である。
バイナリアタック成功率(ASR)とは異なり、OPTIMUSはタスク固有のトレーニングを必要とせず、進化する戦略を一般化し、ASRが見逃すステルス最適体制(S*=0.57, H*=0.43)を公開する。
114,000件の実験では、OPTIMUSがWeak、Moderate、Optimalのジェイルブレイクを分離し、二項評価が供給できないことを確認している。
関連論文リスト
- AlcaTRAz - Anchored Tree-Rule Defense Against Jailbreaks [0.08699280339422538]
大規模言語モデル(LLM)は、慎重に構築されたプロンプトを通じて安全アライメントをバイパスするジェイルブレイク攻撃に対して脆弱である。
本稿では,AlcaTRAzを提案する。AlcaTRAzは,入力テキストのみで動作するルールツリーに基づく,プロンプトレベルの防御手法である。
提案手法は,33のオープンウェイトモデル,22のジェイルブレイク攻撃タイプ,および短い単ターンベニグナーのベンチマークで評価した。
論文 参考訳(メタデータ) (2026-09-03T11:30:08Z) - Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics [50.36375380196006]
ジェイルブレイクプロンプトは、大規模な言語モデルにおけるアライメントガードレールをバイパスすることができる。
先行検出アプローチは固定距離空間に大きく依存する。
この仮定は,意図によって無視されるが,安全関連キーワードを含む疑似悪質なプロンプトの下で破られることを示す。
本稿では, LLM を入力を出力に変換する運動系として扱う Manifold Trajectory Kinetics (MTK) を提案する。
論文 参考訳(メタデータ) (2026-06-05T14:49:26Z) - Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models [2.6140509675507384]
我々はセキュリティと解釈可能性の両方の観点からジェイルブレイクを研究する。
隠れアクティベーションにおける構造をキャプチャするテンソルベース潜在表現フレームワークを提案する。
以上の結果から,脱獄行動が内部構造に根ざしていることが示唆された。
論文 参考訳(メタデータ) (2026-02-12T02:43:17Z) - Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense [55.77152277982117]
私たちは、jailbreak攻撃から防御するために設計された方法であるLayer-AdvPatcherを紹介します。
私たちは、自己拡張データセットを通じて、大規模言語モデル内の特定のレイヤにパッチを適用するために、未学習の戦略を使用します。
我々の枠組みは、脱獄攻撃の有害性と攻撃の成功率を減らす。
論文 参考訳(メタデータ) (2025-01-05T19:06:03Z) - LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds [98.20826635707341]
ジェイルブレイク攻撃は、慎重に製作されたプロンプトを通じて有害なアウトプットを引き出すことによって、安全に整合したLDMの脆弱性を露呈する。
私たちはジェイルブレイクを推論時のミスアライメントとして捉え、高速でブラックボックスのベスト・オブ・N$サンプリングアタックであるLIARを導入しました。
また、安全アライメント強度を定量化し、最適下界を導出するための理論的「ジェイルブレイクに対する安全ネット」指標も導入する。
論文 参考訳(メタデータ) (2024-12-06T18:02:59Z) - Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation [71.92055093709924]
そこで本稿では, ガーブレッドの逆数プロンプトを, 一貫性のある, 可読性のある自然言語の逆数プロンプトに"翻訳"する手法を提案する。
また、jailbreakプロンプトの効果的な設計を発見し、jailbreak攻撃の理解を深めるための新しいアプローチも提供する。
本稿では,AdvBench上でのLlama-2-Chatモデルに対する攻撃成功率は90%以上である。
論文 参考訳(メタデータ) (2024-10-15T06:31:04Z) - HSF: Defending against Jailbreak Attacks with Hidden State Filtering [14.031010511732008]
隠れ状態フィルタ(HSF)に基づくジェイルブレイク攻撃防御戦略を提案する。
HSFは、推論プロセスが始まる前に、モデルが相手の入力をプリエンプティブに識別し、拒否することを可能にする。
不正なユーザクエリに対する応答を最小限に抑えながら、Jailbreak攻撃の成功率を大幅に低下させる。
論文 参考訳(メタデータ) (2024-08-31T06:50:07Z) - EnJa: Ensemble Jailbreak on Large Language Models [69.13666224876408]
大きな言語モデル(LLM)は、安全クリティカルなアプリケーションにますますデプロイされている。
LLMは、悪質なプロンプトを慎重に作り、ポリシーに違反するコンテンツを生成することで、まだジェイルブレイクされる可能性がある。
本稿では,プロンプトレベルのジェイルブレイクを用いて有害な命令を隠蔽し,グラデーションベースの攻撃で攻撃成功率を高め,テンプレートベースのコネクタを介して2種類のジェイルブレイク攻撃を接続する新しいEnJa攻撃を提案する。
論文 参考訳(メタデータ) (2024-08-07T07:46:08Z) - AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens [83.08119913279488]
本稿では,ジェイルブレイク攻撃と防衛技術における依存関係の体系的解析について述べる。
包括的な、自動化された、論理的な3つのフレームワークを提案します。
このアンサンブル・ジェイルブレイク・アタックと防衛の枠組みは,既存の研究を著しく上回る結果となった。
論文 参考訳(メタデータ) (2024-06-06T07:24:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。