論文の概要: MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
- arxiv url: http://arxiv.org/abs/2605.11002v1
- Date: Sun, 10 May 2026 00:17:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.290827
- Title: MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
- Title(参考訳): MT-JailBench: マルチTurnjailbreak攻撃を理解するためのモジュールベンチマーク
- Authors: Xinkai Zhang, Zhipeng Wei, Huanli Gong, Jing Ting Zheng, Yuchen Zhang, Yue Dong, N. Benjamin Erichson,
- Abstract要約: マルチターンジェイルブレイクは、大きな言語モデルが会話のコンテキストに蓄積して作用する能力を利用する。
報告されたゲインがより強力な攻撃機構や異なる実験条件を反映しているかは、しばしば不明である。
固定条件下でマルチターンジェイルブレイクをベンチマークするモジュール評価フレームワークMT-JailBenchを紹介する。
- 参考スコア(独自算出の注目度): 16.699418698714585
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-turn jailbreaks exploit the ability of large language models to accumulate and act on conversational context. Instead of stating a harmful request directly, an attacker can gradually steer the conversation toward an unsafe answer. Recent methods demonstrate this risk, but they are usually evaluated as black-box pipelines with different budgets, judges, retry rules, and strategy generation procedures. As a result, it is often unclear whether reported gains reflect stronger attack mechanisms or different experimental conditions. We introduce MT-JailBench, a modular evaluation framework for benchmarking multi-turn jailbreaks under fixed conditions. MT-JailBench implements each attack as five interacting modules: evaluation function, attack strategy, prompt generation, prompt refinement, and flow control. This design enables fair comparison across attack methods and component-wise analysis of what drives attack success. Using MT-JailBench, we find that resource budgets and evaluation functions are major confounders: controlling turns, retries, interactions, sampled strategies, and judges substantially change the ranking of attacks. At the component level, prompt generation accounts for most performance variation, while refinement and flow control provide moderate gains. We also find that explicit dynamic strategy generation is not always necessary; stochastic sampling from a fixed strategy can rival more elaborate diversification mechanisms. Finally, recomposing the best components yields a strong attack configuration that outperforms its source attacks and generalizes across diverse target LLMs. MT-JailBench therefore provides a modular framework for comparing multi-turn jailbreaks, understanding the impact of components, and guiding stronger red-teaming evaluations.
- Abstract(参考訳): マルチターンジェイルブレイクは、大きな言語モデルが会話のコンテキストに蓄積して作用する能力を利用する。
有害な要求を直接述べる代わりに、攻撃者は徐々に会話を安全でない回答に向けて操縦することができる。
最近の手法はこのリスクを示すが、通常、異なる予算、審査、再試行規則、戦略生成手順を備えたブラックボックスパイプラインとして評価される。
その結果、報告されたゲインがより強い攻撃機構や異なる実験条件を反映しているかは、しばしば不明である。
固定条件下でマルチターンジェイルブレイクをベンチマークするモジュール評価フレームワークMT-JailBenchを紹介する。
MT-JailBenchは、評価関数、アタック戦略、即時生成、即時改善、フロー制御の5つの相互作用モジュールとして、各攻撃を実装している。
この設計により、アタックメソッド間の公正な比較と、アタックの成功を駆動するコンポーネントワイズ分析が可能になる。
MT-JailBenchを使用すると、リソース予算と評価関数が主要な共同創設者であることがわかった。
コンポーネントレベルでは、プロンプト生成はほとんどのパフォーマンスのばらつきを考慮し、リファインメントとフローコントロールは適度な利得を提供する。
固定戦略からの確率的サンプリングは、より精巧な多様化メカニズムに匹敵する可能性がある。
最後に、最高のコンポーネントを再コンパイルすると、ソースアタックよりも優れた強力なアタック構成が得られ、多様なターゲットLLMにわたって一般化される。
したがって、MT-JailBenchはマルチターンジェイルブレイクを比較し、コンポーネントの影響を理解し、より強力なレッドチーム評価を導くためのモジュラーフレームワークを提供する。
関連論文リスト
- SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking [24.752522468137443]
我々は、攻撃戦略を体系的に発見、構成、洗練する自己進化型ルール駆動型トレーニングフリージェイルブレイク(SRTJ)フレームワークを提案する。
結果として生じるルールメモリは階層的なマルチレベルな方法で進化し、蒸留された攻撃知識を長期的、中期的、短期的なルールに明示的に整理する。
SRTJは、既存のjailbreak法と比較して、一般化と堅牢性を向上しつつ、異なる目標LLMに対して、強力で安定した攻撃性能を実現する。
論文 参考訳(メタデータ) (2026-05-01T17:27:45Z) - SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks [53.97948802255959]
本稿では,既存の戦略や外部データに頼ることなく,マルチターン攻撃者を訓練するフレームワークを提案する。
準備された自己調整は、非拒否的で、よく構造化された、多ターンの逆のプロンプトを微調整することで、使用可能なロールアウトを可能にする。
私たちは、意図の整合性、コンプライアンスリスク、詳細レベルを組み合わせたインテントドリフト対応の報酬を通じて、多ターンジェイルブレイクにおける有害な意図を保ちます。
論文 参考訳(メタデータ) (2026-02-06T16:44:57Z) - RL-MTJail: Reinforcement Learning for Automated Black-Box Multi-Turn Jailbreaking of Large Language Models [60.201244463046784]
大規模な言語モデルは、ジェイルブレイク攻撃に弱い。
本稿では,ブラックボックスのマルチターンジェイルブレイクについて検討し,ブラックボックスモデルから有害なコンテンツを引き出すように攻撃者のLDMを訓練することを目的とした。
論文 参考訳(メタデータ) (2025-12-08T17:42:59Z) - OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation [94.61617176929384]
OmniSafeBench-MMはマルチモーダル・ジェイルブレイク攻撃防御評価のための総合ツールボックスである。
13の代表的な攻撃方法と15の防衛戦略、9つの主要なリスクドメインと50のきめ細かいカテゴリにまたがる多様なデータセットを統合している。
データ、方法論、評価をオープンソースで再現可能なプラットフォームに統合することで、OmniSafeBench-MMは将来の研究のための標準化された基盤を提供する。
論文 参考訳(メタデータ) (2025-12-06T22:56:29Z) - JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering [73.962469626788]
マルチモーダルな大規模言語モデル(MLLM)に対するジェイルブレイク攻撃は重要な研究課題である。
JPS, UnderlineJailbreak MLLMs with collaborative visual underlinePerturbation and textual underlineSteering。
論文 参考訳(メタデータ) (2025-08-07T07:14:01Z) - MetaCipher: A Time-Persistent and Universal Multi-Agent Framework for Cipher-Based Jailbreak Attacks for LLMs [14.530593083777502]
低コストでマルチエージェントのジェイルブレイクフレームワークであるMetaCipherを提案する。
わずか10クエリで、MetaCipherは最近の悪意のあるプロンプトベンチマークで最先端の攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-06-27T18:15:56Z) - PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks [7.252454104194306]
大きな言語モデル(LLM)は目覚ましい能力を達成したが、ジェイルブレイクとして知られる敵のプロンプトに弱いままである。
LLMの安全性研究への取り組みが増えているにもかかわらず、既存の評価はしばしば断片化され、単独の攻撃や防御技術に焦点が当てられている。
PandaGuardはLLMジェイルブレイクの安全性を攻撃者、ディフェンダー、および審査員で構成されるマルチエージェントシステムとしてモデル化する、統一的でモジュール化されたフレームワークである。
論文 参考訳(メタデータ) (2025-05-20T03:14:57Z) - AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens [83.08119913279488]
本稿では,ジェイルブレイク攻撃と防衛技術における依存関係の体系的解析について述べる。
包括的な、自動化された、論理的な3つのフレームワークを提案します。
このアンサンブル・ジェイルブレイク・アタックと防衛の枠組みは,既存の研究を著しく上回る結果となった。
論文 参考訳(メタデータ) (2024-06-06T07:24:41Z) - Generalizable Black-Box Adversarial Attack with Meta Learning [54.196613395045595]
ブラックボックス攻撃では、ターゲットモデルのパラメータが不明であり、攻撃者はクエリのフィードバックに基づいて、クエリの予算に基づいて摂動を成功させることを目指している。
本稿では,実例レベルの逆転可能性という,過去の攻撃に対するフィードバック情報を活用することを提案する。
この2種類の逆転送性を持つフレームワークは,市販のクエリベースのアタック手法と自然に組み合わせて性能を向上させることができる。
論文 参考訳(メタデータ) (2023-01-01T07:24:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。