論文の概要: A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination
- arxiv url: http://arxiv.org/abs/2608.04034v1
- Date: Mon, 03 Aug 2026 02:28:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.37983
- Title: A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination
- Title(参考訳): 原子ジェイルブレイク戦略のデカップリングと組み合わせによるマルチモーダル自動リピート評価
- Abstract要約: MLLM(Multimodal Large Language Models)は画像テキストの理解と生成において顕著な進歩を遂げている。
有害なアウトプットを誘発し、深刻な安全上の懸念を引き起こす可能性がある。
既存のマルチモーダル・ジェイルブレイク攻撃は、そのような攻撃の可能性を示しているが、それでも2つの根本的な課題に直面している。
- 参考スコア(独自算出の注目度): 24.819747080813485
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have achieved impressive progress in image-text comprehension and generation, yet they remain susceptible to jailbreak attacks that can trigger harmful outputs and pose serious safety concerns. Existing multimodal jailbreak attacks have shown the feasibility of such attacks, but they still face two fundamental challenges: the lack of a atomic multi-modal strategy space, the absence of a concise and efficient executable framework beyond human-craft experience. To address these challenges, we first decompose the text-image jailbreak strategy space into three levels: structural, semantic, and syntactic, constructing a jailbreak strategy set encompassing both text and image modalities to systematically achieve combined coverage of different attack types. Then we propose a multimodal automated red team jailbreak method named Hierarchical Atomic Combination Attack (HACA). Specifically, based on a six-dimensional strategy space, a cross-modal joint planner is used to select and combine the different atomic jailbreak strategy for subsequent jailbreak command generation. Finally, at the implementation level, we explore to apply a unified generate executor to directly generate jailbreak instructions based on the selected multi-modal strategies. A series of experiments show that our automated red team method can achieve an attack success rate of average 95.48\% against five mainstream MLLMs.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、画像テキストの理解と生成において目覚ましい進歩を遂げているが、有害なアウトプットを引き起こし、深刻な安全上の懸念を引き起こす可能性があるジェイルブレイク攻撃の影響を受け続けている。
既存のマルチモーダル・ジェイルブレイク攻撃はそのような攻撃の可能性を示しているが、それでも2つの根本的な課題に直面している: 原子的マルチモーダル戦略空間の欠如、簡潔で効率的な実行可能なフレームワークの欠如。
これらの課題に対処するために、まず、テキストイメージのジェイルブレイク戦略空間を、構造、意味、構文の3つのレベルに分解し、テキストと画像の両方を含むジェイルブレイク戦略セットを構築し、異なる攻撃タイプの複合カバレッジを体系的に達成する。
次に,階層的原子結合攻撃 (HACA) と呼ばれるマルチモーダルのレッドチームジェイルブレイク手法を提案する。
具体的には、6次元の戦略空間に基づいて、次のジェイルブレイクコマンド生成のために異なる原子ジェイルブレイク戦略を選択し、組み合わせるために、クロスモーダルな共同プランナーが使用される。
最後に、実装レベルでは、選択したマルチモーダル戦略に基づいてジェイルブレイク命令を直接生成するために、統一された生成エグゼキュータを適用することを検討する。
一連の実験により、我々の自動レッドチーム方式は、5つのメインストリームMLLMに対して平均95.48\%の攻撃成功率を達成することができた。
関連論文リスト
- Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection [1.8374319565577155]
脱獄技術は、大規模言語モデルの安全性に重大な脅威をもたらす。
ジェイルブレイク技術の有効性の理解を深めるために,構造化されたレッドチームチャレンジを実施した。
我々は、50のジェイルブレイク戦略の包括的な階層的な分類法を開発し、以前の分類を7つの広い家族に集約し拡張した。
論文 参考訳(メタデータ) (2025-10-14T12:34:41Z) - Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models [80.66766532477973]
テストタイム免疫(TIM)は、自己進化的な方法で様々なジェイルブレイク攻撃に対して適応的に防御することができる。
テストタイム免疫(TIM)は、自己進化的な方法で様々なジェイルブレイク攻撃に対して適応的に防御することができる。
論文 参考訳(メタデータ) (2025-05-28T11:57:46Z) - Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models [1.0768089718297513]
本稿では,マルチモーダルジェイルブレイク手法であるJMLLMを提案する。
テキスト、視覚、聴覚のモダリティにわたって包括的なジェイルブレイク攻撃を実行するために、複数の戦略を統合する。
また、マルチモーダルジェイルブレイク研究のための新しい包括的データセットTriJailも提供します。
論文 参考訳(メタデータ) (2024-12-21T09:43:51Z) - Rapid Response: Mitigating LLM Jailbreaks with a Few Examples [13.841146655178585]
我々は,少数の攻撃を観測した後に,脱獄のクラス全体をブロックするために,迅速な応答手法を開発した。
我々は5つの迅速応答法を評価し,それぞれがジェイルブレイク増殖を利用した。
我々の最強の方法は、ジェイルブレイクの非分配セットで240以上、アウト・オブ・ディストリビューションセットで15以上、攻撃成功率で240以上削減する。
論文 参考訳(メタデータ) (2024-11-12T02:44:49Z) - IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves [70.43466586161345]
IDEATORは、ブラックボックスジェイルブレイク攻撃のための悪意のある画像テキストペアを自律的に生成する新しいジェイルブレイク手法である。
最近リリースされたVLM11のベンチマーク結果から,安全性の整合性に大きなギャップがあることが判明した。
例えば、我々はASRをGPT-4oで46.31%、Claude-3.5-Sonnetで19.65%と設定した。
論文 参考訳(メタデータ) (2024-10-29T07:15:56Z) - PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs [33.87649859430635]
大規模言語モデル(LLM)は様々なタスクに優れていますが、それでも脱獄攻撃に対して脆弱です。
PAPILLONは自動ブラックボックスジェイルブレイク攻撃フレームワークである。
ブラックボックスのファジテストアプローチを、一連のカスタマイズされた設計で適用する。
論文 参考訳(メタデータ) (2024-09-23T10:03:09Z) - h4rm3l: A language for Composable Jailbreak Attack Synthesis [48.5611060845958]
h4rm3lは、人間が読めるドメイン固有言語とのギャップに対処する新しいアプローチである。
我々は、h4rm3lの合成攻撃は、文献における既存のジェイルブレイク攻撃よりも多様で、より成功していることを示す。
論文 参考訳(メタデータ) (2024-08-09T01:45:39Z) - EnJa: Ensemble Jailbreak on Large Language Models [69.13666224876408]
大きな言語モデル(LLM)は、安全クリティカルなアプリケーションにますますデプロイされている。
LLMは、悪質なプロンプトを慎重に作り、ポリシーに違反するコンテンツを生成することで、まだジェイルブレイクされる可能性がある。
本稿では,プロンプトレベルのジェイルブレイクを用いて有害な命令を隠蔽し,グラデーションベースの攻撃で攻撃成功率を高め,テンプレートベースのコネクタを介して2種類のジェイルブレイク攻撃を接続する新しいEnJa攻撃を提案する。
論文 参考訳(メタデータ) (2024-08-07T07:46:08Z) - Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models [15.582860145268553]
JailFuzzerは、大きな言語モデル(LLM)エージェントによって駆動される新しいファジングフレームワークである。
自然かつ意味的に一貫性のあるプロンプトを生成し、従来の防御による検出の可能性を減らす。
クエリオーバーヘッドを最小限に抑えたジェイルブレイク攻撃で高い成功率を達成する。
論文 参考訳(メタデータ) (2024-08-01T12:54:46Z) - AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens [83.08119913279488]
本稿では,ジェイルブレイク攻撃と防衛技術における依存関係の体系的解析について述べる。
包括的な、自動化された、論理的な3つのフレームワークを提案します。
このアンサンブル・ジェイルブレイク・アタックと防衛の枠組みは,既存の研究を著しく上回る結果となった。
論文 参考訳(メタデータ) (2024-06-06T07:24:41Z) - EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models [53.87416566981008]
本稿では,大規模言語モデル(LLM)に対するジェイルブレイク攻撃の構築と評価を容易にする統合フレームワークであるEasyJailbreakを紹介する。
Selector、Mutator、Constraint、Evaluatorの4つのコンポーネントを使ってJailbreak攻撃を構築する。
10の異なるLSMで検証した結果、さまざまなジェイルブレイク攻撃で平均60%の侵入確率で重大な脆弱性が判明した。
論文 参考訳(メタデータ) (2024-03-18T18:39:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。