論文の概要: MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities
- arxiv url: http://arxiv.org/abs/2608.25490v1
- Date: Wed, 26 Aug 2026 08:03:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.665513
- Title: MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities
- Title(参考訳): MMJailBench: マルチモーダルジェイルブレーク脆弱性の解消のための因子ベンチマーク
- Abstract要約: MMJailBenchは、制御された構成下にある因子を体系的に変化させ、結合する因子化ベンチマークである。
ジェイルブレイクの脆弱性は、現在のマルチモーダルセーフティアライメントにおける不均一なカバレッジを露呈する。
フルかつ軽量な構成,複数判定オプション,多次元メトリクスを備えたモジュール型マルチモーダルジェイルブレイク評価スイートを開発した。
- 参考スコア(独自算出の注目度): 17.17645010365275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) are increasingly deployed in real-world applications, yet how different factors shape their jailbreak vulnerabilities remains poorly understood. Existing benchmarks often couple harmful intent, prompt framing, visual semantics, and instruction carrier within individual jailbreak instances, obscuring the specific sources of observed vulnerabilities. To address this limitation, we introduce MMJailBench, a factorized benchmark that systematically varies and combines these factors under controlled configurations, enabling fine-grained comparison and factor-level attribution. Large-scale evaluations across 16 open-weight and proprietary MLLMs reveal highly heterogeneous and model-dependent vulnerability profiles. Jailbreak vulnerability varies markedly across harm domains, exposing uneven coverage in current multimodal safety alignment. Prompt framing emerges as the dominant source of variation, task-relevant visual semantics systematically increase jailbreak susceptibility with authority-like cues exposing particularly pronounced vulnerabilities, and visually rendered instructions do not consistently increase jailbreak susceptibility relative to direct textual instructions. To further investigate the risks introduced by multimodal context, we conduct diagnostic analyses on a representative open-weight model and identify vulnerability-associated patterns in internal representations and cross-modal interactions. Finally, we develop a modular multimodal jailbreak evaluation suite with full and lightweight configurations, multiple judge options, and multidimensional metrics, enabling reproducible, scalable, and cost-efficient multimodal jailbreak auditing.
- Abstract(参考訳): マルチモーダル大規模言語モデル(MLLM)は、現実のアプリケーションにますますデプロイされているが、異なる要因が脱獄の脆弱性をどう形成するかは理解されていない。
既存のベンチマークでは、個々のjailbreakインスタンス内で有害なインテント、プロンプトフレーミング、視覚的セマンティクス、およびインストラクションキャリアを混在させ、観察された脆弱性の特定のソースを隠蔽することが多い。
この制限に対処するため、MMJailBenchは、これらの因子を体系的に変化させ、制御された構成下で結合し、きめ細かい比較と因子レベルの属性を可能にする因子化ベンチマークである。
16のオープンウェイトおよびプロプライエタリMLLMにわたる大規模評価では、非常に異質でモデルに依存した脆弱性プロファイルが示されている。
ジェイルブレイクの脆弱性は、現在のマルチモーダルセーフティアライメントにおける不均一なカバレッジを露呈する。
プロンプトフレーミングは変化の主要な原因として現れ、タスク関連視覚的セマンティクスは、特に顕著な脆弱性を露呈する権威のような手がかりによるジェイルブレイクの感受性を体系的に増加させ、視覚的に描画された命令は、直接のテキストによる指示に対するジェイルブレイクの感受性を一貫して増加させない。
マルチモーダルコンテキストがもたらすリスクをさらに調査するため,代表的オープンウェイトモデルを用いて診断分析を行い,内部表現や相互モーダル相互作用における脆弱性関連パターンを同定する。
最後に, マルチモーダル・ジェイルブレイク評価スイートを開発し, 完全軽量構成, 複数判定オプション, 多次元計測値を用いて, 再現性, 拡張性, コスト効率の高いマルチモーダル・ジェイルブレイク監査を実現する。
関連論文リスト
- Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs [56.53007443197966]
大規模推論モデル(LRM)は推論および生成タスクにおいて顕著な機能を示した。
彼らの明確なチェーン・オブ・シント(CoT)メカニズムは、新しいセキュリティリスクをもたらし、特にジェイルブレイク攻撃に対して脆弱である。
AE-CoTと呼ばれる適応的な進化的CoTジェイルブレイクフレームワークを提案し、これらの制限を克服する。
論文 参考訳(メタデータ) (2026-05-23T10:11:32Z) - MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety [34.69024935656433]
MultiBreakは、大規模言語モデル(LLM)の安全性を評価するために、スケーラブルで多様なマルチターンジェイルブレイクベンチマークである。
我々のベンチマークは、DeepSeek-R1-7BとGPT-4.1-miniの2番目に高いデータセットよりも54.0と34.6高い攻撃成功率(ASR)を達成した。
論文 参考訳(メタデータ) (2026-05-03T02:55:30Z) - Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models [2.6140509675507384]
我々はセキュリティと解釈可能性の両方の観点からジェイルブレイクを研究する。
隠れアクティベーションにおける構造をキャプチャするテンソルベース潜在表現フレームワークを提案する。
以上の結果から,脱獄行動が内部構造に根ざしていることが示唆された。
論文 参考訳(メタデータ) (2026-02-12T02:43:17Z) - OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation [94.61617176929384]
OmniSafeBench-MMはマルチモーダル・ジェイルブレイク攻撃防御評価のための総合ツールボックスである。
13の代表的な攻撃方法と15の防衛戦略、9つの主要なリスクドメインと50のきめ細かいカテゴリにまたがる多様なデータセットを統合している。
データ、方法論、評価をオープンソースで再現可能なプラットフォームに統合することで、OmniSafeBench-MMは将来の研究のための標準化された基盤を提供する。
論文 参考訳(メタデータ) (2025-12-06T22:56:29Z) - Multimodal Safety Is Asymmetric: Cross-Modal Exploits Unlock Black-Box MLLMs Jailbreaks [33.836587055255954]
MLLM(Multimodal large language model)は、様々な現実世界のアプリケーションにまたがって大きな有用性を示している。
しかしMLLMは、敵の入力が安全上の制約を崩壊させ、非倫理的な反応を引き起こす可能性があるジェイルブレイクに弱いままです。
強化学習に基づくブラックボックスジェイルブレイク手法であるPolyJailbreakを開発した。
論文 参考訳(メタデータ) (2025-10-20T08:03:39Z) - Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models [11.867355323884217]
本稿では,悪質なプロンプトを視覚的およびテキスト的フラグメントに分解する新しいブラックボックス・ジェイルブレイク攻撃フレームワークを提案する。
我々のアプローチは、調整可能な推論の複雑さをサポートし、以前の攻撃よりもはるかに少ないクエリを必要とし、ステルスと効率の両方を可能にします。
論文 参考訳(メタデータ) (2025-06-20T05:30:25Z) - Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models [83.80177564873094]
マルチモーダル・ユニバーサル・ジェイルブレイク・アタック・フレームワークを提案する。
LLaVA,Yi-VL,MiniGPT4,MiniGPT-v2,InstructBLIPなどのMLLMの望ましくないコンテキスト生成を評価する。
本研究は,MLLMにおける堅牢な安全対策の必要性を浮き彫りにするものである。
論文 参考訳(メタデータ) (2025-06-02T04:33:56Z) - MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks [85.3303135160762]
MIRAGEは、物語駆動型コンテキストとロール没入を利用して、マルチモーダル大規模言語モデルにおける安全性メカニズムを回避する新しいフレームワークである。
最先端のパフォーマンスを達成し、最高のベースラインよりも攻撃成功率を最大17.5%向上させる。
役割の浸漬と構造的セマンティック再構築は、モデル固有のバイアスを活性化し、モデルが倫理的保護に自発的に違反することを実証する。
論文 参考訳(メタデータ) (2025-03-24T20:38:42Z) - Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey [50.031628043029244]
マルチモーダル生成モデルは、ビルトインの安全機構をバイパスし、潜在的に有害なコンテンツの生成を誘導できる、ジェイルブレイク攻撃の影響を受けやすい。
本稿では,マルチモーダル生成モデルに特有の攻撃方法,防御機構,評価フレームワークの詳細な分類について述べる。
論文 参考訳(メタデータ) (2024-11-14T07:51:51Z) - BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models [47.576957746503666]
BlackDANは、多目的最適化を備えた革新的なブラックボックス攻撃フレームワークである。
ジェイルブレイクを効果的に促進する高品質なプロンプトを生成する。
コンテキスト関連性を維持し、検出可能性を最小限にする。
論文 参考訳(メタデータ) (2024-10-13T11:15:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。