論文の概要: Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs
- arxiv url: http://arxiv.org/abs/2605.05709v1
- Date: Thu, 07 May 2026 05:54:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.545436
- Title: Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs
- Title(参考訳): コンシール, 再建, 脱獄: MLLMにおける再建・再建トレードオフの爆発
- Authors: Md Farhamdur Reza, Richeng Jin, Tianfu Wu, Huaiyu Dai,
- Abstract要約: 多モーダル大言語モデル(MLLM)に対する侵入難易度に基づくジェイルブレイク攻撃
我々はこのような攻撃がエンプレコンストラクションによって支配されていることを示す--concealment tradeoff
本稿では,有害キーワードのアライメントが低く,相互に多様である文字除去型を欲しがって選択する,エンフェンセレーメント対応の変種構成を提案する。
- 参考スコア(独自算出の注目度): 38.904948168003536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Intent-obfuscation-based jailbreak attacks on multimodal large language models (MLLMs) transform a harmful query into a concealed multimodal input to bypass safety mechanisms. We show that such attacks are governed by a \emph{reconstruction--concealment tradeoff}: the transformed input must hide harmful intent from safety filters while remaining recoverable enough for the victim model to reconstruct the original request. Through a reconstruction analysis of three representative black-box methods, we find that existing transformations struggle to balance this tradeoff, limiting their effectiveness. In contrast, we show that character-removed variants achieve a better balance. Building on this, we propose \emph{concealment-aware variant construction}, which greedily selects character-removed variants that are low in harmful-keyword alignment and mutually diverse, and instantiates them through five modality-aware prompting strategies. We further introduce \emph{keyword-related distractor images} that depict the harmful keyword in diverse contexts, providing more effective auxiliary visual context than generic distractor images. Experiments across closed-source and open-source MLLMs show the proposed strategies outperform strong baselines, revealing an underexplored vulnerability: a model's own reconstruction ability can be exploited to recover hidden harmful intent and produce unsafe responses.
- Abstract(参考訳): マルチモーダル大規模言語モデル(MLLM)に対するインテント・オブファシエーションに基づくジェイルブレイク攻撃は、有害なクエリを隠れたマルチモーダル入力に変換し、安全機構をバイパスする。
変換された入力は、被害者モデルが元の要求を再構築するのに十分な回復性を維持しながら、安全フィルタから有害な意図を隠さなければならない。
3つの代表的なブラックボックス手法の再構成解析により、既存の変換はこのトレードオフのバランスを保ち、その効果を制限していることがわかった。
対照的に、文字除去された変種はバランスが良くなることを示す。
そこで我々は, 有害キーワードアライメントが低く, 相互に多様である文字除去変異を欲求的に選択し, 5つのモダリティ認識促進戦略によってそれらをインスタンス化する「emph{concealment-aware variant construction"」を提案する。
さらに, 有害なキーワードを多種多様な文脈で表現する「emph{keyword-related distractor image」を導入し, 汎用的なイントラクタ画像よりも効果的な視覚的コンテキストを提供する。
クローズドソースおよびオープンソースMLLMでの実験では、提案された戦略が強力なベースラインを上回り、未調査の脆弱性を明らかにしている。
関連論文リスト
- MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs [22.919956583415324]
マルチイメージ分散と意味再構成(MIDAS)
本稿では,有害なセマンティクスをリスク対応サブユニットに分解するマルチモーダルジェイルブレイクフレームワークを提案する。
MIDASはより長く、より構造化されたマルチイメージ連鎖推論を強制する。
論文 参考訳(メタデータ) (2026-02-28T09:29:36Z) - Jailbreaks on Vision Language Model via Multimodal Reasoning [10.066621451320792]
本稿では,安全フィルタをバイパスできるステルスシープロンプトの構築を促す,ポストトレーニングのChain-of-Thoughtを利用したフレームワークを提案する。
また,モデルフィードバックに基づいて反復的に入力画像を摂動するReAct型適応雑音発生機構を提案する。
論文 参考訳(メタデータ) (2026-01-29T23:09:24Z) - SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models [67.84174763413178]
我々はSafeRedirを紹介した。SafeRedirは、迅速な埋め込みリダイレクトによる堅牢なアンラーニングのための軽量な推論時フレームワークである。
SafeRedirは,効果的な非学習能力,意味的・知覚的保存能力,堅牢な画像品質,対人攻撃に対する耐性の向上を実現している。
論文 参考訳(メタデータ) (2026-01-13T15:01:38Z) - VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack [40.68344330540352]
MLLM(Multimodal Large Language Models)は、その強力なクロスモーダル理解と生成能力により、様々な分野で広く使われている。
以前のジェイルブレイク攻撃は、テキストモダルで安全性のリスクを推論しようとする試みだったが、視覚モダルでは同様の脅威がほとんど見過ごされている。
本稿では、MLLMを徐々に外部化し、完全に有害な意図を集約する視覚推論シークエンシャルアタック(VRSA)を提案する。
論文 参考訳(メタデータ) (2025-12-05T16:29:52Z) - Multimodal Safety Is Asymmetric: Cross-Modal Exploits Unlock Black-Box MLLMs Jailbreaks [33.836587055255954]
MLLM(Multimodal large language model)は、様々な現実世界のアプリケーションにまたがって大きな有用性を示している。
しかしMLLMは、敵の入力が安全上の制約を崩壊させ、非倫理的な反応を引き起こす可能性があるジェイルブレイクに弱いままです。
強化学習に基づくブラックボックスジェイルブレイク手法であるPolyJailbreakを開発した。
論文 参考訳(メタデータ) (2025-10-20T08:03:39Z) - MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks [85.3303135160762]
MIRAGEは、物語駆動型コンテキストとロール没入を利用して、マルチモーダル大規模言語モデルにおける安全性メカニズムを回避する新しいフレームワークである。
最先端のパフォーマンスを達成し、最高のベースラインよりも攻撃成功率を最大17.5%向上させる。
役割の浸漬と構造的セマンティック再構築は、モデル固有のバイアスを活性化し、モデルが倫理的保護に自発的に違反することを実証する。
論文 参考訳(メタデータ) (2025-03-24T20:38:42Z) - White-box Multimodal Jailbreaks Against Large Vision-Language Models [61.97578116584653]
本稿では,テキストと画像のモダリティを併用して,大規模視覚言語モデルにおけるより広範な脆弱性のスペクトルを利用する,より包括的戦略を提案する。
本手法は,テキスト入力がない場合に,逆画像プレフィックスをランダムノイズから最適化し,有害な応答を多様に生成することから始める。
様々な有害な指示に対する肯定的な反応を誘発する確率を最大化するために、対向テキスト接頭辞を、対向画像接頭辞と統合し、共最適化する。
論文 参考訳(メタデータ) (2024-05-28T07:13:30Z) - AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting [54.931241667414184]
textbfAdaptive textbfShield Promptingを提案する。これは、MLLMを構造ベースのジェイルブレイク攻撃から守るための防御プロンプトで入力をプリペイドする。
我々の手法は、構造に基づくジェイルブレイク攻撃に対するMLLMの堅牢性を一貫して改善することができる。
論文 参考訳(メタデータ) (2024-03-14T15:57:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。