論文の概要: StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs
- arxiv url: http://arxiv.org/abs/2605.25534v1
- Date: Mon, 25 May 2026 07:41:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:19.446429
- Title: StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs
- Title(参考訳): StructBreak:MLLMの構造的認知的過負荷による安全障害
- Authors: Yang Luo, Xinran Liu, Tiantian Ji, Zhiyi Yin, Lingyun Peng, Shuyu Li,
- Abstract要約: MLLM(Multimodal Large Language Models)は構造的推論において優れているが、構造的整合性の急激な論理的脆さに悩まされている。
我々はこの現象を、深い推論と安全性の整合性の競合の副産物である構造的認知的過負荷(SCO)と呼ぶ。
SCOの定量化を目的としたエンドツーエンドの自動フレームワークであるStructBreakを提案する。
- 参考スコア(独自算出の注目度): 20.638038966630337
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) excel at structural reasoning yet suffer from a sharp logical brittleness in structural consistency. We term this phenomenon Structural Cognitive Overload (SCO), a byproduct of the contention between deep reasoning and safety alignment. However, prior work has predominantly targeted typographic and pixel-level perturbations, leaving the study of SCO largely unexplored. To this end, we propose StructBreak, an automated end-to-end framework designed to quantify SCO. By leveraging StructBreak, we uncover a novel higher-order cognitive overload attack paradigm; notably, this attack operates under a practical black-box setting, requiring no internal model access. Consequently, we utilize this framework to establish a comprehensive benchmark spanning ten diverse threat scenarios. Empirical evaluations on six leading MLLMs reveal that SCO readily triggers toxic generation, yielding a 92% average ASR (up to 97% on Gemini 2.5). To elucidate the mechanism of SCO, we further conduct model-level interpretations spanning attention dynamics, latent space topology, and geometric analysis. Our findings reveal that StructBreak acts as a novel structural channel to circumvent safety filters. Furthermore, the limited efficacy of inherent safety mechanisms underscores that current alignment paradigms are insufficient for the era of complex multimodal reasoning.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は構造的推論において優れているが、構造的整合性の急激な論理的脆さに悩まされている。
我々はこの現象を、深い推論と安全性の整合性の競合の副産物である構造的認知的過負荷(SCO)と呼ぶ。
しかし、以前の研究はタイポグラフィーとピクセルレベルの摂動を主なターゲットとしており、SCOの研究はほとんど調査されていない。
この目的のために,SCOの定量化を目的としたエンドツーエンドの自動フレームワークであるStructBreakを提案する。
StructBreakを利用することで、新しい高次認知負荷攻撃パラダイムを発見し、特に、この攻撃は実用的なブラックボックス設定の下で動作し、内部モデルアクセスを必要としない。
その結果,このフレームワークを用いて,10の多様な脅威シナリオにまたがる包括的なベンチマークを構築した。
6つのMLLMに関する実証的な評価によると、SCOはすぐに毒性を発生させ、平均的なASRは92%(ジェミニ2.5で最大97%)に達する。
SCOのメカニズムを解明するために、注意力学、潜時空間トポロジー、幾何学的解析にまたがるモデルレベルの解釈を行う。
以上の結果から,StructBreakは安全フィルタを回避するための新しい構造チャネルとして機能することが明らかとなった。
さらに、固有の安全機構の限られた有効性は、現在のアライメントパラダイムが複雑なマルチモーダル推論の時代には不十分であることを示す。
関連論文リスト
- When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers [0.0]
概念ボトルネックモデル(Concept Bottleneck Models、CBM)は、解釈可能な機械学習の基盤となるアプローチとして登場した。
CBMにおける概念レベルの敵対的脆弱性を包括的かつ体系的に研究する。
我々は、安定原理の正規化防衛であるSPECTRAを紹介する。
論文 参考訳(メタデータ) (2026-05-25T00:03:47Z) - Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs [56.53007443197966]
大規模推論モデル(LRM)は推論および生成タスクにおいて顕著な機能を示した。
彼らの明確なチェーン・オブ・シント(CoT)メカニズムは、新しいセキュリティリスクをもたらし、特にジェイルブレイク攻撃に対して脆弱である。
AE-CoTと呼ばれる適応的な進化的CoTジェイルブレイクフレームワークを提案し、これらの制限を克服する。
論文 参考訳(メタデータ) (2026-05-23T10:11:32Z) - METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models [61.33372454250959]
コンテキスト因果推論は、大規模言語モデルにとって重要なが難しい能力である。
既存のベンチマークでは、コンテキスト整合性を保証するか、完全な因果階層をカバーすることができない。
私たちはMETERの先駆者であり、因果はしごの3つのレベルすべてにわたってLSMを体系的にベンチマークしました。
論文 参考訳(メタデータ) (2026-04-13T14:07:11Z) - From Intent to Evidence: A Categorical Approach for Structural Evaluation of Deep Research Agents [25.080554451314683]
深層研究エージェント(DRA)は、複雑な情報合成のための有望なパラダイムとして登場した。
我々は、DRAの挙動を圏論のレンズを通して形式化し、構造保存マップの合成として深層研究ワークフローをモデル化する。
エージェントを4つの解釈可能な軸に沿ってストレステストするために設計された296の質問を持つメカニズム認識ベンチマークを導入する。
論文 参考訳(メタデータ) (2026-03-26T11:37:26Z) - Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools? [1.8549313085249322]
本研究は,多カテゴリー間相互作用脅威分類におけるLarge Language Models (LLMs) の総合評価を初めて行った。
Llama 3.1 8B, Llama 70B, GPT-4o, Gemini-2.5-Pro, DeepSeek-R1を0, 1, 2ショット設定でベンチマークする。
以上の結果から, LLMは有望な意味理解を示すが, 相互構造的推論を必要とする脅威に対して, 精度は著しく低下することがわかった。
論文 参考訳(メタデータ) (2026-01-02T04:17:36Z) - SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security [9.26421208894097]
大きな言語モデル(LLM)は優れた能力を示すが、ジェイルブレイクのような敵の操作には弱いままである。
LLMにおけるすべてのレベルの因果関係調査を支援する統一因果関係解析フレームワークを導入する。
我々は、複数のオープンウェイトモデルと、ジェイルブレイクを含む安全クリティカルなベンチマークに関するフレームワークを実証的に評価する。
論文 参考訳(メタデータ) (2025-12-04T14:25:15Z) - Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs [38.3239023969819]
大きな言語モデル(LLM)は多様なアプリケーションのための強力なツールとして登場した。
ツール・コンプリート・アタック(TCA)と呼ばれる新しい種類の脆弱性を特定し,提案する。
これらの脆弱性に対処するために、コンテキスト認識階層学習(CAHL)を導入します。
論文 参考訳(メタデータ) (2025-12-03T12:10:21Z) - Cannot See the Forest for the Trees: Invoking Heuristics and Biases to Elicit Irrational Choices of LLMs [83.11815479874447]
本研究では,人間の認知における認知的分解と偏見に触発された新しいジェイルブレイク攻撃フレームワークを提案する。
我々は、悪意のあるプロンプトの複雑さと関連バイアスを減らし、認知的分解を用いて、プロンプトを再編成する。
また、従来の二分的成功または失敗のパラダイムを超越したランキングベースの有害度評価指標も導入する。
論文 参考訳(メタデータ) (2025-05-03T05:28:11Z) - MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks [85.3303135160762]
MIRAGEは、物語駆動型コンテキストとロール没入を利用して、マルチモーダル大規模言語モデルにおける安全性メカニズムを回避する新しいフレームワークである。
最先端のパフォーマンスを達成し、最高のベースラインよりも攻撃成功率を最大17.5%向上させる。
役割の浸漬と構造的セマンティック再構築は、モデル固有のバイアスを活性化し、モデルが倫理的保護に自発的に違反することを実証する。
論文 参考訳(メタデータ) (2025-03-24T20:38:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。